IA Local numa Pen USB
Executar um modelo Qwen3 localmente, a partir de uma pen USB, com Llamafile e sem depender de serviços de IA na nuvem.
1Objectivo
O objectivo desta experiência é colocar numa pen USB tudo o que é necessário para executar um modelo de Inteligência Artificial localmente num computador Windows.
A pen contém o programa Llamafile, o modelo de linguagem em formato GGUF e um pequeno ficheiro de arranque em formato .bat.
2Preparar a pen USB
Neste exemplo utilizei uma pen USB com 16 GB.
Antes de copiar os ficheiros, formatei a unidade com o sistema de ficheiros exFAT.
3Estrutura final da pen
No final do processo, a raiz da pen deverá conter essencialmente três ficheiros:
llamafile-0.10.5.exe
qwen3-4b-thinking-2507.Q4_K_M.gguf
iniciar.bat
4Aceder ao projecto Llamafile
No navegador, pesquisa por llamafile github ou acede directamente ao repositório:
5Descarregar uma versão
No GitHub, abre a área Releases. Na versão pretendida, procura a secção Assets e descarrega o ficheiro llamafile-x.x.x.
6Adicionar a extensão .exe
Se o ficheiro descarregado não apresentar extensão, renomeia-o e acrescenta .exe ao final do nome.
Na experiência aqui descrita, o ficheiro ficou com o seguinte nome:
llamafile-0.10.5.exe
Depois, copia o ficheiro para a raiz da pen USB.
7Aceder ao Hugging Face
No navegador, pesquisa por Hugging Face ou acede directamente a:
No menu superior, selecciona Models.
8Filtrar modelos GGUF
Na área dos modelos, activa o filtro ou biblioteca GGUF. Este formato é adequado para execução local através de ferramentas compatíveis com llama.cpp e Llamafile.
9Pesquisar o modelo
Pesquisa por Qwen3 e abre o repositório:
pramodlohra/Qwen3_4B_thinking_finetune
10Descarregar o ficheiro GGUF
Abre o separador Files and versions e localiza o ficheiro:
qwen3-4b-thinking-2507.Q4_K_M.gguf
Usa o ícone da seta para baixo para efectuar a transferência sem necessidade de abrir previamente a página do ficheiro.
Depois de concluída a transferência, copia o ficheiro .gguf para a raiz da pen USB.
11Criar o ficheiro de arranque
Abre o Bloco de Notas ou outro editor de texto simples e cria um ficheiro com o seguinte conteúdo:
@echo off
.\llamafile-0.10.5.exe --server --model qwen3-4b-thinking-2507.Q4_K_M.gguf
pause
Guarda o ficheiro directamente na pen com o nome:
iniciar.bat
12Compreender o comando
.\llamafile-0.10.5.exe --server --model qwen3-4b-thinking-2507.Q4_K_M.gguf
.\llamafile-0.10.5.exe— executa o Llamafile presente na mesma pasta.--server— inicia o servidor local e a respectiva interface.--model— indica qual o modelo GGUF que deverá ser carregado.
iniciar.bat pelos nomes reais dos teus ficheiros.
13Executar a IA
Faz duplo clique em iniciar.bat e aguarda enquanto o modelo é carregado.
Durante o arranque é aberta uma janela de terminal. Não a feches enquanto estiveres a utilizar o modelo.
Quando o servidor estiver disponível, podes aceder à interface local indicada pelo Llamafile no terminal.
14Posso utilizar outro modelo?
Sim. O Llamafile não fica preso ao modelo Qwen3 utilizado neste exemplo. Podes substituir o ficheiro .gguf por outro modelo compatível e alterar apenas o nome indicado depois de --model.
O comando utilizado neste guia é:
.\llamafile-0.10.5.exe --server --model qwen3-4b-thinking-2507.Q4_K_M.gguf
Se copiares outro modelo para a pen, basta substituir o nome do ficheiro GGUF no comando.
15Exemplo com outro modelo
Imagina que descarregaste um modelo chamado:
gemma-3-4b-it.Q4_K_M.gguf
O ficheiro de arranque passa a conter:
@echo off
.\llamafile-0.10.5.exe --server --model gemma-3-4b-it.Q4_K_M.gguf
pause
--model.
16Vários modelos na mesma pen
Se houver espaço disponível, podes guardar vários modelos na mesma pen e criar um ficheiro de arranque para cada um.
Pen USB
│
├── llamafile-0.10.5.exe
├── qwen3-4b-thinking-2507.Q4_K_M.gguf
├── gemma-3-4b-it.Q4_K_M.gguf
├── llama-3.2-3b-instruct.Q4_K_M.gguf
├── iniciar_qwen.bat
├── iniciar_gemma.bat
└── iniciar_llama.bat
Desta forma, escolhes o modelo apenas pelo ficheiro de arranque correspondente.
17Windows, macOS e Linux
O ficheiro .bat é específico do Windows. Em macOS ou Linux utiliza-se normalmente um pequeno script .sh.
Windows — iniciar.bat
@echo off
.\llamafile-0.10.5.exe --server --model qwen3-4b-thinking-2507.Q4_K_M.gguf
pause
macOS / Linux — iniciar.sh
#!/bin/bash
./llamafile-0.10.5 --server --model qwen3-4b-thinking-2507.Q4_K_M.gguf
Em macOS/Linux é ainda necessário dar permissão de execução ao script:
chmod +x iniciar.sh
18Modelos que fui testando
Esta secção pode ser actualizada à medida que forem testados novos modelos. Assim, o artigo passa também a funcionar como registo prático de desempenho.
| Modelo | Formato | Estado | Observações |
|---|---|---|---|
| Qwen3 4B Thinking | GGUF Q4_K_M | Testado | Modelo utilizado neste guia. |
| Outros modelos | GGUF | A testar | Adicionar resultados à medida que forem experimentados. |
Vantagens desta solução
- O modelo fica disponível localmente.
- Não é necessário enviar as perguntas para um serviço de IA na nuvem.
- A mesma pen pode transportar o ambiente para diferentes computadores compatíveis.
- É possível experimentar diferentes modelos GGUF sem alterar o Llamafile.
- É uma solução simples para demonstrações e experiências com IA local.
Aspectos a ter em conta
- Os modelos podem ocupar vários gigabytes.
- Modelos maiores exigem mais memória RAM e maior capacidade de processamento.
- Uma pen USB lenta pode aumentar o tempo inicial de carregamento.
- O ficheiro
.batdeste exemplo destina-se a Windows; em macOS/Linux utiliza-se normalmente um script.sh. - Os nomes dos ficheiros têm de corresponder exactamente aos utilizados no comando.