IA Local numa Pen USB
Executar um modelo Qwen3 localmente, a partir de uma pen USB, com Llamafile e sem depender de serviços de IA na nuvem.
1Objectivo
O objectivo desta experiência é colocar numa pen USB tudo o que é necessário para executar um modelo de Inteligência Artificial localmente num computador Windows.
A pen contém o programa Llamafile, o modelo de linguagem em formato GGUF e um pequeno ficheiro de arranque em formato .bat.
2Preparar a pen USB
Neste exemplo utilizei uma pen USB com 16 GB.
Antes de copiar os ficheiros, formatei a unidade com o sistema de ficheiros exFAT.
3Estrutura final da pen
No final do processo, a raiz da pen deverá conter essencialmente três ficheiros:
llamafile-0.10.5.exe
qwen3-4b-thinking-2507.Q4_K_M.gguf
iniciar.bat
4Aceder ao projecto Llamafile
No navegador, pesquisa por llamafile github ou acede directamente ao repositório:
5Descarregar uma versão
No GitHub, abre a área Releases. Na versão pretendida, procura a secção Assets e descarrega o ficheiro llamafile-x.x.x.
6Adicionar a extensão .exe
Se o ficheiro descarregado não apresentar extensão, renomeia-o e acrescenta .exe ao final do nome.
Na experiência aqui descrita, o ficheiro ficou com o seguinte nome:
llamafile-0.10.5.exe
Depois, copia o ficheiro para a raiz da pen USB.
7Aceder ao Hugging Face
No navegador, pesquisa por Hugging Face ou acede directamente a:
No menu superior, selecciona Models.
8Filtrar modelos GGUF
Na área dos modelos, activa o filtro ou biblioteca GGUF. Este formato é adequado para execução local através de ferramentas compatíveis com llama.cpp e Llamafile.
9Pesquisar o modelo
Pesquisa por Qwen3 e abre o repositório:
pramodlohra/Qwen3_4B_thinking_finetune
10Descarregar o ficheiro GGUF
Abre o separador Files and versions e localiza o ficheiro:
qwen3-4b-thinking-2507.Q4_K_M.gguf
Usa o ícone da seta para baixo para efectuar a transferência sem necessidade de abrir previamente a página do ficheiro.
Depois de concluída a transferência, copia o ficheiro .gguf para a raiz da pen USB.
11Criar o ficheiro de arranque
Abre o Bloco de Notas ou outro editor de texto simples e cria um ficheiro com o seguinte conteúdo:
@echo off
.\llamafile-0.10.5.exe --server --model qwen3-4b-thinking-2507.Q4_K_M.gguf
pause
Guarda o ficheiro directamente na pen com o nome:
iniciar.bat
12Compreender o comando
.\llamafile-0.10.5.exe --server --model qwen3-4b-thinking-2507.Q4_K_M.gguf
.\llamafile-0.10.5.exe— executa o Llamafile presente na mesma pasta.--server— inicia o servidor local e a respectiva interface.--model— indica qual o modelo GGUF que deverá ser carregado.
iniciar.bat pelos nomes reais dos teus ficheiros.
13Executar a IA
Faz duplo clique em iniciar.bat e aguarda enquanto o modelo é carregado.
Durante o arranque é aberta uma janela de terminal. Não a feches enquanto estiveres a utilizar o modelo.
Quando o servidor estiver disponível, podes aceder à interface local indicada pelo Llamafile no terminal. Normalmente 127.0.0.1:8080
Vantagens desta solução
- O modelo fica disponível localmente.
- Não é necessário enviar as perguntas para um serviço de IA na nuvem.
- A mesma pen pode transportar o ambiente para diferentes computadores compatíveis.
- É possível experimentar diferentes modelos GGUF.
- É uma solução simples para demonstrações e experiências com IA local.
Aspectos a ter em conta
- Os modelos podem ocupar vários gigabytes.
- Modelos maiores exigem mais memória RAM e maior capacidade de processamento.
- Uma pen USB lenta pode aumentar o tempo inicial de carregamento.
- O ficheiro
.batdeste exemplo destina-se a Windows. - Os nomes dos ficheiros têm de corresponder exactamente aos utilizados no comando.