Logótipo

IA Local numa Pen USB

Executar um modelo Qwen3 localmente, a partir de uma pen USB, com Llamafile e sem depender de serviços de IA na nuvem.

Llamafile Qwen3 GGUF Hugging Face IA Local
./ia_portatil_usb.txt

1Objectivo

O objectivo desta experiência é colocar numa pen USB tudo o que é necessário para executar um modelo de Inteligência Artificial localmente num computador Windows.

A pen contém o programa Llamafile, o modelo de linguagem em formato GGUF e um pequeno ficheiro de arranque em formato .bat.

2Preparar a pen USB

Neste exemplo utilizei uma pen USB com 16 GB.

Antes de copiar os ficheiros, formatei a unidade com o sistema de ficheiros exFAT.

Atenção: formatar a pen elimina todos os ficheiros existentes. Guarda previamente qualquer informação importante.

3Estrutura final da pen

No final do processo, a raiz da pen deverá conter essencialmente três ficheiros:

llamafile-0.10.5.exe
qwen3-4b-thinking-2507.Q4_K_M.gguf
iniciar.bat
./preparar_llamafile.txt

4Aceder ao projecto Llamafile

No navegador, pesquisa por llamafile github ou acede directamente ao repositório:

github.com/mozilla-ai/llamafile

5Descarregar uma versão

No GitHub, abre a área Releases. Na versão pretendida, procura a secção Assets e descarrega o ficheiro llamafile-x.x.x.

6Adicionar a extensão .exe

Se o ficheiro descarregado não apresentar extensão, renomeia-o e acrescenta .exe ao final do nome.

Na experiência aqui descrita, o ficheiro ficou com o seguinte nome:

llamafile-0.10.5.exe

Depois, copia o ficheiro para a raiz da pen USB.

./obter_modelo_qwen3.txt

7Aceder ao Hugging Face

No navegador, pesquisa por Hugging Face ou acede directamente a:

huggingface.co

No menu superior, selecciona Models.

8Filtrar modelos GGUF

Na área dos modelos, activa o filtro ou biblioteca GGUF. Este formato é adequado para execução local através de ferramentas compatíveis com llama.cpp e Llamafile.

9Pesquisar o modelo

Pesquisa por Qwen3 e abre o repositório:

pramodlohra/Qwen3_4B_thinking_finetune

10Descarregar o ficheiro GGUF

Abre o separador Files and versions e localiza o ficheiro:

qwen3-4b-thinking-2507.Q4_K_M.gguf

Usa o ícone da seta para baixo para efectuar a transferência sem necessidade de abrir previamente a página do ficheiro.

Depois de concluída a transferência, copia o ficheiro .gguf para a raiz da pen USB.

./iniciar_ia.bat

11Criar o ficheiro de arranque

Abre o Bloco de Notas ou outro editor de texto simples e cria um ficheiro com o seguinte conteúdo:

@echo off
.\llamafile-0.10.5.exe --server --model qwen3-4b-thinking-2507.Q4_K_M.gguf
pause

Guarda o ficheiro directamente na pen com o nome:

iniciar.bat

12Compreender o comando

.\llamafile-0.10.5.exe --server --model qwen3-4b-thinking-2507.Q4_K_M.gguf
  • .\llamafile-0.10.5.exe — executa o Llamafile presente na mesma pasta.
  • --server — inicia o servidor local e a respectiva interface.
  • --model — indica qual o modelo GGUF que deverá ser carregado.
Se utilizares outra versão do Llamafile ou outro modelo, tens de substituir os nomes no ficheiro iniciar.bat pelos nomes reais dos teus ficheiros.

13Executar a IA

Faz duplo clique em iniciar.bat e aguarda enquanto o modelo é carregado.

Durante o arranque é aberta uma janela de terminal. Não a feches enquanto estiveres a utilizar o modelo.

Quando o servidor estiver disponível, podes aceder à interface local indicada pelo Llamafile no terminal.

./alterar_modelo.txt

14Posso utilizar outro modelo?

Sim. O Llamafile não fica preso ao modelo Qwen3 utilizado neste exemplo. Podes substituir o ficheiro .gguf por outro modelo compatível e alterar apenas o nome indicado depois de --model.

O comando utilizado neste guia é:

.\llamafile-0.10.5.exe --server --model qwen3-4b-thinking-2507.Q4_K_M.gguf

Se copiares outro modelo para a pen, basta substituir o nome do ficheiro GGUF no comando.

15Exemplo com outro modelo

Imagina que descarregaste um modelo chamado:

gemma-3-4b-it.Q4_K_M.gguf

O ficheiro de arranque passa a conter:

@echo off
.\llamafile-0.10.5.exe --server --model gemma-3-4b-it.Q4_K_M.gguf
pause
A regra é simples: manténs o Llamafile e alteras o ficheiro indicado depois de --model.

16Vários modelos na mesma pen

Se houver espaço disponível, podes guardar vários modelos na mesma pen e criar um ficheiro de arranque para cada um.

Pen USB
│
├── llamafile-0.10.5.exe
├── qwen3-4b-thinking-2507.Q4_K_M.gguf
├── gemma-3-4b-it.Q4_K_M.gguf
├── llama-3.2-3b-instruct.Q4_K_M.gguf
├── iniciar_qwen.bat
├── iniciar_gemma.bat
└── iniciar_llama.bat

Desta forma, escolhes o modelo apenas pelo ficheiro de arranque correspondente.

17Windows, macOS e Linux

O ficheiro .bat é específico do Windows. Em macOS ou Linux utiliza-se normalmente um pequeno script .sh.

Windows — iniciar.bat

@echo off
.\llamafile-0.10.5.exe --server --model qwen3-4b-thinking-2507.Q4_K_M.gguf
pause

macOS / Linux — iniciar.sh

#!/bin/bash
./llamafile-0.10.5 --server --model qwen3-4b-thinking-2507.Q4_K_M.gguf

Em macOS/Linux é ainda necessário dar permissão de execução ao script:

chmod +x iniciar.sh
O executável Llamafile utilizado tem de ser compatível com o sistema operativo e a arquitectura do computador onde vai ser executado.

18Modelos que fui testando

Esta secção pode ser actualizada à medida que forem testados novos modelos. Assim, o artigo passa também a funcionar como registo prático de desempenho.

Modelo Formato Estado Observações
Qwen3 4B Thinking GGUF Q4_K_M Testado Modelo utilizado neste guia.
Outros modelos GGUF A testar Adicionar resultados à medida que forem experimentados.
./notas_e_observacoes.txt
Importante: a velocidade do modelo depende bastante do computador onde a pen é utilizada. A pen apenas transporta os ficheiros; o processamento é efectuado pelo computador.

Vantagens desta solução

  • O modelo fica disponível localmente.
  • Não é necessário enviar as perguntas para um serviço de IA na nuvem.
  • A mesma pen pode transportar o ambiente para diferentes computadores compatíveis.
  • É possível experimentar diferentes modelos GGUF sem alterar o Llamafile.
  • É uma solução simples para demonstrações e experiências com IA local.

Aspectos a ter em conta

  • Os modelos podem ocupar vários gigabytes.
  • Modelos maiores exigem mais memória RAM e maior capacidade de processamento.
  • Uma pen USB lenta pode aumentar o tempo inicial de carregamento.
  • O ficheiro .bat deste exemplo destina-se a Windows; em macOS/Linux utiliza-se normalmente um script .sh.
  • Os nomes dos ficheiros têm de corresponder exactamente aos utilizados no comando.

Ligações utilizadas

Resumo: com Llamafile, um ou mais modelos GGUF e pequenos ficheiros de arranque, é possível criar uma solução portátil para experimentar Inteligência Artificial local. O modelo pode ser trocado sem alterar o restante processo.