Logótipo

IA Local numa Pen USB

Executar um modelo Qwen3 localmente, a partir de uma pen USB, com Llamafile e sem depender de serviços de IA na nuvem.

Llamafile Qwen3 GGUF Hugging Face IA Local
./ia_portatil_usb.txt

1Objectivo

O objectivo desta experiência é colocar numa pen USB tudo o que é necessário para executar um modelo de Inteligência Artificial localmente num computador Windows.

A pen contém o programa Llamafile, o modelo de linguagem em formato GGUF e um pequeno ficheiro de arranque em formato .bat.

2Preparar a pen USB

Neste exemplo utilizei uma pen USB com 16 GB.

Antes de copiar os ficheiros, formatei a unidade com o sistema de ficheiros exFAT.

Atenção: formatar a pen elimina todos os ficheiros existentes. Guarda previamente qualquer informação importante.

3Estrutura final da pen

No final do processo, a raiz da pen deverá conter essencialmente três ficheiros:

llamafile-0.10.5.exe
qwen3-4b-thinking-2507.Q4_K_M.gguf
iniciar.bat
./preparar_llamafile.txt

4Aceder ao projecto Llamafile

No navegador, pesquisa por llamafile github ou acede directamente ao repositório:

github.com/mozilla-ai/llamafile

5Descarregar uma versão

No GitHub, abre a área Releases. Na versão pretendida, procura a secção Assets e descarrega o ficheiro llamafile-x.x.x.

6Adicionar a extensão .exe

Se o ficheiro descarregado não apresentar extensão, renomeia-o e acrescenta .exe ao final do nome.

Na experiência aqui descrita, o ficheiro ficou com o seguinte nome:

llamafile-0.10.5.exe

Depois, copia o ficheiro para a raiz da pen USB.

./obter_modelo_qwen3.txt

7Aceder ao Hugging Face

No navegador, pesquisa por Hugging Face ou acede directamente a:

huggingface.co

No menu superior, selecciona Models.

8Filtrar modelos GGUF

Na área dos modelos, activa o filtro ou biblioteca GGUF. Este formato é adequado para execução local através de ferramentas compatíveis com llama.cpp e Llamafile.

9Pesquisar o modelo

Pesquisa por Qwen3 e abre o repositório:

pramodlohra/Qwen3_4B_thinking_finetune

10Descarregar o ficheiro GGUF

Abre o separador Files and versions e localiza o ficheiro:

qwen3-4b-thinking-2507.Q4_K_M.gguf

Usa o ícone da seta para baixo para efectuar a transferência sem necessidade de abrir previamente a página do ficheiro.

Depois de concluída a transferência, copia o ficheiro .gguf para a raiz da pen USB.

./iniciar_ia.bat

11Criar o ficheiro de arranque

Abre o Bloco de Notas ou outro editor de texto simples e cria um ficheiro com o seguinte conteúdo:

@echo off
.\llamafile-0.10.5.exe --server --model qwen3-4b-thinking-2507.Q4_K_M.gguf
pause

Guarda o ficheiro directamente na pen com o nome:

iniciar.bat

12Compreender o comando

.\llamafile-0.10.5.exe --server --model qwen3-4b-thinking-2507.Q4_K_M.gguf
  • .\llamafile-0.10.5.exe — executa o Llamafile presente na mesma pasta.
  • --server — inicia o servidor local e a respectiva interface.
  • --model — indica qual o modelo GGUF que deverá ser carregado.
Se utilizares outra versão do Llamafile ou outro modelo, tens de substituir os nomes no ficheiro iniciar.bat pelos nomes reais dos teus ficheiros.

13Executar a IA

Faz duplo clique em iniciar.bat e aguarda enquanto o modelo é carregado.

Durante o arranque é aberta uma janela de terminal. Não a feches enquanto estiveres a utilizar o modelo.

Quando o servidor estiver disponível, podes aceder à interface local indicada pelo Llamafile no terminal. Normalmente 127.0.0.1:8080

./notas_e_observacoes.txt
Importante: a velocidade do modelo depende bastante do computador onde a pen é utilizada. A pen apenas transporta os ficheiros; o processamento é efectuado pelo computador.

Vantagens desta solução

  • O modelo fica disponível localmente.
  • Não é necessário enviar as perguntas para um serviço de IA na nuvem.
  • A mesma pen pode transportar o ambiente para diferentes computadores compatíveis.
  • É possível experimentar diferentes modelos GGUF.
  • É uma solução simples para demonstrações e experiências com IA local.

Aspectos a ter em conta

  • Os modelos podem ocupar vários gigabytes.
  • Modelos maiores exigem mais memória RAM e maior capacidade de processamento.
  • Uma pen USB lenta pode aumentar o tempo inicial de carregamento.
  • O ficheiro .bat deste exemplo destina-se a Windows.
  • Os nomes dos ficheiros têm de corresponder exactamente aos utilizados no comando.

Ligações utilizadas

Resumo: com três ficheiros numa pen USB — Llamafile, um modelo GGUF e um ficheiro BAT — é possível criar uma solução simples e portátil para experimentar Inteligência Artificial local num computador Windows.