Como editar código diretamente com IA local: ferramentas, modelos, hardware e guia prático
📅 2026-08-27
📍 Agentes locais de programação com IA
⏱️ Cerca de 30 minutos de leitura
Funcionamento dos agentes | Ferramentas | Modelos | Hardware | Instalação e testes | Segurança
🚀 A IA local já consegue editar projetos, mas o modelo é apenas uma peça
Em 2026, a programação local com IA já vai muito além de responder a perguntas sobre código. Um agente bem configurado pode ler todo o projeto, procurar ficheiros, editar código, criar ficheiros, executar comandos e testes e continuar a corrigir os erros encontrados. O código pode permanecer no seu computador e não há custos de API por token.
- 🎯 Principais diferenças: a conclusão do código apenas prevê o próximo trecho de código, e o assistente de chat apenas diz às pessoas como o alterar; o agente irá realmente chamar o ficheiro e as ferramentas do terminal e gravar as alterações no disco rígido.
- 🧠 O modelo não é agente: O modelo é responsável por compreender a tarefa e decidir o passo seguinte, e o Agente é responsável por realizar operações de leitura, escrita de ficheiros, pesquisa e comando. Basta instalar o Ollama e um modelo não ganha automaticamente a capacidade de modificar o projeto.
- 🔁 Ciclo de trabalho completo: Compreender os requisitos → Pesquisar o código → Ler o ficheiro → Modificar vários ficheiros → Executar o teste → Analisar o erro → Modificar novamente → Confirmar o resultado.
- 🔒 valor de localização: Código privado, produtos não divulgados e projetos de clientes não precisam de sair do computador, mas apenas se os modelos, embeddings e ferramentas utilizados estiverem realmente a correr na máquina local, em vez de uma versão remota com Cloud no nome.
- ⚠️ Critérios de julgamento: Ser capaz de conversar, escrever código e suportar modelos locais não significa ser capaz de chamar ferramentas de forma estável. Uma solução verdadeiramente prática deve ter ferramentas de arquivo, ferramentas de terminal, chamada de ferramentas e loops de execução contínuos ao mesmo tempo.
🧭 As quatro camadas de um sistema local de programação com IA
- 🖥️ Camada do editor: O VS Code é responsável pela abertura e exibição de projetos e é a bancada do developer. O Terminal Agent não depende de um editor fixo, pelo que também pode cooperar com o Cursor, JetBrains, Vim ou outras ferramentas.
- 🛠️ Camada de agente: Cline, Roo Code, Continue, Codex, Claude Code ou OpenCode são responsáveis pela leitura de ficheiros, aplicação de patches, execução de comandos e gestão de loops de execução, que é a verdadeira parte prática.
- ⚙️ camada de corredor modelo: O Ollama ou LM Studio é responsável por carregar e executar o modelo e fornecer uma interface para o Agente. O Ollama é mais adequado para linha de comandos, automação e utilização a longo prazo, enquanto o LM Studio é mais adequado para utilizadores principiantes que preferem uma interface gráfica.
- 🧠 camada de modelo: Modelos como o Qwen e o Devstral são responsáveis por analisar código, planear modificações e selecionar ferramentas. Quanto melhor for o modelo em programação agêntica, contexto longo e chamada de ferramenta, mais estáveis serão as tarefas complexas.
- ⚖️ indispensável: Um modelo forte só pode fazer sugestões sem agente; se um agente forte estiver emparelhado com um modelo com capacidades insuficientes, é fácil encontrar o ficheiro errado, executá-lo repetidamente ou produzir modificações não fiáveis.
📊 Comparação dos principais agentes locais de programação
| Conjunto de ferramentas |
| Cline + Ollama |
Pode ler e escrever ficheiros, pesquisar a base de código, aplicar patches e executar comandos; O Plano é responsável pela pesquisa e planeamento, e o Ato é responsável pela execução. Existe também uma versão CLI que pode funcionar sem o VS Code. |
É mais adequado para construir um Agente local pela primeira vez e também para pessoas que desejam rever claramente cada passo da operação na barra lateral do VS Code. |
| Roo Code + Ollama |
Fornece ferramentas de leitura, edição, terminal e MCP, um grande espaço para personalização de modos, permissões e funções de agente, bem como suporte completo para tarefas de vários ficheiros. |
Adequado para utilizadores familiarizados com o VS Code e que pretendam subdividir os modos de trabalho ou criar várias funções de agente dedicadas. |
| Continue + Ollama |
Chat, Plan e Agent têm uma divisão clara de trabalho, e os modelos de chat, edição, Aplicar, Preenchimento automático e Incorporação podem ser configurados respetivamente. |
É adequado para pessoas que precisam de preenchimento de código de agente local e de guia ao mesmo tempo. Os modelos pequenos podem ser utilizados para a conclusão em tempo real e os modelos grandes podem lidar com tarefas complexas. |
| Agente nativo do VS Code + Ollama |
Pode ligar modelos locais a ferramentas de chat e de agentes, mas o efeito real depende se o modelo consegue identificar e chamar corretamente ficheiros e ferramentas de terminal. |
Adequado para utilizadores que pretendam testar a compatibilidade; O Agente BYOK local e as Sugestões Inline nativas pertencem a dois conjuntos diferentes de funções. |
| Codex / Claude Code + Ollama |
Leia, modifique, execute e depure diretamente para o diretório do projeto sem ligar o VS Code. O shell do Agent é aqui utilizado, e o modelo aberto local ainda é fornecido pela Ollama. |
É adequado para programadores que gostam de terminais, querem separar completamente a IA e o editor ou alternar frequentemente entre diferentes IDEs. |
| OpenCode / Copilot CLI + Ollama |
É também capaz de compreender bases de código, modificar ficheiros e executar comandos. O shell do agente do OpenCode é mais aberto e o Copilot CLI também pode separar as fontes do agente e do modelo. |
Adequado para fluxos de trabalho Linux, SSH, servidores e terminais puros, ou para aqueles que desejam utilizar uma cadeia de ferramentas aberta tanto quanto possível. |
| Chat Geral Ollama |
O modelo pode gerar e interpretar código, mas não tem ligações para edição de ficheiros, pesquisa de projetos ou execução de terminais. |
Adequado para perguntas e respostas e rascunhos de código, não pode ser considerado um agente de programação que pode modificar diretamente o projeto. |
🧩 No VS Code: Cline, Roo Code, Continue e o agente nativo
🛠️ Cline: A escolha de entrada mais direta
- O Cline pode ler ficheiros do projeto, pesquisar a base de código, aplicar patches, criar ficheiros e executar comandos. Perante uma tarefa como «adicionar a opção Lembrar-me ao início de sessão e executar os testes», pode rever o frontend, a autenticação e a API e ajustar a implementação segundo os resultados.
- O modo Planear é adequado para pesquisar problemas e conceber soluções primeiro, e depois o modo Agir irá realmente implementá-los. Caso o Agente apenas analise, mas não modifique os ficheiros, confirme primeiro se ainda se encontra no modo Plano e se a permissão "Editar ficheiros do projeto" está ativada.
- A aprovação automática permite que o agente trabalhe continuamente, mas os riscos de modificação de ficheiros e comandos de terminal serão alargados ao mesmo tempo. A aprovação manual deve ser mantida quando o utiliza pela primeira vez, e as operações seguras devem ser abertas gradualmente depois de o comportamento do modelo estar estável.
- O Cline CLI pode ser executado a partir do diretório do projeto, por exemplo, utilizando
cline "Verifique o projeto e corrija os testes com falhas". Está mais próximo da experiência terminal do Codex ou do Claude Code, mantendo o mesmo conjunto de capacidades do Agente.
🧰 Código Roo: permissões e funções mais flexíveis
- O Roo Code divide os recursos em leitura, edição, comando e MCP, que podem completar a leitura, escrita, execução de Shell e invocação de ferramenta externa no modelo local.
- Está muito próximo das capacidades base do Cline. Se preferir usá-lo pronto a usar, pode escolher primeiro Cline; quando precisa de modo, permissões e definições de funções mais detalhadas, o Roo Code é geralmente mais conveniente.
- Em ambos os casos, convém começar com testes pequenos. Depois de confirmar que o modelo chama as ferramentas de forma estável, avance para um repositório real e alterações em vários ficheiros.
🧠 Continue: uma alternativa local completa ao Copilot
- O modo Chat é utilizado para conversas, o modo Plano lê e analisa projetos e o modo Agente possui ferramentas completas para criar ficheiros, modificar ficheiros e executar comandos de terminal.
- Pode atribuir tarefas diferentes a modelos diferentes: o modelo leve é responsável pelo preenchimento automático, o modelo grande é responsável pelo agente e o modelo de incorporação é configurado separadamente para a recuperação de código.
- Embora alguns modelos do Ollama sejam anotados para suportar a invocação de ferramentas, o Agente pode ainda não conseguir utilizar a ferramenta. Neste momento, precisa de verificar a declaração de capacidade do modelo, a configuração do fornecedor e se está corretamente ativada.
tool_use。
🧩 Agente nativo do VS Code: acesso bem-sucedido não significa execução estável
- Os modelos locais podem participar nos fluxos de trabalho de chat e agente do VS Code, mas a invocação de ferramentas, o raciocínio e os recursos visuais dependem do modelo específico. Ser capaz de conversar normalmente não prova que irá chamar Editar Ficheiro.
- Se for necessária modificação
login.tsPor fim, o modelo apenas gera um trecho de código de substituição sem provocar alterações no ficheiro, e a configuração atual ainda é apenas um assistente de chat.
- Quando o modelo BYOK local é utilizado para modificação no estilo do agente, não substituirá automaticamente o preenchimento do separador nativo do VS Code. Se quiser manter a conclusão localmente, necessitará de uma extensão como Continue, que se possa ligar ao modelo de preenchimento automático local.
⌨️ No terminal: trabalhar no projeto sem abrir o VS Code
🧪 Codex + Ollama
- Use primeiro
npm install -g @openai/codexInstale o Codex CLI e executeollama launch codex, também pode passarcodex --ossSelecione um modelo local.
- Depois de entrar no diretório do projeto, o Codex irá operar diretamente o armazém no disco rígido, para que o editor possa escolher livremente. Codex App também pode passar
ollama launch codex-appLigue-se ao Ollama, adequado para pessoas que não gostam de interface de terminal puro.
- Este tipo de Agente continuará a transportar instruções de ferramentas, códigos de projeto, saída de comandos e operações históricas. O uso real deve começar em contextos de cerca de 64K.
🧭 Claude Code + Ollama
- correr
ollama launch claudePode ligar o shell do Claude Code Agent ao Ollama ou usarclaude --model qwen3.5Especifique o modelo aberto local.
- O programa do agente e a fonte do modelo são duas coisas diferentes. Utilizar as capacidades de operação de projeto do Claude Code não significa necessariamente que está a chamar o modelo de cloud Claude da Anthropic.
- Para acomodar o conteúdo do ficheiro, definições de ferramentas e múltiplas rondas de depuração, também é adequado configurar contextos de pelo menos cerca de 64K.
🌐 OpenCode, Copilot CLI e Cline CLI
ollama launch opencodeAdequado para fluxos de trabalho de terminal aberto;ollama launch copilotDeixe o Copilot CLI utilizar o modelo fornecido pela Ollama.
- O Terminal Agent é especialmente adequado para ambientes Linux, SSH e servidores. Desde que introduza o diretório correto do projeto, este poderá ler o repositório, modificar ficheiros e executar testes independentemente do editor.
- Não olhe apenas para o nome quando escolher uma ferramenta, verifique se esta também tem Ler Ficheiro, Editar Ficheiro ou Aplicar Patch, Terminal, Chamada de Ferramenta e Loop de Agente.
🧠 Como escolher um modelo: parâmetros, contexto e quantização
| modelo local |
| Qwen3.5 9B |
A versão Ollama tem cerca de 6,6 GB, suporta cerca de 256 mil chamadas de contexto e ferramentas e tem uma baixa pressão de hardware. |
Adequado para experimentar Agent, modificação de ficheiro único, pequenos scripts, HTML/CSS e bugs mais simples; a estabilidade das tarefas longas é limitada. |
| Qwen3.5 27B / 35B |
A versão 27B tem cerca de 17 GB e a versão 35B tem cerca de 24 GB. Ambos suportam cerca de 256K de chamadas de contexto e ferramentas. |
É adequado para computadores de gama média a alta com VRAM e memória suficientes e tem um raciocínio abrangente mais forte e capacidades de compreensão de projetos complexos. |
| Devstral Small 24B |
A versão Q4 ocupa cerca de 14–15 GB e admite um contexto de aproximadamente 128K. O modelo foi orientado para explorar bases de código, utilizar ferramentas e resolver tarefas de engenharia de software com vários ficheiros. |
Adequado para computadores com VRAM de 24 GB ou Macs com memória unificada de 32 GB, é uma escolha prática para projetos de média dimensão, depuração local e modificação de vários ficheiros. |
| Qwen3-Coder 30B |
A versão Q4 ocupa cerca de 19 GB, tem aproximadamente 30,5B parâmetros, contexto nativo de 256K e suporte para ferramentas; foi otimizada para repositórios e programação agêntica. |
É adequado para a máquina principal de desenvolvimento local com 64 GB de memória e 24 GB ou mais de VRAM e pode lidar seriamente com depuração, reconstrução, loop de teste e tarefas de vários ficheiros. |
📏 Parâmetros e capacidades reais do agente
- 3B ~ 4B estão mais próximos da conclusão avançada de código e não são adequados para tarefas complexas de agentes; 7B ~ 9B podem modificar ficheiros únicos, escrever pequenas funções e lidar com bugs simples, mas a estabilidade de loops longos é média.
- Por volta do 14B, começa a ter um claro valor de produtividade; 24B a 30B é um nível importante para o Agente de Codificação local, que pode lidar seriamente com a compreensão da base de código, modificação de vários ficheiros, depuração, refactoring e ciclos de teste.
- Só porque o modelo pode escrever código, não significa que possa ser um agente. As tarefas reais também exigem que escolha a ferramenta certa, preencha parâmetros, analise o resultado da ferramenta, mantenha metas a longo prazo e julgue quando parar, portanto, a capacidade de codificação agentica é mais importante do que uma única pontuação de benchmark de código.
📚 A janela de contexto não pode olhar apenas para o valor nominal máximo
- O contexto do Agente inclui também prompts do sistema, definições de ferramentas, requisitos do utilizador, ficheiros de projeto, saída do terminal, Git Diff e registos de operações anteriores. 8K pode ser suficiente para o chat comum, mas é mais fiável usar 32K como ponto de partida realista para o Coding Agent.
- Cline e Roo Code podem começar em 32K; os agentes terminais de loop longo, como o Codex, Claude Code e OpenCode, são mais adequados para 64K e superiores. Para armazéns de grandes dimensões ou refatorações em grande escala, considere adicionar mais.
- Só porque o modelo suporta 256K, não significa que deva ser directamente
num_ctxDefina como 262144. Quanto maior for o contexto, mais KV Cache está ocupado, o que pode causar overflow de memória, falta de memória, redução de velocidade e maior espera pelo primeiro token.
🗜️ Como escolher entre Q4, Q5, Q6 e Q8
- O Q4 tem um maior grau de compressão, ficheiros mais pequenos, menores requisitos de VRAM e operação mais rápida, mas perderá uma pequena quantidade de precisão; O Q8 está mais próximo das capacidades do modelo original, e a utilização de memória e VRAM também aumenta significativamente.
- O agente de programação local comum pode começar em Q4_K_M. Ser capaz de carregar de forma estável o modelo completo e o contexto razoável no hardware é geralmente mais importante do que procurar quantização de alta precisão, mas com excessos frequentes.
🖥️ Hardware: priorizar a VRAM sem esquecer a RAM e o contexto
| Nível de hardware |
| Memória de 16 GB, sem gráficos discretos ou VRAM de 6 GB |
Modelo quantitativo 2B~7B |
Adequado para primeiros utilizadores, explicações de código e pequenos scripts. Cada etapa do Agente pode ser lenta e inadequada para loops longos. |
| Memória de 16 ~ 32 GB, VRAM de 8 GB |
Modelo 7B ~ 9B |
Pode realizar modificação de ficheiro único, HTML/CSS e tarefas simples de Python e JavaScript. |
| 32 GB de memória, 12 ~ 16 GB de VRAM |
Modelo 9B ~ 14B |
Comece a ter uma produtividade estável e consiga lidar com plugins React, API, WordPress e projetos web de pequena e média dimensão. |
| Memória de 64 GB, VRAM de 24 GB |
Modelo 24B~30B Q4 |
Um ponto de equilíbrio muito prático para agentes locais, adequado ao Devstral Small 24B, Qwen3-Coder 30B e a contextos próximos de 64K. |
| 96 GB ou mais de memória, 32 GB de VRAM |
Modelo 27B~35B |
Capaz de melhorar a precisão, o contexto e a margem da quantização para ambientes de desenvolvimento paralelo, adequados para estações de trabalho locais de última geração. |
| 128 GB ou mais de memória, 48 GB ou mais de VRAM |
Quantificação 30B~70B ou modelo maior |
Adequado para estações de trabalho profissionais de IA; mais de 80 GB de VRAM podem melhorar ainda mais as capacidades de modelos grandes e de contexto longo. |
🎮 Porque é que a VRAM está em primeiro lugar
- A velocidade é geralmente melhor quando todos os parâmetros do modelo entram na GPU; quando a VRAM for insuficiente, alguns parâmetros serão transferidos para a memória do sistema. Embora ainda possa ser executado, a troca de dados entre o CPU e o GPU irá abrandar significativamente o ciclo do Agente.
- A operação pura da CPU não é totalmente inviável, mas o Agente irá solicitar o modelo várias vezes seguidas para uma tarefa. Esperar dezenas de segundos por cada passo pode tornar os processos de depuração, teste e correção complicados.
- O ficheiro Qwen3-Coder 30B Q4 tem cerca de 19 GB, o que não significa que existam 5 GB fixos restantes de VRAM de 24 GB. Cache KV, tempo de execução e contexto ocuparão características adicionais, e 32 GB ou 48 GB de VRAM serão mais confortáveis.
💾 Prioridade de memória, SSD e CPU
- A memória de 64 GB é mais adequada para o desenvolvimento a longo prazo porque o Windows, VS Code, browsers, Docker, Node.js, bases de dados, Ollama e servidores de desenvolvimento ocuparão recursos ao mesmo tempo que o modelo.
- As capacidades comuns dos ficheiros de modelo variam entre 6 GB, 15 GB, 19 GB e dezenas de GB. Depois de instalar vários modelos, pode facilmente ocupar centenas de GB. O SSD tem pelo menos 1 TB e 2 TB NVMe é mais adequado para utilização a longo prazo.
- É claro que o CPU é importante, mas quando se está com um orçamento limitado, geralmente não vale a pena reduzir 24 GB de VRAM para 16 GB para um pequeno aumento de CPU. Para modelos locais grandes, a memória GPU tem uma prioridade mais elevada.
🍎 Como escolher memória unificada para Apple Silicon
- O Mac utiliza memória unificada partilhada pelo CPU e GPU e não pode aplicar diretamente o algoritmo do PC de "memória do sistema mais VRAM independente". 16 GB é adequado para modelos mais pequenos e 32 GB podem testar seriamente modelos como o Devstral 24B Q4.
- A memória unificada de 64 GB é adequada para agentes de programação locais de 24B a 35B e 128GB pode acomodar modelos maiores e contextos mais longos. Ao executar apenas IA local e não se focar em jogos de grande escala, o Mac com grande memória unificada tem vantagens óbvias.
- Uma referência prática é: cerca de 8GB de VRAM com contexto de 16K, cerca de 16GB de VRAM com 32K e mais de 24GB de VRAM, experimente 64K. A ocupação específica irá ainda variar em função da arquitetura do modelo e do método de quantização.
⚙️ Instalação no Windows: VS Code + Cline + Ollama
1️⃣ Instale o corredor e descarregue o modelo adequado
- Instale primeiro o Ollama e depois selecione o modelo por hardware. Memória de vídeo de 24 GB pode ser testada
ollama pull qwen3-coder:30bouollama pull devstral-small-2:24b;Quando a VRAM é pequena, pode utilizarollama pull qwen3.5:9bComece.
- Se se sentir mais confortável com uma interface gráfica, também pode utilizar o LM Studio para pesquisar, descarregar e carregar modelos. O âmbito de automatização e integração do Ollama é normalmente mais conveniente quando o Coding Agent é a utilização principal.
2️⃣ Instale o Cline e ligue-se ao Ollama
- Instale o Cline no armazenamento de extensões do VS Code, introduza Definições e defina o fornecedor de API como Ollama.
- O endereço padrão desta máquina é normalmente
http://localhost:11434e selecione o modelo descarregado e defina um comprimento de contexto razoável para o Agente.
- Não abra as permissões automáticas de terminal pela primeira vez, permita primeiro a leitura de projetos, a edição de ficheiros do espaço de trabalho e a execução de comandos seguros.
3️⃣ Confirme a ligação do Agente com testes mínimos
- criar
test.txte escreverhello, exigindo que o Agente não responda ao conteúdo modificado, mas altere diretamente o ficheiro parahello world。
- Se o ficheiro foi realmente alterado, significa que a ferramenta de edição foi chamada; se apenas for apresentado "deve ser alterado para Olá mundo", ainda existe um problema com o modo atual, permissões, modelo ou configuração da ferramenta.
- O segundo passo é criá-lo
hello.py, execute o script e confirme a saída. Só quando a criação, execução e leitura dos resultados puderem ser concluídas em sequência é que significa que a ferramenta de arquivo, a ferramenta de terminal e a chamada de ferramenta estão todas ligadas.
4️⃣ De seguida, introduza a tarefa real do software
- Primeiro, selecione projetos de pequena e média dimensão que tenham testes ou possam ser construídos, peça ao Agente para encontrar erros de compilação do TypeScript, corrija-os diretamente e, em seguida, execute
npm run build, se mesmo assim falhar, continue o processamento.
- Indicar claramente o objetivo, o âmbito das modificações permitidas, os comandos de verificação que devem ser executados e as condições de paragem são mais fáceis de alcançar resultados estáveis do que dizer apenas “Ajude-me a corrigir”.
🧪 Tarefas em que os agentes locais de programação são úteis
🐛 Correções de bugs e tratamento automático de erros de compilação
- Perante o problema de o estado de login desaparecer após a atualização da página web, o Agente pode procurar o código de autenticação, verificar a lógica localStorage e Token, modificar ficheiros relacionados e executar testes.
- quando
npm run buildQuando ocorrem vários erros, pode ler o erro, localizar o ficheiro, modificá-lo, reconstruí-lo e repetir o ciclo até que passe. Este tipo de tarefa com feedback claro pode realçar melhor o valor do Agente.
🧱 Adicione funções e modifique vários ficheiros
- Ao adicionar uma função de coleção de artigos a um blog, o Agent pode lidar com base de dados, API, backend, frontend, estilo e testes ao mesmo tempo, em vez de apenas gerar uma função isolada.
- Os requisitos devem indicar claramente a estrutura dos dados, o fluxo do utilizador, os requisitos de compatibilidade e os comandos de aceitação, para que o Agente possa terminar a tarefa com base em resultados reais e não em julgamentos subjetivos.
♻️Refatoração, atualização de dependências e ciclo de teste
- Ao dividir um ficheiro Python de 2000 linhas, o Agente pode analisar dependências, criar módulos, mover funções, ajustar importações e executar testes continuamente, desde que o projeto tenha uma proteção de teste fiável.
- Pode ser modificado ao atualizar dependências como React
package.json, instale dependências, corrija APIs antigas e confirme a compatibilidade através da criação e teste.
🔍 Entenda armazéns desconhecidos e construa projetos de raiz
- Após entrar num projeto desconhecido, pode solicitar ao Agente que descubra o método de arranque, a entrada de login, o local de arranque da base de dados e a ligação de pedido. As pesquisas de repositório e as correlações entre ficheiros geralmente consomem menos tempo do que a leitura ficheiro a ficheiro.
- Ao criar um site de contabilidade pessoal a partir do zero, o Agente pode gerar o diretório, front-end e back-end, base de dados e API e, em seguida, iniciá-lo e corrigir erros, mas ainda requer a tomada de decisão manual da arquitetura e a verificação dos limites de segurança.
🧯 Escreve código, mas não edita ficheiros: causas comuns
❌ O modelo não possui características estáveis de chamada de ferramentas
- O agente requer uma seleção precisa do modelo
edit_file、read_fileou ferramenta de terminal e preencha o caminho e os parâmetros corretos do ficheiro. Se o modelo gerar apenas linguagem natural, apenas dará sugestões de código.
- Os modelos pequenos tendem a tornar-se confusos quando confrontados com um grande número de definições de ferramentas, ficheiros de projetos, conversas históricas e requisitos complexos. Mesmo que o modelo 3B ou 7B suporte nominalmente a ferramenta, esta pode ainda recorrer a respostas de texto comuns durante tarefas longas.
🔧 Modo, permissões ou configuração do fornecedor incorretas
- Os modos Chat e Plano geralmente não realizam modificações reais e devem ser comutados para o modo Agente, Ato ou Código. Não importa quão inteligente seja o modelo, não poderá escrever no ficheiro quando as permissões de edição estiverem desativadas.
- Confirme se o endereço Ollama, o nome do modelo, o contexto e a declaração de capacidade da ferramenta estão corretos. Algumas integrações requerem anotação explícita
tool_use, caso contrário o modelo não receberá as ferramentas disponíveis.
- Não utilize armazéns complexos como primeiro alvo de diagnóstico.
test.txtO teste hello pode separar rapidamente "problemas de capacidade do modelo" e "problemas de compreensão do projeto".
🔁 Agente repetidamente ou desvia-se do alvo em tarefas complexas
- O modelo 9B local pode encontrar o ficheiro errado, repetir a mesma operação, corrigir um bug e introduzir outro bug ou esquecer o objetivo original num loop longo. Ter ferramentas completas não significa que o nível de inteligência atinja o modelo de cloud mais forte.
- Dividir grandes tarefas em pequenas tarefas verificáveis, limitar o número de diretórios e ficheiros que podem ser modificados de uma só vez e exigir a execução de testes em cada fase é geralmente mais estável do que exigir "refatorar todo o projeto" de uma só vez.
- Quando o contexto começa a acumular registos irrelevantes, é mais eficaz reabrir uma tarefa em foco do que expandir cegamente a janela de contexto ao máximo.
🔒 Trabalhar localmente não elimina o risco: permissões, Git e privacidade
- 🌿 Primeiro crie uma ramificação Git: Os projetos formais podem ser executados primeiro
git checkout -b ai-teste deixe o Agente operar após enviar o estado de limpeza atual. Isto permite rever as diferenças item a item e desfazer alterações inadequadas.
- 🛡️ As permissões são abertas de pequena a grande dimensão: Inicialmente é permitido ler e editar o espaço de trabalho e executar comandos de segurança; desligue a edição fora do ambiente de trabalho e a aprovação automática de todos os comandos. Em primeiro lugar, não ative o modo YOLO.
- 💥 Permissões de terminal são mais arriscadas: O agente pode realizar a eliminação, reposição, instalação de dependências ou migração de base de dados. Quaisquer comandos que possam corromper dados, libertar sistemas ou modificar o ambiente de produção devem ser confirmados manualmente.
- 📋 Examine os resultados em vez de olhar apenas para o resumo: visualize o Git Diff, execute testes, compilações e verificações estáticas após a tarefa. A afirmação de conclusão do Agente não significa que o código esteja correto ou não tenha efeitos colaterais.
- 🔐 Confirme a verdade offline: Os modelos locais de Ollama geralmente não cobram taxas de token, mas ainda há custos com computadores, eletricidade e hardware. Se for necessário que o código não seja enviado, também terá de verificar se a telemetria do agente, o MCP remoto, o serviço de incorporação e o modelo são versões na nuvem.
✅ Configurações recomendadas por hardware e forma de trabalhar
| Requisitos de utilização |
| Primeira experiência, memória de 16 ~ 32 GB |
VS Code + Cline + Ollama + Qwen3.5 9B |
A instalação e verificação são simples, adequadas para tarefas de arquivo único e pequenos projetos; não espere muito de loops complexos de agentes. |
| Projetos de média dimensão, memória de 32 a 64 GB |
VS Code + Cline + Ollama + Devstral Small 24B |
Adequada para Web, Python, JavaScript, React, correção de bugs e modificação de vários ficheiros, a VRAM de 24 GB é mais ideal. |
| Principal agente de programação local |
Código Cline ou Roo + Ollama + Qwen3-Coder 30B |
64 GB de memória, mais de 24 GB de VRAM e 2 TB de NVMe constituem um ponto ideal de desenvolvimento local realista. |
| Não depende do código VS |
Codex ou Código Claude + Ollama + Qwen3-Coder/Qwen3.5 |
O Agent opera diretamente o diretório do projeto, que é adequado para utilizadores finais, desenvolvimento multi-IDE ou pessoas que desejam desacoplar ferramentas e editores. |
| Fluxo de trabalho aberto do Linux e SSH |
OpenCode + Ollama + modelo local |
Tanto o shell do agente como o link do modelo são mais abertos e adequados para servidores, desenvolvimento remoto e ambientes de terminal puros. |
| Também requer o preenchimento da guia local |
Continue + Ollama: modelo pequeno para preenchimento automático, modelo grande para Agent |
Separe a conclusão de alta frequência e baixa latência das tarefas complexas do projeto e a experiência estará mais próxima de um copiloto local completo. |
🏁 Conclusão: verificar a cadeia de ferramentas, não o rótulo comercial
A programação local com IA já permite trabalhar em projetos reais, mas a experiência depende da combinação entre agente, modelo, ambiente de execução e hardware. Um modelo leve basta para começar; para uma utilização regular, um modelo de 24B–30B com 64 GB de RAM e pelo menos 24 GB de VRAM aproxima-se muito mais de um assistente local fiável.
- ✅ Se prefere o VS Code: Comece por Cline ou Roo Code com Ollama. Escolha Continue se também precisar de preenchimento automático local.
- ✅ Se prefere o terminal: Utilize Codex, Claude Code ou OpenCode para separar o agente do editor.
- ✅ Ao avaliar uma ferramenta nova: Confirme que inclui Read File, Edit File ou Apply Patch, Terminal, Tool Calling e um Agent Loop.
- ✅ Valide a instalação: Escreva
hello em test.txt e peça ao agente para editar diretamente o ficheiro. Avance para um repositório real apenas depois de o conteúdo mudar.
- ✅ Mantenha a disciplina de engenharia: Utilize Git, limite as permissões, reveja os diffs e execute testes. O agente pode automatizar muito trabalho repetitivo, mas a arquitetura, os limites de segurança e a aprovação final continuam a ser responsabilidade do programador.