Cómo editar código directamente con IA local: herramientas, modelos, hardware y guía práctica

Cómo funciona un agente | Herramientas | Modelos | Hardware | Instalación y pruebas | Seguridad

🚀 La IA local ya puede editar proyectos, pero el modelo es solo una pieza

En 2026, la programación local con IA ya va mucho más allá de responder preguntas sobre código. Un agente bien configurado puede leer todo el proyecto, buscar archivos, editar código, crear archivos, ejecutar comandos y pruebas, y seguir corrigiendo errores a partir de la salida obtenida. El código puede permanecer en su propio ordenador y no hay costes de API por token.

  • 🎯 Diferencias fundamentales: La finalización del código solo predice el siguiente fragmento de código y el asistente de chat solo les dice a las personas cómo cambiarlo; el agente realmente llamará al archivo y a las herramientas del terminal y escribirá los cambios en el disco duro.
  • 🧠 El modelo no es agente: El modelo es responsable de comprender la tarea y decidir el siguiente paso, y el Agente es responsable de realizar lectura de archivos, escritura de archivos, búsqueda y operaciones de comando. Con solo instalar Ollama y un modelo no se obtiene automáticamente la capacidad de modificar el proyecto.
  • 🔁 Ciclo de trabajo completo: Comprenda los requisitos → Busque el código → Lea el archivo → Modifique varios archivos → Ejecute la prueba → Analice el error → Modifique nuevamente → Confirme el resultado.
  • 🔒 ventaja de trabajar en local: El código privado, los productos no divulgados y los proyectos de los clientes no necesitan salir de la ordenador, pero solo si los modelos, incorporaciones y herramientas utilizadas realmente se ejecutan en la máquina local, en lugar de en una versión remota con Cloud en el nombre.
  • ⚠️ Criterios de juicio: Poder chatear, escribir código y admitir modelos locales no significa poder llamar a herramientas de manera estable. Una solución verdaderamente práctica debe tener herramientas de archivos, herramientas de terminal, llamadas de herramientas y bucles de ejecución continuos al mismo tiempo.

🧭 Las cuatro capas de un sistema local de programación con IA

  • 🖥️ Capa editora: VS Code es responsable de abrir y mostrar proyectos y es el banco de trabajo del desarrollador. Terminal Agent no depende de un editor fijo, por lo que también puede cooperar con Cursor, JetBrains, Vim u otras herramientas.
  • 🛠️ capa de agente: Cline, Roo Code, Continue, Codex, Claude Code u OpenCode son responsables de leer archivos, aplicar parches, ejecutar comandos y gestionar bucles de ejecución, que es la parte práctica real.
  • ⚙️ capa de corredor modelo: Ollama o LM Studio es responsable de cargar y ejecutar el modelo y proporcionar una interfaz para el Agente. Ollama es más adecuado para línea de comandos, automatización y uso a largo plazo, mientras que LM Studio es más adecuado para usuarios nuevos que prefieren una interfaz gráfica.
  • 🧠 capa de modelo: Modelos como Qwen y Devstral son responsables de analizar el código, planificar modificaciones y seleccionar herramientas. Cuanto mejor sea el modelo en programación agéntica, contexto largo y llamada de herramientas, más estables serán las tareas complejas.
  • ⚖️ indispensable: Un modelo fuerte sólo puede hacer sugerencias sin un agente; Si se combina un agente potente con un modelo con capacidades insuficientes, es fácil encontrar el archivo incorrecto, ejecutarlo repetidamente o producir modificaciones poco confiables.

📊 Comparativa de los principales agentes locales de programación

Conjunto de herramientas Capacidades y características Método aplicable
Cline + Ollama Puede leer y escribir archivos, buscar en el código base, aplicar parches y ejecutar comandos; Plan es responsable de la investigación y planificación, y Act es responsable de la ejecución. También hay una versión CLI que puede funcionar sin VS Code. Es más adecuado para crear un Agente local por primera vez y también para personas que desean revisar claramente cada paso de la operación en la barra lateral de VS Code.
Roo Code + Ollama Proporciona herramientas de lectura, edición, terminal y MCP, un gran espacio para la personalización de modos, permisos y roles de agente, y soporte completo para tareas de múltiples archivos. Adecuado para usuarios que están familiarizados con VS Code y desean subdividir modos de trabajo o crear múltiples roles de Agente dedicados.
Continue + Ollama Chat, Plan y Agente tienen una clara división del trabajo, y los modelos de chat, edición, Aplicar, Autocompletar e Incrustar se pueden configurar respectivamente. Es adecuado para personas que necesitan completar el Agente local y el Código de pestaña al mismo tiempo. Se pueden utilizar modelos pequeños para completar en tiempo real y modelos grandes pueden manejar tareas complejas.
Agente nativo de VS Code + Ollama Puede conectar modelos locales a herramientas de chat y agentes, pero el efecto real depende de si el modelo puede identificar y llamar correctamente archivos y herramientas de terminal. Adecuado para usuarios que deseen probar la compatibilidad; El agente BYOK local y las sugerencias en línea nativas pertenecen a dos conjuntos diferentes de funciones.
Codex / Claude Code + Ollama Lea, modifique, ejecute y depure directamente en el directorio del proyecto sin vincular VS Code. Aquí se utiliza el shell del Agente, y Ollama todavía proporciona el modelo abierto local. Es adecuado para desarrolladores a quienes les gustan las terminales, desean separar completamente la IA y el editor o, a menudo, cambiar entre diferentes IDE.
OpenCode / Copilot CLI + Ollama También es capaz de comprender bases de código, modificar archivos y ejecutar comandos. El shell del Agente de OpenCode es más abierto y Copilot CLI también puede separar las fuentes del Agente y del modelo. Adecuado para flujos de trabajo de Linux, SSH, servidores y terminales puros, o para aquellos que desean utilizar una cadena de herramientas abierta tanto como sea posible.
Chat General Ollama El modelo puede generar e interpretar código, pero no tiene enlaces de edición de archivos, búsqueda de proyectos ni ejecución de terminal. Adecuado para preguntas y respuestas y borradores de código, no puede considerarse un agente de programación que pueda modificar directamente el proyecto.

🧩 En VS Code: Cline, Roo Code, Continue y el agente nativo

🛠️ Cline: La opción de entrada más directa

  • Cline puede leer archivos del proyecto, buscar en la base de código, aplicar parches, crear archivos y ejecutar comandos. Ante una tarea como «añadir la opción Recordarme al inicio de sesión y ejecutar las pruebas», puede revisar el frontend, la autenticación y la API, y ajustar la implementación según los resultados.
  • El modo Planificar es adecuado para investigar problemas y diseñar soluciones primero, y luego el modo Actuar los implementará. Si el Agente solo analiza pero no modifica los archivos, primero confirme si todavía está en modo Plan y si el permiso "Editar archivos de proyecto" está activado.
  • La aprobación automática permite que el Agente trabaje continuamente, pero al mismo tiempo se magnificarán los riesgos de modificación de archivos y comandos de terminal. Se debe conservar la aprobación manual cuando se usa por primera vez y las operaciones seguras deben abrirse gradualmente una vez que el comportamiento del modelo sea estable.
  • Cline CLI se puede ejecutar desde el directorio del proyecto, por ejemplo usandocline "Verificar el proyecto y corregir las pruebas fallidas". Se acerca más a la experiencia terminal de Codex o Claude Code, al tiempo que conserva el mismo conjunto de capacidades del Agente.

🧰 Código Roo: permisos y roles más flexibles

  • Roo Code divide las capacidades en lectura, edición, comando y MCP, que pueden completar la lectura, escritura, ejecución de Shell e invocación de herramientas externas en el modelo local.
  • Está muy cerca de las capacidades básicas de Cline. Si prefiere usarlo de inmediato, puede elegir Cline primero; cuando necesita configuraciones de modos, permisos y funciones más detalladas, Roo Code suele ser más conveniente.
  • Ambos son adecuados para comenzar con pruebas pequeñas, confirmar que el modelo llamará a la herramienta de manera estable y luego la dejará ingresar al repositorio real para manejar múltiples modificaciones de archivos.

🧠 Continue: Adecuado para una alternativa completa de Copilot local

  • El modo Chat se utiliza para conversaciones, el modo Plan lee y analiza proyectos y el modo Agente tiene herramientas completas para crear archivos, modificar archivos y ejecutar comandos de terminal.
  • Puede asignar diferentes tareas a diferentes modelos: el modelo liviano es responsable de Autocompletar, el modelo grande es responsable del Agente y el modelo Incrustado se configura por separado para la recuperación de código.
  • Aunque algunos modelos de Ollama están anotados para admitir la invocación de herramientas, es posible que el Agente aún no pueda utilizar la herramienta. En este momento, debe verificar la declaración de capacidad del modelo, la configuración del proveedor y si está habilitado correctamente.tool_use

🧩 Agente nativo de VS Code: el acceso exitoso no significa una ejecución estable

  • Los modelos locales pueden participar en los flujos de trabajo de agentes y chat de VS Code, pero la invocación de herramientas, el razonamiento y las capacidades visuales dependen del modelo específico. Poder chatear normalmente no prueba que llamará a Editar archivo.
  • Si se requiere modificaciónlogin.tsFinalmente, el modelo simplemente genera un fragmento de código de reemplazo sin provocar cambios en el archivo, y la configuración actual sigue siendo solo un asistente de chat.
  • Cuando se utiliza el modelo BYOK local para la modificación del estilo del agente, no reemplazará automáticamente la finalización de pestañas nativa de VS Code. Si desea mantener la finalización local, necesita una extensión como Continue que pueda conectarse al modelo de Autocompletar local.

⌨️ En la terminal: trabajar en el proyecto sin abrir VS Code

🧪 Codex + Ollama

  • Usar primeronpm install -g @openai/codexInstale Codex CLI y ejecúteloollama launch codex, también puedes pasarcodex --ossSeleccione un modelo local.
  • Después de ingresar al directorio del proyecto, Codex operará directamente el repositorio en el disco duro, para que el editor pueda elegir libremente. La aplicación Codex también puede pasarollama launch codex-appConéctese a Ollama, adecuado para personas a las que no les gusta la interfaz de terminal pura.
  • Este tipo de Agente seguirá llevando instrucciones de herramientas, códigos de proyecto, resultados de comandos y operaciones históricas. El uso real debe comenzar en contextos de aproximadamente 64 KB.

🧭 Claude Code + Ollama

  • correrollama launch claudePuede conectar el shell de Claude Code Agent a Ollama o utilizarclaude --model qwen3.5Especifique el modelo abierto local.
  • El programa del agente y la fuente del modelo son dos cosas diferentes. El uso de las capacidades de operación de proyectos de Claude Code no significa necesariamente que esté llamando al modelo Claude en la nube de Anthropic.
  • Para acomodar el contenido del archivo, las definiciones de herramientas y múltiples rondas de depuración, también es adecuado configurar al menos contextos de 64K.

🌐 OpenCode, Copilot CLI y Cline CLI

  • ollama launch opencodeAdecuado para flujos de trabajo de terminales abiertos;ollama launch copilotDeje que Copilot CLI utilice el modelo proporcionado por Ollama.
  • Terminal Agent es especialmente adecuado para entornos Linux, SSH y de servidor. Siempre que ingrese al directorio del proyecto correcto, puede leer el repositorio, modificar archivos y ejecutar pruebas independientemente del editor.
  • No mire solo el nombre al elegir una herramienta, verifique si también tiene Leer archivo, Editar archivo o Aplicar parche, Terminal, Llamada de herramienta y Bucle de agente.

🧠 Cómo elegir modelo: parámetros, contexto y cuantización

modelo local Escala y contexto tarea adecuada
Qwen3.5 9B La versión de Ollama tiene aproximadamente 6,6 GB, admite aproximadamente 256 000 llamadas de contexto y herramientas y tiene baja presión de hardware. Adecuado para experimentar con Agent, modificación de un solo archivo, scripts pequeños, HTML/CSS y errores más simples; la estabilidad de tareas largas es limitada.
Qwen3.5 27B / 35B La versión 27B ocupa unos 17 GB y la 35B, unos 24 GB. Ambas admiten alrededor de 256K de contexto y llamadas a herramientas. Es adecuado para ordenadores de gama media a alta con suficiente VRAM y memoria, y tiene capacidades de razonamiento integral más sólidas y comprensión de proyectos complejos.
Devstral Small 24B La versión Q4 ocupa unos 14–15 GB y admite un contexto de aproximadamente 128K. El modelo se centra en explorar bases de código, usar herramientas y resolver tareas de ingeniería de software con varios archivos. Adecuado para ordenadores con VRAM de 24 GB o Mac con memoria unificada de 32 GB, es una opción práctica para proyectos de tamaño mediano, depuración local y modificación de múltiples archivos.
Qwen3-Coder 30B La versión Q4 ocupa unos 19 GB, tiene aproximadamente 30,5B parámetros, un contexto nativo de 256K y compatibilidad con herramientas; está optimizada para repositorios y programación agéntica. Es adecuado para la máquina de desarrollo local principal con 64 GB de memoria y 24 GB o más de VRAM, y puede manejar seriamente tareas de depuración, reconstrucción, bucle de prueba y de múltiples archivos.

📏 Parámetros y capacidades reales del Agente

  • 3B ~ 4B están más cerca de la finalización de código avanzado y no son adecuados para tareas complejas de agentes; 7B ~ 9B pueden modificar archivos individuales, escribir funciones pequeñas y manejar errores simples, pero la estabilidad de bucles largos es promedio.
  • Alrededor del 14B, empieza a tener un valor de productividad claro; 24B a 30B es un nivel importante para el agente de programación local, que puede manejar seriamente la comprensión de la base de código, la modificación de múltiples archivos, la depuración, la refactorización y los ciclos de prueba.
  • El hecho de que el modelo pueda escribir código no significa que pueda ser un agente. Las tareas reales también requieren que elija la herramienta adecuada, complete los parámetros, analice el resultado de la herramienta, mantenga objetivos a largo plazo y juzgue cuándo detenerse, por lo que la capacidad de programación agéntica es más importante que una puntuación comparativa de un solo código.

📚 La ventana de contexto no puede mirar solo el valor nominal máximo

  • El contexto del Agente también incluye indicaciones del sistema, definiciones de herramientas, requisitos del usuario, archivos de proyecto, salida del terminal, Git Diff y registros de operaciones anteriores. 8K puede ser suficiente para un chat normal, pero es más confiable usar 32K como punto de partida realista para Coding Agent.
  • Cline y Roo Code pueden comenzar desde 32K; Los agentes terminales de bucle largo como Codex, Claude Code y OpenCode son más adecuados para 64K y superiores. Para repositorios grandes o refactorizaciones a gran escala, considere agregar más.
  • El hecho de que el modelo admita 256K no significa que deba ser directamentenum_ctxEstablecido en 262144. Cuanto mayor sea el contexto, más caché KV estará ocupada, lo que puede causar desbordamiento de memoria, escasez de memoria, reducción de velocidad y una espera más larga para el primer token.

🗜️ Cómo elegir entre Q4, Q5, Q6 y Q8

  • Q4 tiene un mayor grado de compresión, archivos más pequeños, menores requisitos de VRAM y un funcionamiento más rápido, pero perderá una pequeña cantidad de precisión; El Q8 se acerca más a las capacidades del modelo original y el uso de memoria y VRAM también aumenta significativamente.
  • El agente codificador local ordinario puede comenzar desde Q4_K_M. Ser capaz de cargar de forma estable el modelo completo y el contexto razonable en el hardware suele ser más importante que buscar una cuantización de alta precisión pero con desbordamientos frecuentes.

🖥️ Hardware: primero la VRAM, sin olvidar la RAM y el contexto

Nivel de hardware modelo en forma experiencia real
Memoria de 16 GB, sin gráficos discretos ni memoria de vídeo de 6 GB Modelo cuantitativo 2B~7B Adecuado para usuarios pioneros, explicaciones de código y scripts pequeños. Cada paso del Agente puede ser lento y no adecuado para bucles largos.
Memoria de 16~32 GB, memoria de vídeo de 8 GB Modelo 7B ~ 9B Puede realizar modificaciones de un solo archivo, HTML/CSS y tareas simples de Python y JavaScript.
Memoria de 32 GB, memoria de vídeo de 12 a 16 GB Modelo 9B~14B Empiece a tener una productividad estable y pueda manejar React, API, complementos de WordPress y proyectos web pequeños y medianos.
Memoria de 64 GB, memoria de vídeo de 24 GB Modelo Q4 24B~30B Un punto de equilibrio muy práctico para agentes locales: permite usar Devstral Small 24B, Qwen3-Coder 30B y contextos cercanos a 64K.
96 GB o más de memoria, 32 GB de memoria de vídeo Modelo 27B~35B Capaz de mejorar la precisión de la cuantización, el contexto y el margen para entornos de desarrollo paralelo, adecuado para estaciones de trabajo locales de alta gama.
128 GB o más de memoria, 48 GB o más de memoria de vídeo Modelos cuantizados de 30B–70B o mayores Adecuado para estaciones de trabajo profesionales de IA; más de 80 GB de VRAM pueden mejorar aún más las capacidades de modelos grandes y de contexto prolongado.

🎮 Por qué la VRAM ocupa el primer lugar

  • La velocidad suele ser mejor cuando todos los parámetros del modelo ingresan a la GPU; cuando la VRAM es insuficiente, algunos parámetros se transferirán a la memoria del sistema. Aunque todavía puede ejecutarse, el intercambio de datos entre la CPU y la GPU ralentizará significativamente el ciclo del Agente.
  • La operación pura de la CPU no es completamente inviable, pero el Agente solicitará el modelo varias veces seguidas para una tarea. Esperar decenas de segundos para cada paso puede hacer que los procesos de depuración, prueba y reparación sean difíciles de manejar.
  • El archivo Qwen3-Coder 30B Q4 tiene aproximadamente 19 GB, lo que no significa que queden fijos 5 GB restantes de VRAM de 24 GB. KV Cache, tiempo de ejecución y contexto ocuparán recursos adicionales, y 32 GB o 48 GB de VRAM serán más cómodos.

💾 Prioridad de memoria, SSD y CPU

  • La memoria de 64 GB es más adecuada para el desarrollo a largo plazo, porque Windows, VS Code, navegadores, Docker, Node.js, bases de datos, Ollama y servidores de desarrollo ocuparán recursos al mismo tiempo que el modelo.
  • Las capacidades comunes de los archivos de modelos varían desde 6 GB, 15 GB, 19 GB hasta decenas de GB. Después de instalar varios modelos, puede ocupar fácilmente cientos de GB. El SSD tiene al menos 1 TB y el NVMe de 2 TB es más adecuado para un uso prolongado.
  • Por supuesto, la CPU es importante, pero cuando tienes un presupuesto limitado, generalmente no vale la pena reducir los 24 GB de VRAM a 16 GB para aumentar un poco la CPU. Para modelos locales grandes, la memoria GPU tiene mayor prioridad.

🍎 Cómo elegir memoria unificada para Apple Silicon

  • Mac usa memoria unificada compartida por la CPU y la GPU y no puede aplicar directamente el algoritmo de PC de "memoria del sistema más VRAM independiente". 16 GB son adecuados para modelos más pequeños, y 32 GB pueden probar seriamente modelos como el Devstral 24B Q4.
  • La memoria unificada de 64 GB es adecuada para agentes de programación locales de 24 B a 35 B, y 128 GB pueden acomodar modelos más grandes y contextos más largos. Cuando solo ejecuta IA local y no se centra en juegos a gran escala, Mac con gran memoria unificada tiene ventajas obvias.
  • Una referencia práctica es: aproximadamente 8 GB de VRAM con contexto de 16 K, aproximadamente 16 GB de VRAM con 32 K y más de 24 GB de VRAM, pruebe con 64 K. La ocupación específica seguirá variando según la arquitectura del modelo y el método de cuantización.

⚙️ Instalación en Windows: VS Code + Cline + Ollama

1️⃣ Instale el corredor y descargue el modelo apropiado

  • Primero instale Ollama, luego seleccione el modelo por hardware. Se puede probar una memoria de vídeo de 24 GBollama pull qwen3-coder:30boollama pull devstral-small-2:24b;Cuando la memoria de vídeo es pequeña, puede utilizarollama pull qwen3.5:9bComience.
  • Si se siente más cómodo con una interfaz gráfica, también puede utilizar LM Studio para buscar, descargar y cargar modelos. El alcance de la automatización e integración de Ollama suele ser más conveniente cuando el uso principal es el agente codificador.

2️⃣ Instala Cline y conéctate a Ollama

  • Instale Cline en la tienda de extensiones de VS Code, ingrese a Configuración y configure el proveedor de API en Ollama.
  • La dirección predeterminada de esta máquina suele serhttp://localhost:11434, luego seleccione el modelo descargado y establezca una longitud de contexto razonable para el Agente.
  • No abra los permisos automáticos del terminal por primera vez, primero permita leer proyectos, editar archivos del espacio de trabajo y ejecutar comandos seguros.

3️⃣ Confirme el enlace del Agente con una prueba mínima

  • creartest.txty escribehello, requiriendo que el Agente no responda al contenido modificado, sino que cambie directamente el archivo ahello world
  • Si el archivo efectivamente ha cambiado, significa que se ha llamado a la herramienta de edición; si solo aparece "debe cambiarse a hola mundo", todavía hay un problema con el modo actual, los permisos, el modelo o la configuración de la herramienta.
  • El segundo paso es crearlo.hello.py, ejecute el script y confirme el resultado. Solo cuando la creación, ejecución y lectura de los resultados se pueden completar en secuencia, significa que la herramienta de archivo, la herramienta de terminal y la llamada de herramientas están todas conectadas.

4️⃣ Luego ingresa a la tarea de software real.

  • Primero seleccione proyectos pequeños y medianos que tengan pruebas o se puedan construir, solicite al Agente que busque errores de compilación de TypeScript, los corrija directamente y luego ejecutenpm run build, si aún falla, continúe procesando.
  • Es más fácil lograr resultados estables indicando claramente el objetivo, el alcance de las modificaciones permitidas, los comandos de verificación que se deben ejecutar y las condiciones de detención que simplemente decir "Ayúdame a solucionarlo".

🧪 Tareas para las que destaca un agente local de programación

🐛 Corrección de errores y manejo automático de errores de compilación

  • Si la sesión desaparece al actualizar la página, el agente puede buscar el código de autenticación, revisar la lógica de localStorage y del token, modificar los archivos relacionados y ejecutar las pruebas.
  • cuandonpm run buildCuando ocurren múltiples errores, puede leer el error, localizar el archivo, modificarlo, reconstruirlo y repetir el ciclo hasta que pase. Este tipo de tareas con comentarios claros pueden resaltar mejor el valor del Agente.

🧱 Agregue funciones y modifique múltiples archivos

  • Al agregar una función de recopilación de artículos a un blog, el Agente puede manejar la base de datos, la API, el backend, el frontend, el estilo y las pruebas al mismo tiempo, en lugar de simplemente generar una función aislada.
  • Los requisitos deben establecer claramente la estructura de datos, el flujo de usuarios, los requisitos de compatibilidad y los comandos de aceptación, de modo que el Agente pueda finalizar la tarea basándose en resultados reales en lugar de juicios subjetivos.

♻️Refactorización, actualización de dependencias y ciclo de prueba

  • Al dividir un archivo Python de 2000 líneas, el Agente puede analizar dependencias, crear módulos, mover funciones, ajustar importaciones y ejecutar pruebas continuamente, siempre que el proyecto tenga una protección de prueba confiable.
  • Se puede modificar al actualizar dependencias como React.package.json, instale dependencias, corrija API antiguas y luego confirme la compatibilidad mediante la compilación y las pruebas.

🔍 Comprenda repositorios desconocidos y cree proyectos desde cero

  • Después de ingresar a un proyecto desconocido, puede pedirle al Agente que averigüe el método de inicio, la entrada de inicio de sesión, la ubicación de inicialización de la base de datos y el enlace de solicitud. Las búsquedas en repositorios y las correlaciones entre archivos suelen consumir menos tiempo que la lectura archivo por archivo.
  • Al crear un sitio web de contabilidad personal desde cero, el Agente puede generar el directorio, el front-end y el back-end, la base de datos y la API, y luego iniciarlo y corregir los errores, pero aún requiere la toma de decisiones manual de la arquitectura y la verificación de los límites de seguridad.

🧯 Escribe código pero no edita archivos: causas habituales

❌ El modelo no tiene capacidades estables de llamada de herramientas

  • El agente requiere una selección precisa del modeloedit_fileread_fileo herramienta terminal y complete la ruta y los parámetros correctos del archivo. Si el modelo solo genera lenguaje natural, solo dará sugerencias de código.
  • Los modelos pequeños tienden a resultar confusos cuando se enfrentan a una gran cantidad de definiciones de herramientas, archivos de proyectos, conversaciones históricas y requisitos complejos. Incluso si el modelo 3B o 7B admite nominalmente la herramienta, aún puede recurrir a respuestas de texto normales durante tareas largas.

🔧 Modo, permisos o configuración del proveedor incorrectos

  • Los modos Chat y Plan generalmente no realizan modificaciones reales y deben cambiarse al modo Agente, Actuar o Código. No importa cuán inteligente sea el modelo, no puede escribir en el archivo cuando los permisos de edición están desactivados.
  • Confirme que la dirección de Ollama, el nombre del modelo, el contexto y la declaración de capacidad de la herramienta sean correctos. Algunas integraciones requieren anotaciones explícitastool_use, de lo contrario el modelo no recibirá las herramientas disponibles.
  • No utilice repositorios complejos como primer objetivo de diagnóstico.test.txtLa prueba de saludo puede separar rápidamente los "problemas de capacidad del modelo" y los "problemas de comprensión del proyecto".

🔁 Agente repetidamente o se desvía del objetivo en tareas complejas

  • El modelo 9B local puede encontrar el archivo incorrecto, repetir la misma operación, corregir un error e introducir otro u olvidar el objetivo original en un bucle largo. Tener herramientas completas no significa que el nivel de inteligencia alcance el modelo de nube más potente.
  • Dividir tareas grandes en tareas pequeñas verificables, limitar la cantidad de directorios y archivos que se pueden modificar al mismo tiempo y exigir que se ejecuten pruebas en cada etapa suele ser más estable que requerir "refactorizar todo el proyecto" de una vez.
  • Cuando el contexto comienza a acumular registros irrelevantes, es más efectivo reabrir una tarea enfocada que expandir ciegamente la ventana de contexto al máximo.

🔒 Trabajar en local no elimina el riesgo: permisos, Git y privacidad

  • 🌿 Primero crea una rama de Git: Los proyectos formales se pueden ejecutar primero.git checkout -b ai-testy luego deje que el Agente opere después de enviar el estado de limpieza actual. Esto le permite revisar las diferencias elemento por elemento y deshacer cambios inapropiados.
  • 🛡️ Los permisos se abren de pequeño a grande.: Inicialmente, se permite leer y editar el espacio de trabajo y ejecutar comandos de seguridad; Desactive la edición fuera del espacio de trabajo y la aprobación automática de todos los comandos. En primer lugar, no habilites el modo YOLO.
  • 💥 Los permisos de terminal son más riesgosos: El agente puede realizar eliminación, restablecimiento, instalación de dependencias o migración de bases de datos. Cualquier comando que pueda dañar datos, liberar sistemas o modificar el entorno de producción debe confirmarse manualmente.
  • 📋 Examine los resultados en lugar de simplemente mirar el resumen: vea Git Diff, ejecute pruebas, compilaciones y comprobaciones estáticas después de la tarea. La afirmación del Agente de que el código está completo no significa que el código sea correcto o que no tenga efectos secundarios.
  • 🔐 Confirmar verdadero sin conexión: Los modelos locales de Ollama generalmente no tienen costes por token, pero aún hay costos de ordenadores, electricidad y hardware. Si no es necesario enviar el código, también debe verificar si la telemetría del agente, el MCP remoto, el servicio de integración y el modelo son versiones en la nube.

✅ Combinaciones recomendadas según el hardware y la forma de trabajar

Requisitos de uso Combinación recomendada Motivo de la selección
Primera experiencia, memoria de 16~32GB VS Code + Cline + Ollama + Qwen3.5 9B La instalación y verificación son simples, adecuadas para tareas de un solo archivo y proyectos pequeños; No espere demasiado de los complejos bucles de agentes.
Proyectos de tamaño mediano, memoria de 32~64 GB VS Code + Cline + Ollama + Devstral Small 24B Adecuado para Web, Python, JavaScript, React, corrección de errores y modificación de múltiples archivos, la VRAM de 24 GB es más ideal.
Agente de codificación local principal Código Cline o Roo + Ollama + Qwen3-Coder 30B 64 GB de memoria, más de 24 GB de VRAM y 2 TB de NVMe constituyen un punto óptimo realista para el desarrollo local.
No depende del código VS Códice o Código Claude + Ollama + Qwen3-Coder/Qwen3.5 El agente opera directamente el directorio del proyecto, que es adecuado para usuarios finales, desarrollo multi-IDE o personas que desean desacoplar herramientas y editores.
Flujo de trabajo abierto de Linux y SSH OpenCode + Ollama + modelo local Tanto el shell del agente como el enlace del modelo son más abiertos y adecuados para servidores, desarrollo remoto y entornos de terminal puro.
También requiere completar la pestaña local Continue + Ollama: Finalización de modelo pequeño, Agente de modelo grande Separe la finalización de alta frecuencia y baja latencia de las tareas complejas del proyecto y la experiencia se acercará más a un Copilot local completo.

🏁 Conclusión: revise la cadena de herramientas, no la etiqueta comercial

La programación local con IA ya permite trabajar en proyectos reales, pero la experiencia depende de que el agente, el modelo, el entorno de ejecución y el hardware encajen bien. Un modelo ligero basta para empezar; para trabajar de forma constante, un modelo de 24B–30B con 64 GB de RAM y al menos 24 GB de VRAM se acerca mucho más a un asistente local fiable.

  • Si prefiere VS Code: Empiece con Cline o Roo Code y Ollama. Elija Continue si también necesita autocompletado local.
  • Si prefiere la terminal: Use Codex, Claude Code u OpenCode para separar el agente del editor.
  • Al evaluar una herramienta nueva: Compruebe que incluya Read File, Edit File o Apply Patch, Terminal, Tool Calling y un Agent Loop.
  • Compruebe la instalación: Escriba hello en test.txt y pida al agente que edite el archivo directamente. Pase a un repositorio real solo cuando el contenido cambie de verdad.
  • Mantenga la disciplina de ingeniería: Use Git, limite los permisos, revise los diffs y ejecute pruebas. El agente puede automatizar mucho trabajo mecánico, pero la arquitectura, los límites de seguridad y la aprobación final siguen siendo responsabilidad del desarrollador.