Veredicto rápido para una tarea de repositorio
Esta revisión de SWE-2 no es una afirmación de que ejecuté el modelo de forma independiente a través de un repositorio de producción. No tengo un espacio de trabajo de Devin con el mismo repositorio, permisos y condiciones de implementación que usaría un equipo de ingeniería. En cambio, estoy estableciendo la revisión de una sola tarea que me gustaría ver antes de tratar un modelo de codificación como si estuviera listo para el trabajo real de repositorio.
Soy Lena. Mi veredicto rápido es simple: parece que vale la pena evaluar SWE-2 en Devin, pero un punto de referencia de codificación es solo el comienzo de la decisión. La pregunta útil no es si un modelo puede producir un parche plausible. Se trata de si puede ingresar a una base de código desconocida, encontrar los límites que importan, cambiar lo más mínimo, probar el cambio, recuperarse cuando se rompe su primer camino y dejar algo que un humano pueda revisar sin reconstruir toda la sesión.
Esa distinción es importante porque Cognition informa resultados administrados por proveedores del 50,0 % en FrontierCode 1.1 Main, 73,0 % en DeepSWE 1.1 y 92,8 % en Terminal-Bench 2.1. Son señales sobre la versión del 10 de septiembre de 2026, no tasas de éxito reproducidas de forma independiente para el software de un equipo. El mismo anuncio de lanzamiento de SWE-2 dice que Desktop y CLI estaban disponibles, con Web y Fusion implementándose. Probaría la superficie exacta que un equipo planea usar.
Cómo probaría SWE-2 en Devin
Para una prueba real del agente de repositorio, usaría un cambio existente y no trivial en lugar de un mensaje sintético o una solicitud de función amplia. Debe ser lo suficientemente pequeño como para revisarlo de una sola vez, pero lo suficientemente real como para requerir encontrar una dependencia y respetar un patrón establecido. Un buen candidato es un error con una prueba fallida reproducible, un cambio de validación de alcance limitado o una brecha de comportamiento documentada donde los criterios de aceptación se pueden verificar sin interpretación.
Antes de comenzar, registraría la superficie de Devin, el modelo seleccionado, la configuración de esfuerzo mostrada, la fecha, el SHA de confirmación, las reglas de rama, los archivos de bloqueo, las herramientas, el estado de la red y los comandos iniciales de aprobación o falla. También establecería un tiempo y un presupuesto de intentos y guardaría cada mensaje humano después de la tarea de apertura. Eso evita que una demostración limpia se convierta silenciosamente en un experimento diferente.
Repositorio, tarea, entorno y criterios de aceptación
El informe debe nombrar el comportamiento, el área afectada y la línea de meta: reproducir el error nombrado, realizar el cambio compatible más pequeño, agregar o ajustar una prueba de regresión, ejecutar comprobaciones prescritas y devolver una diferencia revisable. No debe nombrar un archivo a menos que un asignado normal lo sepa. Declararía de antemano los registros, secretos o inicios de sesión del navegador requeridos en lugar de confundir la falta de acceso con una falla del modelo.
La línea de base debe ser honesta. Si el repositorio no se compila antes de la tarea, guardaría los registros y distinguiría esa falla de una creada por el agente. Un subconjunto verde no cuenta si el comando de aceptación indicado permanece en rojo. Las instrucciones y pruebas locales pueden guiar el modelo, pero pertenecen al registro.
¿Puede SWE-2 comprender el código base antes de editarlo?
Inspeccionaría la ruta, no solo el código final. Una sesión sólida identifica la ruta de ejecución, las pruebas relevantes, los límites de configuración y las convenciones cercanas antes de una edición. Eso no recompensa la búsqueda interminable. Cognition dice que el medio SWE-2 se editó antes que SWE-1.7 en las ejecuciones de FrontierCode; la velocidad solo importa si las lecturas omitidas eran irrelevantes.
Encontrar restricciones, dependencias y patrones existentes
Yo preguntaría qué cree que debe preservar: comportamiento de la API pública, manejo de errores, autorización, forma de los datos, compatibilidad con versiones anteriores o una convención comparable. Luego compararía esa respuesta con el repositorio. ¿Encontró a la persona que llamó realmente, utilizó el asistente de prueba establecido y notó indicadores de funciones, artefactos generados, migraciones o límites de paquetes?
Esta parte de una prueba de agente de repositorio real debería producir evidencia, no una puntuación para parecer confiado. Los artefactos útiles son los archivos que inspeccionó, las restricciones que nombró y una diferencia cuyo alcance coincide con ellos. Una exploración sorprendentemente breve puede resultar excelente; uno largo aún puede pasar por alto la dependencia que hace que un parche sea inseguro. Trataría las ediciones inexplicables fuera del área solicitada como un hallazgo de revisión, incluso si las pruebas pasan.
¿Puede SWE-2 ofrecer un cambio verificado?
La implementación es donde un modelo de codificación SWE-2 debe ser responsable. Buscaría un parche mínimo, una prueba de regresión que fallaría sin él y un resultado del entorno del repositorio real. Para una interfaz o flujo de trabajo, agregaría una verificación manual liviana en lugar de asumir que la cobertura de la unidad cuenta la historia completa.
Implementación, pruebas y entrega final
La transferencia debe decir qué cambió, por qué, qué se ejecutó y qué sigue siendo incierto. Una descripción limpia de la solicitud de extracción no es una prueba. Volvería a ejecutar el comando de aceptación desde un nuevo trabajo de pago o CI, inspeccionaría si hay abandono no relacionado y confirmaría que la protección de sucursales aún se aplica.
Quiero el mismo estándar por parte de cualquier colaborador: que no se inventen pruebas de aprobación, que no se reclame como ejercido ningún servicio no disponible y que no se omita ningún comando oculto en un resumen seguro. El Perfil de IA generativa del NIST enmarca de manera similar la evaluación en torno al contexto y el riesgo, no a una etiqueta de capacidad genérica. No es un veredicto de adquisición para Devin o SWE-2.
Donde la intervención humana sigue siendo importante
La intervención humana es una medida. Esta prueba de agente de repositorio real trata la intervención humana del agente de codificación como un evento con nombre: una persona aclaró un requisito, otorgó el permiso esperado, reparó el entorno, explicó una convención, eligió entre comportamientos válidos del producto o corrigió un diagnóstico. Combinarlos en un solo cargo hace que un agente parezca peor o más autónomo de lo que era.
Aclaración, pruebas fallidas y recuperación
El momento más revelador puede ser la primera prueba fallida tras una edición. Conservaría el diagnóstico, la evidencia, la recuperación y si un humano proporcionó un hecho nuevo. La recuperación de fallas del agente de codificación es sólida cuando limita la hipótesis, inspecciona la falla, revisa el parche y vuelve a ejecutar las comprobaciones; es débil cuando cambia repetidamente el código o amplía la diferencia.
No fabricaría fracasos únicamente para hacer que la sesión fuera dramática. Pero cuando un problema real de dependencia, prueba o entorno bloquea la tarea, pertenece al resultado. Para un agente codificador, la calidad de la recuperación es parte de la calidad de la entrega. Me dice si un humano está revisando el trabajo o si se está convirtiendo silenciosamente en el depurador del agente.
Lo que no prueban los puntos de referencia publicados
Los puntos de referencia publicados pueden mostrar que un modelo completó tareas definidas bajo un arnés específico. No establecen que comprende su arquitectura, tiene sus permisos, inicia su cadena de herramientas, respeta su proceso de liberación o se recuperará de la ambigüedad particular en su ticket. Tampoco hacen que SWE-2 y SWE-bench sean intercambiables: SWE-2 es el nombre del modelo de Cognition, mientras que SWE-bench es una familia de referencia.
Las cifras de los proveedores son especialmente fáciles de sobreleer porque son precisas. Siempre deben llevar su fuente, versión comparativa y fecha. Una puntuación única no puede convertirse en un pronóstico del éxito del repositorio real, ni puede decirle a un líder de ingeniería cuánta intervención requerirá una tarea. Yo usaría las cifras para elegir qué probar, no para renunciar a la prueba.
Límites de esta revisión de SWE-2
Este es un plan de evaluación documentado, no una ejecución independiente completa. No puede informar una tasa de resolución, costo, tiempo de reloj o patrón de falla SWE-2 para un repositorio específico. Los resultados variarán según la superficie del producto Devin seleccionada, el nivel de esfuerzo, la instantánea del espacio de trabajo, las instrucciones del repositorio, la disponibilidad de la dependencia, el acceso a la red, los permisos y la calidad del resumen de la tarea.
Tampoco realiza reclamos legales, de seguridad, de cumplimiento o de compras. Antes de conectar un repositorio privado, le pediría al propietario de la cuenta que verificara la documentación y el acuerdo actuales del producto. En particular, el equipo debe verificar los permisos reales otorgados, los controles de datos actuales, el idioma de retención, los derechos del plan y si la opción SWE-2 prevista es visible en su entorno Devin. Ninguna parte de esta revisión implica que EvoX o Evomap utilicen o integren SWE-2.
Preguntas frecuentes
¿Dónde está disponible actualmente SWE-2 en los productos Devin?
En el anuncio del 10 de septiembre de 2026, Cognition dijo que SWE-2 estaba disponible en Devin Desktop y CLI y se estaba implementando en Devin Web y Fusion. Esa es una declaración de tiempo de lanzamiento, no una promesa de derecho permanente, por lo que verificaría el selector de modelo actual, las notas de la versión y el plan antes de confiar en una superficie en particular.
¿Puede un equipo de Devin restringir a qué repositorios puede acceder SWE-2?
Para la integración de GitHub, la guía actual de Cognition dice que un administrador puede otorgar acceso a Devin a todos los repositorios o a repositorios seleccionados, y puede cambiar ese alcance más adelante. Las implementaciones empresariales también documentan los permisos del repositorio. La guía de integración de Devin GitHub enumera los permisos de lectura y escritura más amplios involucrados, por lo que el "repositorio seleccionado" aún debe revisarse como una concesión de acceso significativa, no tratarse como una opción inofensiva.
¿Cómo maneja Cognition los datos del repositorio enviados a SWE-2?
La documentación de seguridad pública de Cognition debe considerarse como la fuente actual para esta pregunta, junto con el acuerdo del cliente. Su redacción pública actual dice que Cognition procesa datos que un usuario autorizado proporciona activamente y dice que la capacitación del modelo sobre los datos del cliente está desactivada de manera predeterminada a menos que se habilite a través de Controles de datos; indica por separado que los datos de los clientes empresariales no se utilizan para entrenar modelos. También describe la retención y los comentarios o los datos de interacción del usuario de manera diferente. Debido a que estos son términos de manejo de datos, verificaría la documentación y el contrato en vivo en lugar de convertir esta respuesta en una conclusión legal o de cumplimiento.
¿Pueden los usuarios elegir un esfuerzo de razonamiento SWE-2 para cada tarea?
El anuncio de Cognition describe SWE-2 medio, alto y máximo como niveles de esfuerzo conductualmente diferentes, pero el anuncio por sí solo no promete que cada superficie Devin permita a cada usuario seleccionar cada esfuerzo para cada tarea. Registraría la configuración seleccionable real en la prueba y la marcaría como no disponible si la interfaz o el plan no la exponen. Entrenar múltiples niveles de esfuerzo no es, por sí solo, evidencia de un control universal por tarea.
¿Cognition proporciona ponderaciones SWE-2 o una API independiente?
El anuncio de lanzamiento describe SWE-2 a través de productos Devin, no pesos descargables ni una API de inferencia SWE-2 independiente. Devin tiene interfaces de plataforma y flujo de trabajo, pero eso es diferente de un lanzamiento de pesos de modelo anunciado o de una API de modelo general. Según el material público revisado para este artículo, no se debe asumir ninguna de las dos cosas; un equipo que necesite cualquiera de los dos debería preguntarle a Cognition directamente.
Publicaciones anteriores:
- Para otra comparación de repositorio fijo entre la capacidad del modelo y la finalización de tareas reales, razonamiento del agente Muse Spark 1.3 examina la calidad de finalización, la intervención humana, la recuperación, la latencia y el esfuerzo de razonamiento en el trabajo de codificación a largo plazo.
- Si desea ver cómo se debe evaluar un agente de codificación a través de una tarea de repositorio delimitada, Revisión de código T3 sigue la configuración, el control de sesión, la inspección de diferencias y la transferencia sin confundir la interfaz con el agente subyacente.
- Para obtener una perspectiva más amplia del desarrollo de software real, estudio de caso de desarrollo de software GPT-5.6 Sol va más allá de la generación de código y abarca pruebas, evidencia de implementación, límites de implementación y revisión humana.
- Para comprender por qué los resultados del benchmark SWE-2 aún dependen de la capa de ejecución circundante, arquitectura del complemento de arnés DeepSeek separa la capacidad del modelo de las herramientas, sesiones, permisos, complementos y control del tiempo de ejecución.
- Para preservar la evidencia detrás de las pruebas fallidas, los reintentos, las correcciones y el estado final del repositorio, repetición determinista para agentes LLM explica cómo las ejecuciones del agente pueden seguir siendo reproducibles y auditables una vez finalizada la tarea.




