- OpenAI
- GPT-6 Astra
- Devin
- programación
- agentes de IA
OpenAI muestra cómo Devin usa GPT-6 Astra para probar su propio código
OpenAI presenta una integración de GPT-6 Astra en Devin que genera pruebas y evidencia visual, aunque todavía faltan métricas independientes sobre su fiabilidad.
Article created with AI assistance using the cited sources.
Devin intenta demostrar que su trabajo funciona
OpenAI anunció que Cognition está utilizando GPT-6 Astra para reforzar las pruebas de software realizadas por Devin y mostrar evidencia de los resultados. El énfasis del anuncio no está solamente en producir código, sino en acompañar los cambios con materiales que permitan examinarlos.
Según OpenAI, Cognition aplica GPT-6 Astra tanto en el agente principal de Devin como en sus productos de línea de comandos y escritorio. La propuesta apunta así a incorporar la verificación dentro del flujo del agente, en vez de tratarla como una etapa completamente separada.
Qué clase de evidencia entrega el agente
En el ejemplo publicado por OpenAI, Devin prueba un juego para iPhone llamado Otter Run y entrega una grabación de su ejecución en un simulador junto con un informe. OpenAI señala que ese informe identifica las comprobaciones superadas y las partes que quedaron sin probar.
Esta combinación puede ser más útil para una revisión que una afirmación genérica de éxito: la grabación permite observar el comportamiento y el informe delimita lo evaluado. Desde una perspectiva editorial, la distinción importante es que mostrar evidencia no equivale a garantizar que el programa carezca de errores.
OpenAI también describe un flujo en el que Cognition entrega a Devin la captura de un error y recibe otra imagen que muestra el resultado después de la corrección. La imagen posterior puede facilitar una primera comprobación visual, pero por sí sola no demuestra que la causa original haya desaparecido ni que el cambio no introduzca regresiones.
Por qué puede importar a los equipos de ingeniería
Cognition espera que este enfoque reduzca con el tiempo la cantidad de código que sus ingenieros deben revisar manualmente, según la declaración recogida por OpenAI. Si la evidencia generada resulta consistente, un equipo podría dedicar más atención a los cambios de mayor riesgo y menos a reconstruir qué hizo el agente.
El cambio de enfoque es relevante para quienes evalúan agentes de programación: la pregunta deja de ser únicamente si pueden escribir una solución y pasa a incluir si pueden exponer pruebas comprensibles de su funcionamiento. Eso podría mejorar la trazabilidad del trabajo automático, aunque la decisión de aceptar un cambio seguiría requiriendo criterios definidos por cada equipo.
Lo que el anuncio todavía no resuelve
El material de OpenAI presenta ejemplos y expectativas de Cognition, no una evaluación independiente. Quedan abiertas cuestiones esenciales: con qué frecuencia las pruebas detectan fallos reales, cuántos problemas omiten, cómo se comporta el sistema en repositorios complejos y qué coste operativo supone generar la evidencia.
También falta saber qué controles humanos son adecuados según el riesgo del software. Una demostración visual puede ser valiosa en una interfaz, mientras que cambios de seguridad, datos o infraestructura exigirían evidencias distintas. Por ahora, el anuncio debe leerse como una muestra del rumbo que Cognition y OpenAI quieren dar a la revisión asistida por agentes, no como prueba de que la revisión manual pueda eliminarse.
Sources and references
Read the original publications for more detail.