
La plataforma de revisión de código con inteligencia artificial CodeRabbit ha publicado una de las primeras evaluaciones independientes de GPT-6 Astra, el nuevo modelo insignia de OpenAI presentado el 3 de septiembre. Los resultados apuntan a una mejora moderada en términos generales, pero muestran una ventaja considerable cuando el análisis requiere relacionar cambios distribuidos entre varios archivos.
Qué ha medido CodeRabbit y por qué es relevante
CodeRabbit utiliza como referencia la denominada actionable bug coverage, una métrica que determina cuántos errores previamente etiquetados consigue identificar un modelo mediante observaciones que un desarrollador puede convertir en acciones concretas.
La compañía advierte de que no se trata de una clasificación global sobre la calidad de los modelos. Es una evaluación inicial centrada en una tarea específica.
La principal conclusión es que los modelos más avanzados pueden aportar mayor valor cuando necesitan combinar evidencias repartidas entre distintas partes de un proyecto, mientras que para revisiones sencillas un modelo más económico puede seguir siendo suficiente.
GPT-6 Astra frente a GPT-5.6 Sol y Claude Opus 5
Según los resultados publicados por CodeRabbit, GPT-6 Astra detectó aproximadamente un 4% más de errores accionables que GPT-5.6 Sol y alrededor de un 22% más que Claude Opus 5 en la medición global.
La diferencia aumentó considerablemente en las revisiones que implicaban varios archivos: Astra obtuvo aproximadamente un 20% más de cobertura que Sol y un 33% más que Opus 5.
La ventaja aparece en el análisis entre archivos
CodeRabbit atribuye esta mejora a la capacidad del modelo para conectar información relevante distribuida por diferentes partes del código. La cuestión no sería únicamente disponer de una ventana de contexto amplia, sino identificar qué elementos de ese contexto están relacionados y resultan importantes para detectar un fallo.
Este punto resulta especialmente relevante en los pull requests complejos, donde una modificación aparentemente aislada puede alterar funciones, dependencias o módulos situados en otros archivos.
CodeRabbit subraya, no obstante, que sus resultados no garantizan la misma ventaja en todos los proyectos ni permiten establecer por sí solos un ranking general de modelos.
El coste de GPT-6 Astra plantea otro tipo de comparación
La evaluación también aborda uno de los factores decisivos para las empresas: el precio.
| Modelo | Entrada / 1M tokens | Salida / 1M tokens | Ejemplo: 100k entrada / 10k salida |
|---|---|---|---|
| GPT-5.6 Luna | 0,20 US$ | 1,20 US$ | 0,032 US$ |
| GPT-5.6 Terra | 2,00 US$ | 12,00 US$ | 0,32 US$ |
| GPT-5.6 Sol | 4,00 US$ | 20,00 US$ | 0,60 US$ |
| GPT-6 Astra | 10,00 US$ | 50,00 US$ | 1,50 US$ |
| Claude Fable 5.1 | 10,00 US$ | 50,00 US$ | 1,50 US$ |
Con estas tarifas, Astra cuesta 2,5 veces más por token que Sol, cerca de 4,7 veces más que Terra y aproximadamente 47 veces más que Luna.
Sin embargo, CodeRabbit considera que comparar exclusivamente el precio por token puede resultar engañoso.
El coste por tarea puede ser una métrica más útil
Greg Brockman, presidente de OpenAI, defendió durante el lanzamiento que la referencia relevante es el coste necesario para completar una tarea.
OpenAI sostiene que Astra puede reducir aproximadamente un 57% el coste por tarea completada en ingeniería de software, pese a su mayor tarifa por token, al necesitar menos intentos para finalizar correctamente determinados trabajos.
Para una startup, esto implica analizar el coste total de conseguir un resultado válido, incluyendo repeticiones, correcciones y errores no detectados.
Privacidad y retención de código empresarial
La protección del código propietario es otro aspecto destacado por CodeRabbit.
GPT-6 Astra admite retención cero de datos (ZDR) para clientes de API elegibles de OpenAI. En el caso de Claude Fable, Anthropic establece por defecto una retención de 30 días destinada a controles de seguridad, aunque determinados clientes pueden acceder a opciones ZDR.
Anthropic también está introduciendo Enterprise Frontier Safeguards (EFS), un sistema orientado a mantener determinados datos retenidos dentro de infraestructura controlada por el cliente.
Según CodeRabbit, el código propietario de sus clientes no se utiliza para entrenar los modelos de OpenAI ni los de Anthropic.
Aplicaciones más allá de la revisión de código
CodeRabbit considera que la capacidad de Astra para trabajar con evidencias distribuidas podría resultar útil en otros escenarios, aunque recalca que no ha evaluado directamente estas aplicaciones.
Entre ellos figuran la síntesis de investigaciones con fuentes contradictorias, el análisis de registros y documentación de incidentes, la comparación entre requisitos y políticas internas o la validación cruzada de documentos y hojas de cálculo.
El elemento común es la necesidad de relacionar información que se encuentra repartida entre múltiples fuentes.
Qué supone GPT-6 Astra para las startups
CodeRabbit procesa más de dos millones de revisiones de código semanales para unos 17.000 clientes y recientemente cerró una Serie C de 143 millones de dólares, liderada por Atomico y Smash Capital, que situó su valoración en unos 1.500 millones de dólares.
Para equipos tecnológicos, sus resultados sugieren una estrategia prudente: identificar primero qué tipos de errores escapan actualmente a la revisión automática y después comparar Astra con el modelo existente utilizando los mismos pull requests.
Una prueba sobre un conjunto representativo de proyectos puede medir no solo el consumo de tokens, sino también el número de intentos, los errores encontrados y los fallos que finalmente llegan a producción.
Un modelo potente que también exige cautela
El lanzamiento de Astra también ha generado debate en materia de ciberseguridad. OpenAI confirmó que el modelo es el primero en alcanzar su umbral interno “Critical” en capacidades cibernéticas, con resultados del 100% en ExploitBench y del 98% en FrontierMath Tier 4.
Para las empresas, los primeros datos de CodeRabbit apuntan a que el principal atractivo de GPT-6 Astra no reside en sustituir automáticamente modelos más económicos, sino en abordar tareas complejas donde la información está distribuida entre diferentes archivos y dependencias. La decisión de adoptarlo dependerá, por tanto, de si esa mejora compensa el mayor coste y de cómo encaje en los requisitos de seguridad y privacidad de cada organización.

Jacinto Benavente es colaborador de Revista Metrónomo, donde escribe sobre actualidad, política, negocios, tecnología, deportes, entretenimiento y estilo de vida. Su trabajo se centra en ofrecer información clara, precisa y relevante para los lectores, con un enfoque en los acontecimientos que marcan la agenda diaria. A través de una cobertura equilibrada y accesible, busca ayudar a la audiencia a comprender mejor los temas de interés público y las tendencias que influyen en la sociedad.


