NovedadIA
O

Open Code Review

Codigo abiertoValoracion editorial 4.6/5Programación con IA

Herramienta CLI open source de Alibaba especializada en code review con IA. Divide el proceso en etapas de ingenieria determinista controladas por software y un LLM de razonamiento, lo que reduce el consumo de tokens, mejora la precision de los comentarios y permite integrarla en flujos de CI/CD.

Open Code Review, también conocido como open-code-review, es una herramienta CLI de AI Code Review desarrollada como proyecto open source por Alibaba. Nació a partir de un sistema interno de revisión de código y, según el proyecto, ya ha sido utilizado por decenas de miles de desarrolladores y ha ayudado a detectar millones de defectos.

La herramienta lee el Git Diff, entrega los archivos modificados a un LLM Agent con capacidad de utilizar herramientas y genera comentarios de Review asociados a líneas concretas del código.

Pero no funciona simplemente como:

Diff → LLM → comentario

El Agent puede leer archivos completos, buscar referencias dentro del repositorio y consultar otros archivos modificados para obtener el contexto necesario.

Por ejemplo, si una función añade una consulta a una base de datos, el problema real puede no estar en el Diff. Puede encontrarse en la forma en que se llama a esa función, en el tratamiento de excepciones o en cómo se comporta bajo concurrencia.

ocr review está orientado principalmente a cambios de Git, mientras que ocr scan permite revisar directamente archivos o directorios completos. Esto último resulta más interesante cuando se trabaja con un proyecto desconocido, se realiza una auditoría o no existe un Diff claro.

El verdadero problema que intenta resolver: la inestabilidad del AI Review

El problema de un Coding Agent generalista no es necesariamente que sea incapaz de encontrar Bugs. El problema es que no está diseñado específicamente para comportarse como un Reviewer estable y reproducible.

Un PR grande puede modificar decenas o incluso cientos de archivos. Un Agent generalista puede decidir por sí mismo qué archivos revisar, cuánto contexto buscar y cuándo dejar de explorar.

El resultado puede ser una cobertura incompleta, un consumo elevado de Tokens o comentarios que terminan asociados a posiciones incorrectas.

Open Code Review adopta una filosofía mucho más clara:

Lo determinista debe hacerlo el software; lo que requiere razonamiento debe hacerlo el Agent.

Decidir qué archivos deben revisarse, qué reglas aplicar o dónde debe terminar exactamente un comentario no debería depender completamente de una decisión espontánea del LLM.

En cambio, determinar si un cambio constituye realmente un Bug, qué función que lo llama debería revisarse o si un determinado tratamiento de errores introduce un riesgo real son tareas donde el razonamiento del LLM resulta especialmente útil.

Esta separación es probablemente la característica más interesante del proyecto.

Lo realmente diferencial: ingeniería determinista + Agent

Open Code Review divide el proceso de Review en varias etapas controladas por software.

Precise File Selection determina qué archivos necesitan realmente una revisión, reduciendo el riesgo de que el Agent omita archivos importantes.

Smart File Bundling agrupa archivos relacionados en unidades de revisión. Esto permite dividir cambios grandes sin perder el contexto necesario para comprender las relaciones entre ellos.

Fine-grained Rule Matching selecciona reglas en función del tipo de archivo y del lenguaje utilizado. Diferentes tecnologías pueden tener distintos puntos de atención, como NPE, seguridad de hilos, XSS o inyección SQL.

De esta forma, el modelo no necesita filtrar por sí mismo una enorme colección de reglas generales en cada Review.

Después entra en acción el Agent.

Puede buscar código, leer archivos completos y consultar otros cambios cuando necesita más contexto. Es decir, Open Code Review no intenta impedir que el modelo explore, sino definir el espacio dentro del cual puede explorar libremente.

Finalmente, componentes independientes como Comment Positioning y Reflection procesan los comentarios y sus posiciones.

Esto es especialmente importante para la localización de comentarios: en lugar de confiar ciegamente en el número de línea devuelto por el modelo, el sistema puede utilizar técnicas como la coincidencia de fragmentos de código para determinar la posición correcta.

Todo esto resuelve un problema que a menudo recibe menos atención de la necesaria:

En AI Code Review no basta con detectar un posible problema. El comentario tiene que señalar con precisión el código que realmente debe modificarse.

¿Qué tal funciona realmente?

La evidencia pública más interesante hasta ahora es AACR-Bench, desarrollado por Alibaba.

El Benchmark contiene 200 PR reales de 50 proyectos open source y cubre 10 lenguajes de programación. Más de 80 ingenieros sénior participaron en la validación cruzada y se etiquetaron más de 1.500 defectos.

La evaluación pública incluye procesos para Open Code Review, Claude Code y Codex.

Según los resultados publicados, en una de las configuraciones evaluadas, Claude 4.6 Opus + Open Code Review alcanzó un SEM-F1 del 25,10 %, frente al 11,57 % de Claude Code.

Open Code Review obtuvo una Precision del 33,90 % y un Recall del 20,00 %.

La diferencia en consumo de Tokens también es importante: Open Code Review utilizó aproximadamente 385K Tokens de media, frente a unos 5,66M Tokens de Claude Code en la misma evaluación.

Estos datos deben interpretarse correctamente.

Una Precision alta significa que los problemas señalados tienen más probabilidades de ser problemas reales. El desarrollador pierde menos tiempo filtrando comentarios que parecen importantes pero que en realidad no lo son.

Un Recall alto, por el contrario, significa que es menos probable que el sistema pase por alto problemas existentes.

Por tanto, Open Code Review no parece estar diseñado simplemente para encontrar el mayor número posible de Bugs. Su estrategia se acerca más a:

detectar algo menos, pero conseguir que los problemas señalados merezcan realmente la atención del desarrollador.

Esto resulta especialmente importante en CI/CD. Un Reviewer de IA que genere decenas de comentarios irrelevantes cada día puede terminar siendo ignorado por completo.

Sin embargo, el Recall inferior también es una limitación real.

Si el objetivo es realizar una auditoría de seguridad, buscar vulnerabilidades o maximizar la cobertura sobre código de alto riesgo, una estrategia de “menos comentarios, pero más precisos” no siempre será la mejor.

De hecho, la hoja de ruta del proyecto contempla un Ultra Mode orientado precisamente a aumentar el Recall utilizando más Tokens y más tiempo.

Por eso, los Benchmarks son una buena evidencia de que una arquitectura especializada de ingeniería puede mejorar el AI Code Review, pero no deberían interpretarse como una demostración de que Open Code Review sea superior a Claude Code en absolutamente todos los proyectos reales.

¿Por qué puede ser mejor para Review que Claude Code, Codex o Cursor?

La diferencia fundamental es bastante sencilla.

Claude Code, Codex y Cursor son Coding Agents generalistas. Pueden comprender requisitos, buscar código, modificar archivos, ejecutar pruebas, refactorizar proyectos y realizar Code Review.

El Review es solo una de muchas tareas posibles.

Open Code Review adopta el enfoque contrario:

no intenta convertirse en otro Coding Agent generalista; intenta especializarse en hacer Code Review correctamente.

Un Agent generalista resulta más adecuado para una petición como:

“Revisa este proyecto y corrige los problemas que encuentres.”

Open Code Review está más orientado a:

“Este es un PR. Revísalo siguiendo estas reglas, analiza de forma completa los cambios relevantes, encuentra los problemas que realmente merecen atención y coloca cada comentario en el lugar correcto.”

Esto significa que ambas aproximaciones no tienen por qué competir directamente.

De hecho, Open Code Review ofrece integraciones con Claude Code, Codex, Cursor y OpenCode, además de un Delegation Mode que permite utilizar el modelo del Coding Agent existente para ejecutar el Review mientras OCR se encarga de organizar el alcance, las reglas y el proceso.

Para quienes ya utilizan Claude Code o Codex, Open Code Review se entiende mejor como una capa especializada de Review, no como un sustituto.

Tokens y velocidad: donde aparece su verdadero valor

Open Code Review utiliza la licencia open source Apache-2.0 y no cobra una suscripción por el software. Sin embargo, ejecutar la herramienta sigue requiriendo un LLM, por lo que existen costes asociados al modelo.

Y el AI Code Review tiene una característica especialmente problemática: puede ejecutarse todos los días, sobre cada PR e incluso sobre múltiples commits.

Si un Agent generalista necesita buscar archivos repetidamente, volver a cargar contexto y utilizar numerosas herramientas para revisar un PR, el consumo de Tokens puede crecer rápidamente.

Open Code Review intenta reducir ese coste mediante selección determinista de archivos, matching de reglas, división por archivos, conjuntos de herramientas controlados y gestión del contexto.

El objetivo es limitar la exploración libre del Agent a las partes donde realmente hace falta razonamiento.

La investigación publicada indica que su consumo de Tokens puede ser aproximadamente 5–15 veces inferior al de un Agent generalista, aunque la proporción concreta depende del modelo y de la configuración utilizada en la evaluación.

Esta eficiencia es precisamente lo que hace interesante a Open Code Review para CI/CD.

El proyecto ofrece integración con GitHub Actions y también admite GitLab CI, GitFlic CI y Gerrit. GitHub Actions permite además configurar parámetros como el esfuerzo de Review, el tiempo máximo de las tareas y el timeout del LLM.

Experiencia de uso: sencillo en CLI, pero no completamente automático

El flujo básico es bastante directo:

Instalar OCR → configurar el LLM → ejecutar ocr review → revisar comentarios → modificar el código → volver a ejecutar el Review.

La herramienta admite interfaces compatibles con OpenAI y también la API de Anthropic. La configuración oficial permite utilizar modelos Claude y puede reutilizar determinadas variables de entorno relacionadas con Claude Code.

Pero hay un punto que conviene tener claro:

el LLM sigue siendo la principal variable de coste y calidad.

Open Code Review no puede convertir mágicamente un modelo mediocre en un Reviewer excelente.

Su función es conseguir que el modelo disponible utilice mejor sus capacidades de razonamiento durante el proceso de Review. No sustituye la capacidad intrínseca del modelo.

ocr scan resulta especialmente interesante para proyectos desconocidos, pero revisar un repositorio completo es naturalmente más caro que analizar únicamente un PR.

Además, los Issues actuales muestran que los grandes procesos de Scan todavía presentan problemas de ingeniería relacionados con aspectos como la recuperación después de una interrupción y el consumo de Tokens.

¿Para quién merece la pena?

PerfilValoraciónMotivo
------:---
Desarrolladores individuales★★★★☆Puede actuar como segundo Reviewer, especialmente en PR importantes
Usuarios de Claude Code / Codex★★★★★Complementa el Agent existente sin necesidad de sustituirlo
Mantenedores de proyectos open source★★★★★El Review automático de PR y la reducción del ruido son especialmente útiles
Equipos pequeños y medianos★★★★★Permite incorporar AI Review progresivamente al CI/CD
Grandes empresas★★★★★Las reglas, los costes, los procesos y la observabilidad facilitan su uso a escala
Personas que programan ocasionalmente★★☆☆☆El coste de configurar el LLM y las reglas puede superar los beneficios

Ventajas y desventajas

Ventajas

  • Diseñado específicamente para AI Code Review
  • Buena Precision y F1 en los Benchmarks publicados
  • Consumo reducido de Tokens
  • Localización de comentarios más fiable
  • Tratamiento estructurado de Diff grandes
  • Compatible con varios modelos y Coding Agents
  • Integración con CI/CD
  • Open source, extensible y con reglas de Review personalizables

Desventajas

  • El Recall no es su principal fortaleza
  • La calidad final sigue dependiendo del LLM
  • Configurarlo y mantenerlo es más complejo que simplemente pedir a Claude Code que revise un Diff
  • Puede pasar por alto problemas que requieren un conocimiento profundo de la lógica de negocio
  • Los Scan de gran escala siguen teniendo un coste considerable
  • Que el software sea open source y gratuito no significa que el LLM ni la infraestructura de CI/CD sean gratuitos

¿Merece la pena utilizar Open Code Review?

Sí, especialmente si ya estás utilizando AI Coding en proyectos reales.

Pero su verdadero interés no está simplemente en que Alibaba haya publicado otra herramienta de AI Code Review.

Lo importante es la idea de ingeniería que hay detrás:

un AI Agent no siempre funciona mejor cuanto más libertad tiene. Para tareas como Code Review, imponer suficientes límites de ingeniería puede hacerlo más fiable y eficiente.

Si solo utilizas Claude Code, Codex o Cursor ocasionalmente para revisar un fragmento de código, probablemente no necesitas desplegar Open Code Review.

La situación cambia cuando el AI Coding forma parte habitual del desarrollo y quieres integrar el Review directamente en GitHub PR, CI/CD, reglas de código de equipo y procesos de desarrollo de proyectos grandes.

Ahí es donde Open Code Review empieza a tener mucho más sentido.

Su verdadero objetivo no es responder simplemente a la pregunta “¿puede la IA encontrar Bugs?”, sino a una pregunta mucho más práctica:

¿Puede revisar de forma estable el código que realmente necesita ser revisado, encontrar problemas relevantes utilizando el menor número posible de Tokens y colocar cada comentario exactamente donde el desarrollador debe actuar?

Esa es la diferencia fundamental frente a un Coding Agent generalista.

Valoración final

CriterioPuntuación
------:
Detección de Bugs4,4/5
Precisión del Review4,7/5
Comprensión del contexto4,5/5
Localización de comentarios4,8/5
Diff grandes4,7/5
Velocidad de Review4,6/5
Coste de Tokens4,9/5
CI/CD4,8/5
Facilidad de uso4,0/5
Puntuación global4,6/5

Conclusión: Open Code Review no pretende sustituir a Claude Code, Codex o Cursor. Su objetivo es convertir el AI Code Review de una tarea que un Coding Agent generalista puede hacer de forma ocasional en un sistema de ingeniería especializado. Su principal innovación no consiste simplemente en utilizar IA, sino en utilizar restricciones de ingeniería deterministas para controlar cómo utiliza la IA su capacidad de razonamiento.

Lo que hace Open Code Review

  • Disenado especificamente para AI Code Review
  • Buena precision y F1 en benchmarks publicados
  • Consumo reducido de tokens frente a coding agents generalistas
  • Localizacion fiable de comentarios en lineas concretas
  • Tratamiento estructurado de diffs grandes
  • Compatible con varios modelos y coding agents
  • Integracion con CI/CD como GitHub Actions y GitLab CI
  • Codigo abierto, extensible y con reglas de review personalizables

Starter: empieza con Open Code Review