- Resultados del benchmark de Ox Alpha: La puntuación reportada en DeepSWE alcanza el 80% en 10 tareas de ingeniería de software.
- Punto de comparación: El resultado es superior a las puntuaciones probadas de Fable 5.5, GLM 5.3, Grock 4.6 6 y GPT 5.6.
- Áreas más destacadas: Sobresalen el modelado 3D interactivo, la cinemática 3D y los prototipos funcionales de frontend.
- Contexto importante: Estas cifras proceden de una prueba reportada y limitada, no de una clasificación universal de modelos.
- Mejor uso: Considera la puntuación como una señal de evaluación y valida los resultados con tus propias pruebas repetibles.
Resultados del benchmark de Ox Alpha de un vistazo
Los resultados actuales del benchmark de Ox Alpha se centran en una puntuación del 80% en una prueba de programación SWE de DeepSWE con 10 tareas. Esta cifra sitúa a Ox Alpha por delante de los modelos de comparación incluidos en la misma prueba, aunque la muestra es demasiado pequeña para representar todas las cargas de trabajo de programación o las capacidades generales de un modelo.
El resultado ha atraído atención porque Ox Alpha apareció como un modelo sigiloso en OpenRouter y OpenCode, sin información pública confirmada sobre su creador en el material proporcionado. El perfil reportado del modelo incluye una ventana de contexto de 1 millón de tokens y compatibilidad con entradas de texto, imagen y vídeo. Estas capacidades pueden influir en su rendimiento en flujos de trabajo con contextos largos o multimodales, pero no deben considerarse una prueba de rendimiento en benchmarks fuera de las condiciones evaluadas.
Aspectos destacados del vídeo:
- Resultado reportado del 80% en 10 tareas de programación SWE de DeepSWE
- Comparación con los resultados de cinco modelos identificados
- Pruebas interactivas de programación, 3D, diseño, física y desarrollo full-stack
- Demostraciones destacadas en tareas 3D y de movimiento basadas en navegador
| Señal de evaluación | Resultado reportado | Lo que sugiere |
|---|---|---|
| Prueba SWE de DeepSWE | 80% | Rendimiento sólido en la muestra citada de 10 tareas |
| Ventana de contexto | 1 millón de tokens | Diseñada para contextos de texto o código muy extensos |
| Modos de entrada | Texto, imagen, vídeo | Admite interacción multimodal |
| Capacidad reportada | Hasta 100 billones de tokens al día | Una afirmación sobre la capacidad disponible, no sobre la calidad del modelo |
| Identidad pública | Sin confirmar | El origen del modelo sigue sin estar claro en las fuentes proporcionadas |
La interpretación más prudente es que Ox Alpha ha mostrado un resultado inicial prometedor, especialmente en ingeniería de software. Una puntuación de benchmark es más útil cuando se acompaña de detalles de las tareas, prompts, configuración de herramientas, gestión de errores y replicación independiente. Sin esos controles, un porcentaje aislado debe considerarse orientativo, no definitivo.
Usa la cifra del 80% como punto de partida para investigar. Es un resultado reportado notable, pero no demuestra que Ox Alpha vaya a superar a todos los modelos en todas las tareas de programación.
Comparación de puntuaciones de DeepSWE
La parte más clara de la comparación disponible es la diferencia entre Ox Alpha y los demás modelos incluidos en la misma prueba reportada. Ox Alpha obtuvo un 80%, mientras que Fable 5.5 alcanzó el 65%, GLM 5.3 el 62%, Grock 4.6 6 el 62% y GPT 5.6 el 52%.
Estos valores deben compararse con cuidado. El material proporcionado no incluye el conjunto completo de prompts, la rúbrica de evaluación, la temperatura, el acceso a herramientas, las versiones de los modelos ni información sobre si todos los sistemas utilizaron configuraciones idénticas. Por ello, la tabla registra las cifras reportadas sin presentarlas como una clasificación controlada.
| Modelo | Puntuación reportada | Diferencia frente a Ox Alpha | Interpretación |
|---|---|---|---|
| Ox Alpha | 80% | — | Resultado más alto en la prueba citada |
| Fable 5.5 | 65% | 15 puntos porcentuales | Segundo entre los resultados incluidos |
| GLM 5.3 | 62% | 18 puntos porcentuales | Resultado de comparación intermedio |
| Grock 4.6 6 | 62% | 18 puntos porcentuales | Empatado con GLM 5.3 en el informe |
| GPT 5.6 | 52% | 28 puntos porcentuales | Resultado más bajo de la lista |
El orden reportado es útil para identificar qué sistemas merecen pruebas de seguimiento. Es menos útil para realizar afirmaciones generales sobre razonamiento, fiabilidad, latencia o preparación para producción. Un modelo puede rendir bien en un subconjunto concreto de ingeniería de software y, aun así, requerir una revisión minuciosa de seguridad, mantenibilidad, documentación y casos extremos.
La puntuación de Ox Alpha superior al 80% en el subconjunto de DeepSWE también aparece mencionada por AGTP Insights en X, en una publicación del 21 de agosto de 2026. Esa publicación ofrece una referencia útil que respalda el resultado principal, pero el contenido disponible de la página no expone una metodología completa ni un desglose detallado de las puntuaciones.
Resultado principal
El 80% es la puntuación reportada clave y el principal motivo por el que Ox Alpha está recibiendo atención.
Ventaja relativa
El margen reportado es de 15 puntos sobre Fable 5.5 y de 28 puntos sobre GPT 5.6.
Precaución de evaluación
La muestra contiene 10 tareas, por lo que se necesitan pruebas más amplias antes de extraer conclusiones generales.
No combines estos porcentajes con resultados de benchmarks no relacionados. Los distintos conjuntos de datos, evaluadores, prompts y permisos de herramientas pueden cambiar considerablemente el resultado.
Señales de rendimiento tarea por tarea
La evaluación más amplia ofrece más que un porcentaje de programación. Ox Alpha fue probado en ilustración vectorial, modelado 3D, cinemática 3D, diseño de frontend, física de videojuegos y una aplicación full-stack. Como el tema es un modelo de IA y no un juego convencional, estos ejemplos se entienden mejor como demostraciones de capacidades.
Las impresiones más sólidas proceden de tareas que combinan generación e interacción. El organizador de pastillas 3D incluía siete compartimentos etiquetados, tapas que se abrían individualmente, pastillas, sombras y controles para abrir o cerrar todo. El elevador de tijera incluía un control deslizante que modificaba la altura de la plataforma mientras mantenía el movimiento conectado entre los brazos del mecanismo.
| Categoría de prueba | Resultado demostrado | Señal de calidad reportada |
|---|---|---|
| Ilustración vectorial | Ilustraciones SVG de un mapache y un zorro | Formas limpias y detalles reconocibles |
| Modelado 3D | Organizador semanal de pastillas con siete compartimentos | Materiales, etiquetas, sombras y controles realistas |
| Cinemática 3D | Elevador de tijera animado con control de altura | Movimiento fluido y piezas mecánicas conectadas |
| Diseño de frontend | Espacio de trabajo de descubrimiento de IA Observatory | Diseño pulido, vista previa en directo, animación y preguntas frecuentes |
| Física interactiva | Experiencia de tiros libres de baloncesto | Lanzamientos, puntuación, distancias, sonido y clasificación funcionales |
| Desarrollo full-stack | Panel de tareas con React y Python | API funcional, almacenamiento en base de datos y cambios de estado mediante arrastrar y soltar |
La prueba de diseño de frontend se centró en un espacio de trabajo de descubrimiento de IA llamado Observatory. La página generada utilizó una paleta de blanco cálido, casi negro y naranja eléctrico, con una sección principal, vista previa en directo, datos animados, pasos de flujo de trabajo, precios, contenido de preguntas frecuentes, una sección de llamada a la acción y un pie de página. Esto sugiere que Ox Alpha puede ensamblar una presentación completa de producto en lugar de generar únicamente un componente aislado.
La prueba full-stack destaca por su integración. El panel de tareas utilizó ReactJS para el frontend, Python FastAPI para el backend y SQLite para el almacenamiento. Los usuarios podían crear tareas, arrastrarlas entre columnas, cambiar su estado y conservar los datos mediante la capa de API de la aplicación. El resultado reportado estaba menos pulido visualmente que los ejemplos 3D, pero su cobertura funcional era más sólida que la de un mockup estático.
| Capacidad | Evidencia de la evaluación | Mejor interpretación |
|---|---|---|
| Generación visual | Personajes SVG y diseños de interfaces | Útil para crear conceptos rápidamente |
| Razonamiento espacial | Organizador de pastillas y elevador de tijera | Prometedor para escenas 3D estructuradas |
| Lógica de interacción | Controles deslizantes, botones, animaciones y controles | Puede conectar elementos visuales con comportamientos básicos |
| Arquitectura de aplicaciones | Panel de tareas con React, FastAPI y SQLite | Puede producir prototipos de varias capas |
| Lógica de juego | Puntuación de baloncesto y cambios de distancia | Puede implementar reglas interactivas sencillas |
Ox Alpha resulta especialmente convincente cuando una tarea requiere tanto resultados visuales como interacción funcional, sobre todo en prototipos 3D basados en navegador.
Cómo evaluar Ox Alpha por tu cuenta
Un benchmark práctico debe separar el atractivo visual de la corrección funcional. Empieza con un prompt fijo, registra la configuración del modelo y evalúa el resultado con criterios explícitos. Repetir la misma tarea varias veces puede revelar si un resultado sólido es consistente o excepcionalmente favorable.
El siguiente flujo de trabajo es adecuado para comparar Ox Alpha con otros modelos sin depender únicamente de una puntuación principal.
Define la tarea
Elige una tarea concreta, como un panel CRUD, una escena mecánica 3D, una ilustración SVG o una landing page adaptable. Escribe los criterios de aceptación antes de generar nada.
Fija las condiciones de prueba
Mantén constantes el prompt, los recursos de entrada, la longitud del contexto, los permisos de las herramientas y el formato de salida esperado. Registra la fecha como 22 de agosto de 2026 y anota cualquier cambio en la interfaz.
Evalúa la funcionalidad
Prueba las interacciones en lugar de juzgar únicamente las capturas de pantalla. Comprueba la persistencia de datos, el comportamiento de las animaciones, el diseño adaptable, la gestión de errores y si los controles producen el resultado solicitado.
Revisa la calidad del código
Inspecciona la estructura, los nombres, las dependencias, las prácticas de seguridad y la mantenibilidad. Un prototipo funcional puede seguir necesitando un trabajo de ingeniería considerable antes de utilizarse en producción.
Repite y compara
Ejecuta varios intentos y compara los mismos criterios entre modelos. Registra los fallos con el mismo cuidado que los resultados satisfactorios.
| Área de puntuación | Pregunta sugerida | Condición de aprobación |
|---|---|---|
| Requisitos | ¿Incluyó el resultado todas las funciones solicitadas? | No falta ningún requisito importante |
| Interacción | ¿Funcionan los controles, formularios y animaciones? | Las acciones principales se comportan como se describe |
| Fiabilidad | ¿Sigue funcionando el resultado después de utilizarlo varias veces? | No se produce ningún fallo inmediato durante la repetición de la prueba |
| Calidad del código | ¿Está la implementación organizada y es fácil de leer? | Otro desarrollador puede inspeccionarla y modificarla |
| Presentación | ¿Es clara y coherente la interfaz? | El diseño y la jerarquía respaldan la tarea |
| Seguridad | ¿Se gestionan correctamente las entradas, las API y el almacenamiento? | No hay valores predeterminados claramente inseguros ni secretos expuestos |
Un conjunto de pruebas útil debe incluir prompts sencillos y difíciles. Por ejemplo, combina una solicitud simple de SVG con una aplicación de varios pasos que requiera frontend, API, base de datos y transiciones de estado. Esto evita que un modelo parezca sólido basándose únicamente en el atractivo visual.
Lista de comprobación para revisar el benchmark:
- Registra el prompt exacto y la configuración del modelo
- Utiliza criterios de aceptación fijos antes de realizar la prueba
- Comprueba por separado la calidad visual y el comportamiento funcional
- Vuelve a probar las interacciones importantes y la persistencia de datos
- Documenta los fallos, las revisiones y la calidad final del resultado
Una prueba local repetible con criterios transparentes es más valiosa que una demostración impresionante realizada una sola vez. Mantén la tarea sin cambios al comparar versiones del modelo.
Qué significan los resultados para los desarrolladores
La evidencia disponible apunta a un modelo que podría ser útil para la creación rápida de prototipos en varios ámbitos. Los desarrolladores pueden explorar ideas en 3D, crear conceptos de frontend, ensamblar experiencias interactivas sencillas y generar puntos de partida full-stack. Los resultados reportados no eliminan la necesidad de depuración, revisión de código, pruebas ni comprobaciones de seguridad.
Para el trabajo de programación, el resultado del 80% en DeepSWE es la señal más importante. Para el desarrollo de productos, las demostraciones interactivas pueden ser igual de relevantes porque muestran cómo gestiona el modelo varios requisitos conectados. Un flujo de trabajo útil podría comenzar con un prototipo amplio y continuar con el refinamiento humano de la arquitectura y los casos extremos.
| Caso de uso | Por qué Ox Alpha puede ayudar | Revisión humana aún necesaria |
|---|---|---|
| Mockups iniciales de productos | Generación rápida de diseño, estilos y contenido | Accesibilidad, coherencia de marca y comportamiento adaptable |
| Prototipos 3D para navegador | Geometría, materiales, controles y animación | Rendimiento, precisión de las colisiones y compatibilidad con dispositivos |
| Estructuras iniciales full-stack | Frontend, API, base de datos y flujo de estado en un solo proyecto | Autenticación, validación, migraciones y despliegue |
| Experimentos educativos | Demostraciones visuales claras y ejemplos interactivos | Corrección, calidad de las explicaciones y cobertura de pruebas |
| Programación creativa | SVG, movimiento, física y conceptos de interfaz | Originalidad, pulido e implementación mantenible |
Siguen siendo importantes varias limitaciones:
- La comparación de DeepSWE utiliza una muestra reportada de 10 tareas.
- El material proporcionado no incluye un protocolo completo del benchmark.
- La propiedad o el creador del modelo no están confirmados en las referencias disponibles.
- Las demostraciones pueden enfatizar los resultados satisfactorios en lugar de las tasas de fallo.
- El rendimiento puede variar según el diseño del prompt, el contexto, las herramientas y las condiciones de ejecución.
- Un prototipo funcional no es automáticamente software listo para producción.
La compatibilidad reportada del modelo con entradas de texto, imagen y vídeo podría hacerlo atractivo para flujos de desarrollo multimodales. Sin embargo, las etiquetas de capacidad por sí solas no demuestran precisión. Si esas funciones son importantes para tu proyecto, prueba por separado la interpretación de imágenes, la comprensión de vídeo y la recuperación en contextos largos.
No publiques código generado ni comportamientos 3D generados sin revisión. Valida las dependencias, las entradas, el manejo de datos, el rendimiento y la recuperación ante fallos antes del despliegue.
Q: ¿Cuáles son los principales resultados del benchmark de Ox Alpha?
El resultado principal reportado es una puntuación del 80% en una prueba de ingeniería de software de DeepSWE que cubre 10 tareas. El mismo informe muestra puntuaciones inferiores para Fable 5.5, GLM 5.3, Grock 4.6 6 y GPT 5.6.
Q: ¿La puntuación del 80% de Ox Alpha es una clasificación universal?
No. Es el resultado de una prueba reportada y limitada. El material disponible no proporciona una metodología suficiente para considerarla una clasificación universal en todas las cargas de trabajo de programación, razonamiento, uso multimodal o producción.
Q: ¿Qué capacidades parecieron más sólidas en la evaluación general?
Destacaron el modelado 3D interactivo y la cinemática 3D, incluidos un organizador semanal de pastillas y un elevador de tijera con controles funcionales. El diseño de frontend y la creación de prototipos full-stack también mostraron una funcionalidad útil.
Q: ¿Quién creó Ox Alpha?
La información proporcionada no confirma quién está detrás de Ox Alpha. Se comentan públicamente varias posibilidades, pero siguen siendo especulaciones y no una propiedad verificada.
Vale la pena probar Ox Alpha para programación y creación de prototipos interactivos, pero compáralo mediante tareas repetibles en lugar de confiar en un único porcentaje de benchmark.