- Las completions de chat de Ox Alpha utilizan el identificador de modelo
stealth/ox-alpha. - La autenticación requiere una clave de API de Tokenra enviada como token Bearer.
- El formato de la solicitud sigue la conocida matriz de mensajes al estilo de OpenAI.
- El modo de razonamiento se habilita con
reasoning.enabled: truecuando es compatible. - Los datos de respuesta aparecen principalmente en
choices[0].message.content.
Completions de chat de Ox Alpha de un vistazo
Las completions de chat de Ox Alpha proporcionan una interfaz de API del lado del servidor para enviar mensajes conversacionales al modelo stealth/ox-alpha. La solicitud básica utiliza JSON y requiere dos campos: model y messages. Los controles opcionales pueden ajustar el razonamiento, la longitud de salida, el muestreo y el comportamiento de las herramientas.
La integración está diseñada en torno a una estructura familiar de completions de chat. Cada mensaje incluye un role y un content, lo que permite a las aplicaciones enviar indicaciones del usuario y, cuando sea necesario, contexto del sistema o del asistente. Esto hace que el endpoint sea adecuado para interfaces de chat, herramientas internas, flujos de automatización y funciones estructuradas de aplicaciones.
La documentación oficial de la API de Ox Alpha describe la estructura requerida de la solicitud, los encabezados de autenticación, los parámetros disponibles y el formato de una respuesta correcta.
Modelo
Utiliza el identificador exacto stealth/ox-alpha en el cuerpo de la solicitud.
Mensajes
Envía una matriz de objetos de conversación con un valor de rol y contenido.
Razonamiento
Solicita los campos de razonamiento proporcionados por el proveedor habilitando la opción de razonamiento.
Respuesta
Lee la respuesta generada desde choices[0].message.content.
| Requisito | Valor | Propósito |
|---|---|---|
| Modelo | stealth/ox-alpha | Selecciona el modelo de Ox Alpha |
| Mensajes | Matriz | Proporciona el contexto de la conversación |
| Tipo de contenido | JSON | Da formato al cuerpo de la solicitud |
| Autenticación | Token Bearer | Autoriza la llamada a la API |
Comienza solo con model y messages. Añade controles de generación o herramientas después de que la completion básica devuelva la respuesta esperada.
Autenticación y primera solicitud
La clave de API debe permanecer en un servidor de confianza o en un backend protegido. No coloques una clave de producción en JavaScript del navegador, repositorios públicos, paquetes móviles ni otros paquetes del lado del cliente que los usuarios puedan inspeccionar.
La autenticación utiliza una clave de API de Tokenra en el encabezado Authorization. El valor sigue la convención de los tokens Bearer. Las solicitudes también deben declarar el contenido JSON mediante Content-Type: application/json.
Los encabezados HTTP-Referer y X-Title son metadatos opcionales. Pueden identificar la aplicación o proporcionar contexto para la clasificación del proveedor, pero no aparecen como encabezados obligatorios para una solicitud básica.
Guarda la clave de API de forma segura
Guarda la clave de API de Tokenra en una variable de entorno del lado del servidor, como TOKENRA_API_KEY. Mantén la clave fuera del control de versiones y evita imprimirla en los registros.
Prepara el cuerpo JSON
Establece model como stealth/ox-alpha y proporciona una matriz messages. Cada mensaje debe incluir un rol válido y contenido de texto.
Envía la solicitud POST
Realiza una solicitud POST del lado del servidor al endpoint de Chat Completions documentado por Ox Alpha. Incluye el encabezado de autorización Bearer y el tipo de contenido JSON.
Lee el mensaje del asistente
Analiza la respuesta JSON e inspecciona choices[0].message.content para obtener la completion generada.
Un patrón mínimo de JavaScript puede mantener configurable el endpoint sin codificar detalles de implementación:
const response = await fetch(process.env.CHAT_COMPLETIONS_URL, {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.TOKENRA_API_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
model: "stealth/ox-alpha",
messages: [
{
role: "user",
content: "What AI model are you?"
}
]
})
})
const data = await response.json()
const answer = data.choices?.[0]?.message?.content
| Encabezado | Estado requerido | Valor recomendado |
|---|---|---|
Authorization | Obligatorio | Bearer ${TOKENRA_API_KEY} |
Content-Type | Obligatorio | application/json |
HTTP-Referer | Opcional | URL de tu aplicación |
X-Title | Opcional | Nombre de tu aplicación |
Nunca expongas una clave de API de producción en código del navegador, repositorios públicos de Git, paquetes del lado del cliente, capturas de pantalla ni mensajes de error.
Parámetros de solicitud y controles de generación
El cuerpo de solicitud obligatorio es intencionadamente pequeño, pero Ox Alpha admite varios controles opcionales. Utilízalos de forma selectiva, ya que cada parámetro cambia la manera en que la aplicación gestiona la generación.
max_tokens limita el número máximo de tokens generados. temperature cambia la variedad del muestreo, mientras que top_p limita la selección a un rango de probabilidad acumulada. Los valores predeterminados documentados son 1 para temperature y 0.95 para top-p. top_k tiene un valor predeterminado de 0 y puede limitar el número de tokens candidatos considerados en cada paso de generación.
El razonamiento se controla mediante un objeto en lugar de un Boolean independiente. Establece reasoning.enabled en true cuando la aplicación necesite que el proveedor devuelva campos relacionados con el razonamiento y el servicio seleccionado los admita.
| Parámetro | Tipo | Valor predeterminado documentado | Uso |
|---|---|---|---|
model | Cadena | Ninguno | Identificador de modelo obligatorio |
messages | Matriz | Ninguno | Entrada de conversación obligatoria |
reasoning | Objeto | Ninguno | Controla el comportamiento del razonamiento |
max_tokens | Entero | Ninguno | Limita la longitud de la salida generada |
temperature | Flotante | 1 | Controla la variedad del muestreo |
top_p | Flotante | 0.95 | Limita la probabilidad acumulada de los tokens |
top_k | Entero | 0 | Limita los tokens candidatos por paso |
tools | Matriz | Ninguno | Define herramientas con formato OpenAI |
tool_choice | Cadena u objeto | Ninguno | Controla la selección de herramientas |
Salida predecible
Utiliza una temperature más baja cuando la coherencia sea más importante que la variación estilística.
Respuestas más largas
Establece max_tokens según el tamaño de respuesta que tu interfaz pueda mostrar y almacenar.
Flujos de herramientas
Proporciona tools y configura tool_choice solo cuando la aplicación tenga un flujo de ejecución de herramientas.
Una configuración práctica debe adaptarse a la tarea:
- Para clasificación o extracción, favorece una salida restringida y una configuración de muestreo conservadora.
- Para lluvia de ideas, permite una mayor variedad de muestreo manteniendo un límite de salida razonable.
- Para llamadas a herramientas, define claramente el esquema de la herramienta y valida los argumentos devueltos antes de ejecutarlos.
- Para solicitudes con razonamiento habilitado, decide qué campos devueltos deben almacenarse, mostrarse u omitirse.
La documentación enumera temperature, top_p y top_k como controles independientes. Cambia una sola estrategia de muestreo cada vez durante las pruebas para poder identificar su efecto.
Formato de respuesta y gestión en la aplicación
Una respuesta correcta utiliza la estructura de chat-completion. El mensaje generado del asistente se encuentra en choices[0].message.content. La respuesta también incluye un identificador, el tipo de objeto, la marca de tiempo de creación, el modelo seleccionado, información del proveedor, el estado de la completion y los detalles de uso.
Cuando el razonamiento está habilitado y disponible, inspecciona choices[0].message.reasoning y choices[0].message.reasoning_details. Estos campos pueden contener resultados de razonamiento proporcionados por el proveedor y deben gestionarse de acuerdo con los requisitos de privacidad, seguridad y producto de tu aplicación.
El campo finish_reason explica por qué se detuvo la generación. Un valor como stop indica una completion normal, mientras que un estado de límite de tokens señala que es posible que se haya alcanzado el límite de salida configurado.
| Ruta de respuesta | Significado | Uso en la aplicación |
|---|---|---|
id | Identificador de la completion | Registros de seguimiento y solicitudes de soporte |
model | Modelo utilizado para la generación | Confirma el enrutamiento y la configuración |
choices[0].message.content | Respuesta principal del asistente | Muestra o procesa el texto generado |
choices[0].message.reasoning | Texto de razonamiento cuando está disponible | Gestiona de forma selectiva y segura |
choices[0].message.reasoning_details | Detalles estructurados del razonamiento | Inspecciona solo cuando sea necesario |
choices[0].finish_reason | Estado de detención de la completion | Detecta una salida normal o limitada |
usage.total_tokens | Total de tokens del prompt y de la completion | Supervisa el consumo de las solicitudes |
usage.cost | Coste informado de la solicitud | Revisa los metadatos de uso del servicio |
Utiliza un análisis defensivo en lugar de asumir que todas las propiedades opcionales están presentes. Una aplicación válida debe gestionar una matriz choices vacía, un valor de contenido ausente, un campo de razonamiento no disponible y un estado de finalización inesperado sin bloquearse.
Trata choices[0].message.content como la salida principal y comprueba los campos de razonamiento opcionales solo después de confirmar que existen en la respuesta.
Lista de comprobación de producción y preguntas frecuentes
Antes de publicar una integración de Ox Alpha, verifica la ruta de solicitud, la gestión de secretos, el analizador de respuestas y las medidas de protección operativa. Prueba tanto las completions normales como casos extremos, como salidas vacías, prompts largos, llamadas a herramientas o generaciones incompletas.
Lista de comprobación de preparación para producción:
- Guarda la clave de API de Tokenra en una variable de entorno del lado del servidor
- Utiliza el identificador exacto de modelo stealth/ox-alpha
- Envía model y messages como cuerpo de una solicitud JSON
- Analiza choices[0].message.content de forma defensiva
- Revisa los campos de razonamiento y uso antes de mostrarlos a los usuarios
| Área de prueba | Qué verificar | Condición de aprobación |
|---|---|---|
| Autenticación | Token Bearer y almacenamiento del secreto | La solicitud funciona sin exponer credenciales |
| Cuerpo de la solicitud | Campos model y messages | El JSON coincide con la estructura documentada |
| Generación | Límites y controles de muestreo | La salida se ajusta a los requisitos del producto |
| Razonamiento | Campos de razonamiento opcionales | Los campos ausentes no interrumpen el análisis |
| Estado de la completion | finish_reason | La aplicación gestiona salidas normales y limitadas |
| Uso | Metadatos de tokens | Los registros permiten la supervisión sin filtrar prompts |
Para el mantenimiento continuo, mantén la configuración del endpoint separada de la lógica de la aplicación. Registra los identificadores de solicitud y los estados de completion cuando corresponda, pero evita guardar prompts confidenciales, claves de API o razonamientos devueltos por el proveedor salvo que exista una necesidad operativa clara.
Q: ¿Qué identificador de modelo requieren las completions de chat de Ox Alpha?
El identificador de modelo documentado es `stealth/ox-alpha`. Una solicitud básica también requiere una matriz `messages`.
Q: ¿Qué encabezados son obligatorios para una solicitud de Ox Alpha?
Utiliza una clave de API de Tokenra como token Bearer en el encabezado `Authorization` y envía el cuerpo con `Content-Type: application/json`. `HTTP-Referer` y `X-Title` son opcionales.
Q: ¿Dónde se encuentra la respuesta generada?
Lee la respuesta principal del asistente desde `choices[0].message.content`. También inspecciona `finish_reason` cuando tu aplicación necesite distinguir una completion normal de una limitada.
Q: ¿Cómo funciona el razonamiento en la solicitud?
Añade un objeto `reasoning` con `enabled` establecido en `true`. Cuando el razonamiento está disponible, pueden aparecer valores relacionados en el mensaje del asistente bajo `reasoning` y `reasoning_details`.
Vuelve a consultar la documentación oficial de la API de Ox Alpha el 2026-08-22 y cada vez que cambie la configuración de tu proveedor.