- Ox Alpha 채팅 완성은
stealth/ox-alpha모델 식별자를 사용합니다. - 인증에는 Bearer 토큰으로 전송되는 Tokenra API 키가 필요합니다.
- 요청 형식은 익숙한 OpenAI 스타일의 messages 배열을 따릅니다.
- 추론 모드는 지원되는 경우
reasoning.enabled: true로 활성화합니다. - 응답 데이터는 주로
choices[0].message.content에 나타납니다.
Ox Alpha 채팅 완성 한눈에 보기
Ox Alpha 채팅 완성은 stealth/ox-alpha 모델로 대화형 메시지를 전송하기 위한 서버 측 API 인터페이스를 제공합니다. 기본 요청은 JSON을 사용하며 model과 messages라는 두 필드가 필요합니다. 선택적 제어 항목을 사용하면 추론, 출력 길이, 샘플링 및 도구 동작을 조정할 수 있습니다.
이 통합은 익숙한 채팅 완성 구조를 기반으로 설계되었습니다. 각 메시지에는 role과 content가 포함되므로 애플리케이션은 사용자 프롬프트와 필요에 따라 시스템 또는 어시스턴트 컨텍스트를 전송할 수 있습니다. 따라서 이 엔드포인트는 채팅 인터페이스, 내부 도구, 자동화 워크플로 및 구조화된 애플리케이션 기능에 적합합니다.
공식 Ox Alpha API 문서에는 필요한 요청 구조, 인증 헤더, 사용 가능한 매개변수 및 성공적인 응답 형식이 설명되어 있습니다.
모델
요청 본문에 정확한 식별자 stealth/ox-alpha를 사용합니다.
메시지
role과 content 값이 포함된 대화 객체 배열을 전송합니다.
추론
추론 옵션을 활성화하여 프로바이더가 제공하는 추론 필드를 요청합니다.
응답
choices[0].message.content에서 생성된 답변을 읽습니다.
| 요구 사항 | 값 | 목적 |
|---|---|---|
| 모델 | stealth/ox-alpha | Ox Alpha 모델 선택 |
| 메시지 | 배열 | 대화 컨텍스트 제공 |
| 콘텐츠 유형 | JSON | 요청 본문 형식 지정 |
| 인증 | Bearer 토큰 | API 호출 인증 |
먼저 model과 messages만 사용하세요. 기본 완성 요청이 예상한 응답을 반환한 후 생성 제어 항목이나 도구를 추가합니다.
인증 및 첫 번째 요청
API 키는 신뢰할 수 있는 서버 또는 보호된 백엔드에 보관해야 합니다. 사용자가 확인할 수 있는 브라우저 JavaScript, 공개 저장소, 모바일 번들 또는 기타 클라이언트 측 패키지에 운영 키를 포함하지 마세요.
인증에는 Authorization 헤더의 Tokenra API 키가 사용됩니다. 값은 Bearer 토큰 규칙을 따릅니다. 또한 요청에는 Content-Type: application/json을 사용하여 JSON 콘텐츠임을 지정해야 합니다.
HTTP-Referer 및 X-Title 헤더는 선택적 메타데이터입니다. 애플리케이션을 식별하거나 프로바이더 순위 관련 컨텍스트를 제공할 수 있지만, 기본 요청에 필요한 헤더로 명시되어 있지는 않습니다.
API 키를 안전하게 저장
TOKENRA_API_KEY와 같은 서버 측 환경 변수에 Tokenra API 키를 저장합니다. 소스 제어 시스템 외부에 키를 보관하고 로그에 출력하지 마세요.
JSON 본문 준비
model을 stealth/ox-alpha로 설정하고 messages 배열을 제공합니다. 각 메시지에는 유효한 role과 텍스트 콘텐츠가 포함되어야 합니다.
POST 요청 전송
Ox Alpha가 문서로 안내하는 Chat Completions 엔드포인트에 서버 측 POST 요청을 보냅니다. Bearer 인증 헤더와 JSON 콘텐츠 유형을 포함합니다.
어시스턴트 메시지 읽기
JSON 응답을 파싱하고 choices[0].message.content를 확인하여 생성된 완성 결과를 가져옵니다.
간단한 JavaScript 패턴을 사용하면 배포 세부 정보를 하드코딩하지 않고 엔드포인트를 구성할 수 있습니다:
const response = await fetch(process.env.CHAT_COMPLETIONS_URL, {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.TOKENRA_API_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
model: "stealth/ox-alpha",
messages: [
{
role: "user",
content: "What AI model are you?"
}
]
})
})
const data = await response.json()
const answer = data.choices?.[0]?.message?.content
| 헤더 | 필수 여부 | 권장 값 |
|---|---|---|
Authorization | 필수 | Bearer ${TOKENRA_API_KEY} |
Content-Type | 필수 | application/json |
HTTP-Referer | 선택 사항 | 애플리케이션 URL |
X-Title | 선택 사항 | 애플리케이션 이름 |
운영 API 키를 브라우저 코드, 공개 Git 저장소, 클라이언트 측 번들, 스크린샷 또는 오류 메시지에 절대 노출하지 마세요.
요청 매개변수 및 생성 제어
필수 요청 본문은 의도적으로 간단하지만, Ox Alpha는 여러 선택적 제어 항목을 지원합니다. 각 매개변수는 애플리케이션의 생성 처리 방식에 영향을 주므로 필요한 경우에만 선택적으로 사용하세요.
max_tokens는 생성할 수 있는 최대 토큰 수를 제한합니다. temperature는 샘플링 다양성을 변경하며, top_p는 누적 확률 범위에 따라 선택을 제한합니다. 문서에 명시된 기본값은 temperature의 경우 1, top-p의 경우 0.95입니다. top_k의 기본값은 0이며 각 생성 단계에서 고려할 후보 토큰 수를 제한할 수 있습니다.
추론은 독립적인 Boolean 값이 아니라 객체를 통해 제어됩니다. 애플리케이션에서 프로바이더가 추론 관련 필드를 반환해야 하고 선택한 서비스가 이를 지원하는 경우 reasoning.enabled를 true로 설정합니다.
| 매개변수 | 유형 | 문서화된 기본값 | 용도 |
|---|---|---|---|
model | 문자열 | 없음 | 필수 모델 식별자 |
messages | 배열 | 없음 | 필수 대화 입력 |
reasoning | 객체 | 없음 | 추론 동작 제어 |
max_tokens | 정수 | 없음 | 생성 출력 길이 제한 |
temperature | 실수 | 1 | 샘플링 다양성 제어 |
top_p | 실수 | 0.95 | 누적 토큰 확률 제한 |
top_k | 정수 | 0 | 단계별 후보 토큰 수 제한 |
tools | 배열 | 없음 | OpenAI 형식 도구 정의 |
tool_choice | 문자열 또는 객체 | 없음 | 도구 선택 제어 |
예측 가능한 출력
스타일의 다양성보다 일관성이 중요할 때는 낮은 temperature를 사용합니다.
더 긴 답변
인터페이스에서 표시하고 저장할 수 있는 응답 크기에 맞춰 max_tokens를 설정합니다.
도구 워크플로
애플리케이션에 도구 실행 경로가 있는 경우에만 tools를 제공하고 tool_choice를 구성합니다.
실용적인 구성은 작업에 맞춰야 합니다.
- 분류 또는 추출의 경우 출력 형식을 제한하고 보수적인 샘플링 설정을 우선합니다.
- 브레인스토밍의 경우 합리적인 출력 제한을 유지하면서 더 다양한 샘플링을 허용합니다.
- 도구 호출의 경우 도구 스키마를 명확하게 정의하고 실행 전에 반환된 인수를 검증합니다.
- 추론이 활성화된 요청의 경우 반환된 필드 중 어떤 항목을 저장, 표시 또는 제외할지 결정합니다.
문서에서는 temperature, top_p, top_k를 별도의 제어 항목으로 설명합니다. 테스트 중에는 한 번에 하나의 샘플링 전략만 변경하여 그 효과를 파악할 수 있도록 하세요.
응답 형식 및 애플리케이션 처리
성공적인 응답은 채팅 완성 구조를 사용합니다. 생성된 어시스턴트 메시지는 choices[0].message.content에 있습니다. 응답에는 식별자, 객체 유형, 생성 타임스탬프, 선택된 모델, 프로바이더 정보, 완성 상태 및 사용량 세부 정보도 포함됩니다.
추론이 활성화되어 있고 사용 가능한 경우 choices[0].message.reasoning 및 choices[0].message.reasoning_details를 확인합니다. 이러한 필드에는 프로바이더가 제공하는 추론 출력이 포함될 수 있으므로 애플리케이션의 개인정보 보호, 보안 및 제품 요구 사항에 따라 처리해야 합니다.
finish_reason 필드는 생성이 중지된 이유를 설명합니다. stop과 같은 값은 정상적인 완료를 나타내며, 토큰 제한 상태는 구성된 출력 제한에 도달했을 가능성이 있음을 의미합니다.
| 응답 경로 | 의미 | 애플리케이션 용도 |
|---|---|---|
id | 완성 식별자 | 추적 로그 및 지원 요청 |
model | 생성에 사용된 모델 | 라우팅 및 구성 확인 |
choices[0].message.content | 주요 어시스턴트 응답 | 생성된 텍스트 표시 또는 처리 |
choices[0].message.reasoning | 사용 가능한 경우의 추론 텍스트 | 선택적이고 안전하게 처리 |
choices[0].message.reasoning_details | 구조화된 추론 세부 정보 | 필요한 경우에만 확인 |
choices[0].finish_reason | 완성 중지 상태 | 정상 또는 제한된 출력 감지 |
usage.total_tokens | 전체 프롬프트 및 완성 토큰 수 | 요청 사용량 모니터링 |
usage.cost | 보고된 요청 비용 | 서비스 사용량 메타데이터 검토 |
모든 선택적 속성이 존재한다고 가정하지 말고 방어적으로 파싱하세요. 유효한 애플리케이션은 비어 있는 choices 배열, 누락된 content 값, 사용할 수 없는 추론 필드 및 예상하지 못한 완료 상태를 충돌 없이 처리해야 합니다.
choices[0].message.content를 기본 출력으로 처리하고, 선택적 추론 필드는 응답에 실제로 존재하는지 확인한 후에만 확인하세요.
프로덕션 체크리스트 및 FAQ
Ox Alpha 통합을 출시하기 전에 요청 경로, 비밀 정보 처리, 응답 파서 및 운영 안전장치를 확인하세요. 일반적인 완성 요청뿐 아니라 빈 출력, 긴 프롬프트, 도구 호출 또는 불완전한 생성과 같은 예외 상황도 테스트해야 합니다.
프로덕션 준비 체크리스트:
- Tokenra API 키를 서버 측 환경 변수에 저장
- 정확한 stealth/ox-alpha 모델 식별자 사용
- model과 messages를 JSON 요청 본문으로 전송
- choices[0].message.content를 방어적으로 파싱
- 사용자에게 노출하기 전에 reasoning 및 usage 필드 검토
| 테스트 영역 | 확인할 내용 | 통과 조건 |
|---|---|---|
| 인증 | Bearer 토큰 및 비밀 정보 저장 | 자격 증명을 노출하지 않고 요청이 작동함 |
| 요청 본문 | 모델 및 메시지 필드 | JSON이 문서화된 구조와 일치함 |
| 생성 | 제한 및 샘플링 제어 | 출력이 제품 요구 사항에 맞음 |
| 추론 | 선택적 추론 필드 | 필드가 없어도 파싱이 중단되지 않음 |
| 완성 상태 | finish_reason | 애플리케이션이 정상 및 제한된 출력을 처리함 |
| 사용량 | 토큰 메타데이터 | 프롬프트를 유출하지 않고 로그를 통해 모니터링할 수 있음 |
지속적인 유지 관리를 위해 엔드포인트 구성을 애플리케이션 로직과 분리하세요. 적절한 경우 요청 식별자와 완성 상태를 기록하되, 명확한 운영상 필요가 없다면 민감한 프롬프트, API 키 또는 프로바이더가 반환한 추론을 기록하지 마세요.
Q: Ox Alpha 채팅 완성에 필요한 모델 식별자는 무엇인가요?
문서에 명시된 모델 식별자는 `stealth/ox-alpha`입니다. 기본 요청에는 `messages` 배열도 필요합니다.
Q: Ox Alpha 요청에 필요한 헤더는 무엇인가요?
`Authorization` 헤더에 Bearer Tokenra API 키를 사용하고, `Content-Type: application/json`으로 본문을 전송합니다. `HTTP-Referer`와 `X-Title`은 선택 사항입니다.
Q: 생성된 응답은 어디에 있나요?
주요 어시스턴트 응답은 `choices[0].message.content`에서 읽습니다. 애플리케이션에서 정상 완료와 제한으로 인한 완료를 구분해야 하는 경우 `finish_reason`도 확인하세요.
Q: 요청에서 추론은 어떻게 작동하나요?
`enabled`를 `true`로 설정한 `reasoning` 객체를 추가합니다. 추론을 사용할 수 있는 경우 관련 값이 어시스턴트 메시지의 `reasoning` 및 `reasoning_details` 아래에 나타날 수 있습니다.
공식 Ox Alpha API 문서를 2026-08-22에 다시 확인하고, 프로바이더 구성이 변경될 때마다 검토하세요.