Ox Alphaのパフォーマンス:ベンチマーク、レイテンシ、コーディングテスト - ベンチマーク

Ox Alphaのパフォーマンス:ベンチマーク、レイテンシ、コーディングテスト

スループット、レイテンシ、信頼性、コーディング、マルチモーダル入力、長時間実行のエージェントワークロードにおけるOx Alphaのパフォーマンスを確認します。

2026-08-22
Ox Alpha Wikiチーム
クイックガイド
  • Ox Alphaのパフォーマンスは、コーディング能力、持続的な推論、プロダクション向けのエージェントワークフローを組み合わせたものです。
  • スループットは主要プロバイダーで毎秒23トークンと記載されていますが、測定期間によって変動します。
  • レイテンシはプロバイダー表示でP50が5.30秒と報告されており、より広範なダッシュボード平均も確認できます。
  • 信頼性は、報告された3日間の期間で稼働率99.99%、可用性99.51%に達しました。
  • 最適な用途には、ソフトウェアエンジニアリング、視覚コンテキストを扱うタスク、長期的な自動化が含まれます。

Ox Alphaのパフォーマンス概要

Ox Alphaは、コーディング、持続的なエージェント作業、複雑な問題解決、プロダクションワークロード向けに構築された推論モデルです。そのパフォーマンス特性は単一の速度スコアだけで決まるものではありません。実際の有用性には、応答品質、コンテキスト容量、ツールの信頼性、マルチモーダル処理能力などが影響します。

このモデルは2026年8月20日にリリースされ、匿名の第三者プロバイダーが運用するステルスモデルとして提示されています。OpenRouterはリクエストをそのプロバイダーへ転送しますが、所有権や開発責任を主張していません。報告されたプレビュー期間中、このモデルはトークン料金なしで掲載されています。

指標報告結果意味
コンテキストウィンドウ100万トークン大規模なリポジトリ、長文書、長期的なタスク履歴に適しています
プロバイダー数1プロバイダールーティングの選択なしにリクエストが直接転送されます
プロバイダーのスループット23 tok/s主要プロバイダー表示におけるP50スループット
プロバイダーのレイテンシ5.30秒記載されたP50の往復レイテンシ
ツール呼び出しエラー率2.27%報告されたツール呼び出しの平均失敗率
キャッシュヒット率81.72%報告されたプロバイダーのキャッシュ性能
3日間の稼働率99.99%少なくとも1つのプロバイダーが応答していた期間の割合
3日間の可用性99.51%正常に処理されたリクエストの割合

動画のハイライト:

  • ワンショットのコーディングデモでは、ボクセルスタイルのMinecraft風環境をゼロから構築しようとしています。
  • テストされたサバイバルフローよりも、クリエイティブモードの方が使いやすい様子が示されています。
  • 生成されたデモには、クラフト、アニメーションする豚、洞窟、道具、落下ダメージ、音楽、採掘インタラクションが含まれています。
  • 移動中やその後のワールド操作で、フリーズやランタイムエラーが発生しています。
  • このデモは実用的な能力の一例として有用ですが、標準化されたベンチマークではありません。

最も重要な結論は、Ox Alphaが意欲的なコーディングタスクに有望である一方、検証が依然として必要だということです。大容量のコンテキストウィンドウとマルチモーダル対応は大きな強みですが、観測されたフリーズやツールエラーにより、無人運用では監視が不可欠です。

パフォーマンスの読み方

ダッシュボードの指標と実用的なデモは、補完的な証拠として扱ってください。ダッシュボードはサービスの挙動を測定し、ワンショットの構築デモは、プレッシャーのあるオープンエンドなタスクにモデルがどのように対応するかを示します。

スループット、レイテンシ、信頼性

Ox Alphaのパフォーマンスデータは、測定範囲を考慮して読み取る必要があります。プロバイダーパネルには毎秒23トークンとP50レイテンシ5.30秒が記載されています。より広範なOpenRouterダッシュボードでは、全ロケーションと3日間の期間を対象に、個別のパーセンタイル平均が報告されています。

これらの数値は必ずしも矛盾しているわけではありません。プロバイダー単位のP50と全ロケーションのパーセンタイル平均では、異なるサンプル、期間、トラフィック条件、集計方法が使われる可能性があります。計画時には、固定された保証値ではなく、目安となる範囲として利用してください。

測定ビュースループットレイテンシ範囲
プロバイダー表示23 tok/s5.30秒 P50主要プロバイダー表示
P50ダッシュボード平均36 tok/s3.38秒 P50全ロケーション、報告されたダッシュボードサンプル
P75ダッシュボード平均49 tok/s7.16秒 P75高レイテンシのリクエストを含む
P90ダッシュボード平均60 tok/s14.39秒 P90より遅いリクエストの裾野
P95ダッシュボード平均69 tok/s22.35秒 P95長時間の応答遅延
P99ダッシュボード平均85 tok/s51.16秒 P99ロングテールの挙動

インタラクティブなコーディングでは、P50レイテンシが一般的なリクエストを反映するため、最も体感しやすい指標です。自動化では、P90からP99の方が重要になります。多数の逐次呼び出しを行うワークフローでは、中央値が応答性に優れている場合でも、時折発生する遅い応答の影響を受ける可能性があります。

エンドツーエンドのレイテンシは、生成、ツール実行、アプリケーション処理、追加の往復通信を含む場合があるため、基本的なリクエストレイテンシよりも高くなります。

エンドツーエンドのパーセンタイル平均レイテンシ
P5016.65秒
P7531.24秒
P9061.69秒
P9593.22秒
P99235.27秒

報告された稼働率と可用性は、プレビューモデルとしては有望です。ただし、可用性が稼働率を下回っていることから、これらの指標を分けて考える必要があります。サービスは監視期間のほぼ全体で応答していても、リクエストの失敗や上流エラーが発生する可能性があります。

レイテンシに関する警告

無人エージェントの規模を中央値のレイテンシだけを基準に決めないでください。遅いリクエストや失敗したリクエストに備えて、リトライ、タイムアウト、チェックポイント、明確な復旧状態を追加してください。

コーディングおよびエージェントワークロードへの適合性

Ox Alphaは、ソフトウェアエンジニアリング、持続的なエージェントタスク、プロダクション指向のワークロード向けに明確に位置付けられています。そのため、リポジトリ規模の作業はオプション機能ではなく、モデルの中核的な特性です。

モデルの100万トークンのコンテキストウィンドウは、多数のファイル、大量のログ、設計文書、または過去の意思決定が長く連なるタスクで役立ちます。ただし、大容量のコンテキストが正しい推論を自動的に保証するわけではありません。チームは、焦点を絞ったプロンプト、意味のあるファイル境界、テスト主導のフィードバックを引き続き提供する必要があります。

リポジトリ分析

  • 大容量のコンテキスト
  • ファイル間の関係把握に有用
  • マージ前に出力を確認

長期的なタスク

  • 長期計画に対応
  • 段階的な実行に適している
  • フェーズ間でチェックポイントを使用

プロダクションワークフロー

  • 運用ワークロード向けに設計
  • エラーとレイテンシを監視
  • リスクの高い変更には人間の承認を維持

視覚コンテキスト

  • 画像と動画の入力に対応
  • テキストと視覚的証拠を組み合わせ可能
  • 解釈を個別に検証

実用的なワークフローでは、計画と実行を分離する必要があります。まず、Ox Alphaにリポジトリを調査させ、依存関係を特定します。次に、明確な受け入れ基準を指定して、限定的な実装を依頼します。最後に、テストを実行して差分を確認し、広範な書き直しではなく、対象を絞った修正を依頼します。

ワークロード期待される利点推奨される管理方法
コードベース調査大容量コンテキストにより、同じファイルを繰り返し読み込む必要を減らせる編集前に調査結果を要約する
複数ファイルのリファクタリング持続的なタスク処理により、意図を維持しやすくなる可能性がある小さなバッチに分けて変更を適用する
バグ診断推論とログ分析が関連する強みコードを変更する前に問題を再現する
テスト生成コーディング重視の特性がテスト指向のプロンプトを支援テストを独立して実行する
エージェント自動化長期的な設計が多段階ワークフローに適合リトライと人間によるチェックポイントを追加する
ビジュアルデバッグ画像と動画の入力により証拠の範囲が広がる視覚的な結論をコードやログで確認する

実用的なボクセルワールドのデモは、Ox Alphaが高レベルのプロンプトから複雑なコーディングプロジェクトに挑戦できるという考えを裏付けています。クラフト、移動、環境要素、道具、採掘、アニメーション、音楽など、複数の認識可能なシステムを生成しました。同時に、フリーズやランタイムエラーも発生しており、生成されたソフトウェアにデバッグと段階的な検証が必要であることを示しています。

最適なコーディング方法

Ox Alphaは、分析、実装ドラフト、リファクタリング計画、テスト作成に活用してください。実行状況を可視化し、プロダクション変更を受け入れる前にテストまたはレビューを必須にしてください。

マルチモーダル入力と実用的なテスト

Ox Alphaは、テキスト、画像、動画を入力として受け取り、テキストを返すモデルとして説明されています。そのため、ソースコードとスクリーンショット、インターフェースの録画、図、製品デモなどを組み合わせるタスクに適しています。

マルチモーダル性能は、広範な想定ではなく、具体的な評価セットを用いてテストする必要があります。有用なテストには、既知の画像または動画、検証可能な答えを求める質問、観察と推論を区別できる採点方法が含まれます。

1

証拠を定義する

チームが実際に行うタスクを代表するスクリーンショット、図、短い動画を少数選びます。プロンプトを送る前に、期待される事実を記録します。

2

構造化された指示を追加する

Ox Alphaに、目に見える観察、不確かな結論、推奨アクションを分けて示すよう依頼します。これにより、視覚的な誤りを特定しやすくなります。

3

グラウンドトゥルースと比較する

名前、場所、状態、測定値、コード参照を信頼できるデータと照合します。自信のある回答を正確性の証明とみなしてはいけません。

4

ワークフローの価値を測定する

応答時間、修正回数、ツールの失敗、必要な手動レビュー量を記録します。最初の回答だけでなく、ワークフロー全体を比較します。

ソフトウェアチームにとって、視覚コンテキストはUIリグレッション分析、図の解釈、バグのトリアージ、ドキュメントレビューに活用できます。エージェント構築者にとっては、1つのタスクでリポジトリのコンテキストとスクリーンショットや録画された挙動を組み合わせられる可能性があります。

実用的なデモは、重要なテスト原則も示しています。モデルは多くの目に見える機能を生成できても、状態が変化すると失敗する可能性があります。移動時のフリーズ、インタラクションの問題、後半で発生するランタイムエラーは、短時間の初回確認では現れない場合があります。そのため、テストには反復操作、再読み込み、状態遷移、エラーからの復旧を含める必要があります。

テスト領域推奨チェック成功の指標
画像理解インターフェース要素や図のラベルを特定する目に見える事実と推測を正しく分離する
動画理解操作と状態変化を説明するイベントを創作せず、順序を追跡する
UIデバッグ期待される画面状態と実際の状態を比較するテスト可能なトラブルシューティング手順を生成する
コードと視覚情報の組み合わせスクリーンショットを関連ファイルに結び付ける正しい実装箇所を参照する
長時間セッション複数ターンにわたってタスクを継続する制約と過去の意思決定を維持する
マルチモーダルに関する注意

画像と動画への対応により入力形式は広がりますが、グラウンドトゥルースによる確認が不要になるわけではありません。視覚的なプロンプトは証拠として使用し、自動的に真実を示すものとはみなさないでください。

セットアップ、監視、評価チェックリスト

OpenRouterは、モデルスラッグ stealth/ox-alpha を使用したOx Alpha向けのOpenAI互換APIパスを提供しています。クイックスタートには、OpenRouter APIキー、環境変数、モデル名を指定したリクエストが必要です。アプリケーションで段階的な出力が必要な場合は、ストリーミングを有効にできます。

提供された料金データでは、このモデルの入力および出力コストはゼロと記載されています。第三者が運用するプレビュー版であるため、機密情報を送信する前に、適用されるStealth Model Termsとデータ取り扱い条件を確認する必要があります。

1

APIキーを作成する

OpenRouter APIキーを生成し、OPENROUTER_API_KEY などの環境変数として保存します。認証情報をソースファイルに直接記述しないでください。

2

モデルを選択する

リクエストモデルを stealth/ox-alpha に設定します。OpenRouter互換エンドポイント、またはドキュメントに記載されたリクエスト形式に対応するSDKを使用してください。

3

必要に応じてストリーミングを有効にする

インターフェースで部分的な出力が役立つ場合は、ストリーミングを追加します。バッチジョブでは、非ストリーミング応答の方が収集とログ記録を簡素化できる場合があります。

4

運用上の制御を追加する

モデルに長時間のエージェント作業を許可する前に、リクエストタイムアウト、リトライ回数の上限、ログ記録、出力検証、チェックポイントを設定します。

5

結果をレビューする

テストを実行し、ファイルの変更を確認し、ツール出力を検証します。元の受け入れ基準を満たす変更だけを承認してください。

OpenRouterのOx Alpha APIおよびプロバイダーページには、現在のモデルスラッグ、料金表示、プロバイダー指標、パラメーター、クイックスタート例が掲載されています。また、第三者による運用であることと、プレビュー条件についても説明されています。

パフォーマンスレビューのチェックリスト:

  • リクエストがstealth/ox-alphaモデルスラッグを使用していることを確認する
  • 可能な場合はP50、P90、P99のレイテンシを追跡する
  • ツール呼び出しの失敗とリトライ動作を測定する
  • 代表的なリポジトリを使って大容量コンテキストのプロンプトをテストする
  • 画像と動画の回答を既知の証拠と照合して検証する

優れた評価では、タスク完了の品質を、時間やレビュー作業を含む運用コストと比較する必要があります。記載されたトークン料金はゼロですが、エラーの修正に費やすエンジニアリング時間は、実際のワークフローコストの一部として残ります。

導入のヒント

まずは読み取り専用の分析とコード提案から始めてください。代表的なタスクでOx Alphaが精度、レイテンシ、復旧要件を満たした後にのみ、権限を拡大します。

Ox Alphaのパフォーマンスに関するFAQ

Q: Ox Alphaのパフォーマンスでは何を測定しますか?

コーディングおよび推論能力、スループット、レイテンシ、ツール呼び出しの信頼性、コンテキスト容量、マルチモーダル入力対応、稼働率、可用性が含まれます。単一の指標だけでモデルの完全な使用感を説明することはできません。

Q: Ox Alphaは無料で使用できますか?

提供されたOpenRouterの料金ページでは、報告されたプレビューについて入力および出力トークンの料金がゼロと記載されています。利用状況、制限、規約は変更される可能性があるため、依存関係を構築する前に現在のプロバイダーページを確認してください。

Q: Ox Alphaはどのくらい速いですか?

プロバイダー表示では、毎秒23トークン、P50レイテンシ5.30秒と記載されています。より広範なダッシュボード表示では、P50で毎秒36トークン、3.38秒など、異なるパーセンタイル平均が報告されています。そのため、結果は測定範囲によって異なります。

Q: Ox Alphaはプロダクションエージェントに適していますか?

プロダクションワークロードと持続的なエージェント作業向けに設計されていますが、プレビュー版であること、単一プロバイダーによるホスティング、ツール呼び出しエラー、ロングテールレイテンシがあるため、リトライ、監視、チェックポイント、人間によるレビューなどの安全策が必要です。

最終レビュー

Ox Alphaはコーディングと長期的なタスクに強い特性を持っていますが、プロダクションに導入する前に、観測されたデモとプレビュー指標を自分たちのワークロードに照らして検証する必要があります。