Ox AlphaはGLMなのか:根拠・ベンチマーク・アクセスガイド - 正体

Ox AlphaはGLMなのか:根拠・ベンチマーク・アクセスガイド

Ox AlphaとGLMの理論を支える根拠、ベンチマーク結果、モデル機能、OpenRouterでのアクセス方法、そして主要な不確実性を検証します。

2026-08-22
Ox Alpha Wikiチーム
クイックガイド
  • Ox AlphaはGLMという説は、公式な特定ではなく、証拠に基づく仮説です。
  • コンテキストウィンドウ:OpenRouterでは、Ox AlphaとGLM 5.3のどちらも1,048,576トークンと記載されています。
  • 性能面のシグナル:独立したテストでは、Ox Alphaはいくつかのモデル比較で上位に位置しています。
  • 最も強い手がかり:動画トークンとトークナイザーのフィンガープリントが、GLMファミリーのシステムと一致すると報告されています。
  • 現在のアクセス:OpenRouterでは、Ox Alphaの入力・出力トークン料金は100万トークンあたり$0と記載されています。

Ox AlphaはGLMなのか:この説が意味すること

Ox Alphaは、Open Codeを通じて公開された匿名のAIモデルで、その後OpenRouter上でStealthプロバイダーのラベルが付けられて掲載されました。中心となる疑問は、この非公開モデルがZ.aiの次世代GLMシステムであり、GLMマルチモーダルファミリーと関係している可能性があるかどうかです。現在の証拠はこの説を妥当なものにしていますが、モデルの正体を事実として確定するものではありません。

このモデルが注目を集めたのは、1,048,576トークンのコンテキストウィンドウ、マルチモーダル入力への対応、データ保持を行わないという主張、そして初期ベンチマークでの優れた結果を兼ね備えているためです。Open Codeは2026年8月のテスト期間中、一時的な無料アクセスも提供しており、コミュニティで大きな関心と利用を生み出しました。

動画のハイライト:

  • Ox AlphaはKingbenchの評価で、80点中70点を獲得したと報告されています。
  • 制御されたテスト全体で、動画トークンの挙動がGLM 5V Turboと一致したと報告されています。
  • 25個のプロンプトで、トークナイザーのカウントがGLM 5.3と一致したと報告されています。
  • モデルの文体と音声入力に対する挙動は、既存のGLMシステムに似ています。

入手可能な証拠は、製品発表ではなく、モデルを特定するための調査として読むべきです。「Ox Alpha」という名称は、ステルスチェックポイント、一時的な評価用エイリアス、あるいは未公開のGLM製品ではないもののGLMと技術を共有するシステムを指している可能性があります。

属性Ox AlphaGLM 5.3
掲載プロバイダーStealthZ.ai
コンテキスト長1,048,576トークン1,048,576トークン
OpenRouterの入力料金100万トークンあたり$0100万トークンあたり$1.40
OpenRouterの出力料金100万トークンあたり$0100万トークンあたり$4.40
公開上の正体未確認公式にZ.aiと関連付けられている
編集上の要点

「Ox AlphaはGLM」という説は、確認済みのリリース名ではなく、現在最有力の仮説として扱ってください。観測された挙動と、モデルの開発元に関する主張は分けて考える必要があります。

Ox AlphaとGLMを結び付ける証拠

GLMとの関連を示す根拠は、複数の独立したシグナルに基づいています。どれも単独では決定的ではありませんが、文体やベンチマークスコアを単純に比較するよりも、これらを組み合わせた方が多くの情報を得られます。

最も注目すべき手がかりは、報告されている動画エンコーダーのフィンガープリンティングです。制御されたテストでは、フレームレート、動画の長さ、解像度を変化させた際に、異なるモデルが動画入力をどのようにトークン化するかを比較しました。Ox Alphaは、これらの条件全体でGLM 5V Turboと一致するトークン数を示したと報告されています。具体的には、似たフレームサンプリング、毎秒約147トークン付近での同等の長さへのスケーリング、そして解像度の変化に伴う同様の変動が確認されたとされています。

2つ目の手がかりは、テキストのトークン化です。Ox Alphaは25個のプロンプトで、GLM 5.3のトークナイザーのカウントと一致したと報告されています。トークナイザーが近似していることは、共有された、またはほぼ同一の語彙を示唆する可能性がありますが、2つのモデルが同じ組織によって訓練されたことを証明するものではありません。トークナイザーの再利用は、ライセンス、インフラの選択、互換性を重視した設計によっても起こり得ます。

証拠のカテゴリー報告されたOx Alphaの挙動重要性信頼性の限界
動画のトークン化GLM 5V Turboのパターンと一致関連するマルチモーダル処理を示唆フィンガープリントは再現されたり、誤って解釈されたりする可能性がある
テキストトークナイザー25個のプロンプトでGLM 5.3と一致非常に類似した語彙を示す共有語彙は開発元の証明にはならない
応答スタイル絵文字で装飾された形式がGLMやQwenの出力に類似文体上の関連性を支持スタイルはチューニングで模倣できる
音声への挙動GLM 5Vと同様に音声入力を拒否音声対応システムとの区別に役立つ機能設定はデプロイ環境によって異なる可能性がある
モデルの履歴過去のステルスリリースは中国の研究所と関連していたと報告されている背景的な裏付けを加える過去のパターンだけではこのモデルを特定できない

この調査では、DeepSeek、Qwen、Xiaomi、西側の研究機関などに関係する複数の代替仮説も検討され、否定されたと報告されています。モデルの帰属を判断する際には、一致する手がかりを見つけることと同じくらい、矛盾するフィンガープリントを除外することが重要であるため、これらの排除にも意味があります。

しかし、この説には重要な空白も残っています。Ox AlphaがGLMモデルであることを確認するZ.aiの公式声明はありません。公開上のプロバイダーラベルは依然としてStealthであり、OpenRouterの比較ページもOx AlphaをZ.aiのリリースとして特定していません。公式発表、技術的な開示、またはプロバイダーによる更新が行われるまでは、責任ある結論は、Ox AlphaがGLMに関連している可能性が最も高いというものであり、GLM 5.5であると断定することではありません。

強いシグナル

複数の制御条件下で、動画トークンの挙動がGLM 5V Turboと一致したと報告されています。

補強するシグナル

25個のプロンプトで、テキストトークナイザーのカウントがGLM 5.3と一致したと報告されています。

未解決の問題

開発元や最終的なモデル名を確認する公式プロバイダー発表はありません。

過剰な主張を避ける

高いベンチマークスコア、見慣れた文体、または一致するトークナイザーは帰属を裏付ける材料になりますが、いずれも単独でOx AlphaがZ.aiによって作られたことを証明するものではありません。

ベンチマーク結果とモデル性能

Ox Alphaの性能も、GLM説が注目を集めた大きな理由です。報告されたKingbenchのテストの1つでは、モデルは80点中70点、87.5%に相当するスコアを獲得しました。この結果は、同じテストに掲載された複数の他のフロンティアモデルを上回り、91.25%のGLM 5.3に次ぐ2位に位置しました。

個別の結果では、3JSのコンタクトレンズ問題、Panda SVGタスク、難度の高い順列問題、Gemmaのファインチューニングタスクで満点を獲得しました。また、エレベーターシミュレーションと弓矢タスクでも良好な成績を示しました。一方、折りたたみテーブルの問題と3D腕時計のタスクではスコアが低くなりましたが、後者は多くのシステムにとって非常に難しい問題だと説明されています。

別の10タスクからなるDeepSWAサブセットでは、80%の結果が得られたと報告されています。このスコアは、Fable 5、GLM 5.3、Grok 4.6、GPT 5.6 Soulについて示された比較結果を上回りました。ただし、サンプルはわずか10タスクで構成されているため、安定した普遍的ランキングではなく、有望なシグナルとして扱うべきです。

評価Ox Alphaの結果比較対象解釈
Kingbench70/80、87.5%GLM 5.3:91.25%引用されたリーダーボードの上位に近い
DeepSWAサブセット80%Fable 5:65%小規模サンプルでの強い結果
3JSコンタクトレンズタスク10/10指定なし優れた視覚的または構造化推論のシグナル
Panda SVGタスク10/10指定なし構造化生成で高い性能
Gemmaファインチューニングタスク10/10多くのモデルが苦戦したと報告注目すべき技術的能力
3D腕時計タスク7/10モデル全体で難題難しいプロンプトに対して堅実な結果

この2つの評価の違いは特に重要です。Ox AlphaはKingbenchではGLM 5.3を下回りましたが、引用されたDeepSWAサブセットでは大幅に上回りました。これは、Ox Alphaがあらゆる形式の一発生成に最適化されているというより、エージェント型コーディング、ツール指向の作業、または複数ステップの実行に向けて調整されている可能性を示しています。

OpenRouterの公開比較では、運用面でも異なる特徴が示されています。Ox Alphaのp50レイテンシは5.74秒、スループットは毎秒22トークンと記載されています。一方、GLM 5.3は3.07秒、毎秒36トークンです。実用上は、Ox Alphaは記載上のトークン料金なしで高い能力を提供する一方、確認された比較ではよりゆっくり応答する可能性があります。

運用指標Ox AlphaGLM 5.3実用上の意味
p50レイテンシ5.74秒3.07秒掲載された比較ではGLM 5.3の方が高速に応答
p50スループット毎秒22トークン毎秒36トークンGLM 5.3の方が速くテキストを生成
最大出力131Kトークン131Kトークンどちらも大きな出力上限に対応
コンテキスト長105万トークン105万トークンどちらも非常に長いプロンプトに対応
Artificial Analysisデータ利用不可提供された比較には記載なし普遍的な知能スコアを推測しない
データの最適な活用方法

Ox Alphaのベンチマーク結果は、特に構造化コーディングやエージェント型タスクなど、有望な用途を見つけるために活用してください。ただし、既存モデルを置き換える前に、自分のプロンプトでテストを行いましょう。

Ox Alphaを段階的に評価する方法

慎重な評価では、1つの印象的なスコアではなく、再現可能なタスクに焦点を当てるべきです。以下の手順を使えば、プロンプトや作業内容の違いを抑えながら、Ox AlphaをGLM 5.3や別のモデルと比較できます。

1

作業内容を定義する

コードのデバッグ、長文書の分析、構造化されたSVG生成、数学的推論、マルチモーダルな検査など、現実的なタスクを3~5個選びます。タスクの定義は一定に保ってください。

2

同一のプロンプトを使う

同じプロンプト、添付ファイル、コンテキスト、出力制限、ツール権限で実行します。片方のモデルの応答を見た後に指示を変更することは避けてください。

3

品質と速度を記録する

正確性、未完了の手順、フォーマットエラー、レイテンシ、スループット、そしてモデルが制約に従ったかどうかを記録します。時間がかかっても、優れた回答は有用な場合があります。

4

難しいケースを繰り返す

失敗例や惜しい結果を少なくとも1回は再実行します。小規模なベンチマークサブセットでは結果が大きく変動する可能性があるため、反復試験によってより信頼できるシグナルが得られます。

5

プライバシーとコスト設定を確認する

機密文書を送信したり、本番ワークフローを構築したりする前に、現在のプロバイダーポリシー、データ保持条件、料金、レート制限を確認します。

公平に比較するには、品質、信頼性、速度、コスト、統合作業量を別々の列にした簡単なスコアカードを作成してください。重み付けが実際の優先事項を反映していない限り、すべての要素を1つの数値にまとめないようにしましょう。

テスト領域推奨される測定項目重要性
コーディングテスト合格数、導入されたバグ実用的な実装品質を示す
長文脈保持された事実、回答できた参照事項大規模なコンテキストウィンドウの活用度を測る
マルチモーダル作業視覚的な正確性、フォーマット遵守画像や動画の理解能力をテストする
エージェント型実行完了した手順、ツールエラー複数段階のタスクにおける信頼性を反映する
運用レイテンシ、スループット、可用性ワークフローへの適合性を判断する
テストの原則

最適なモデルは作業内容によって異なります。Ox Alphaの現在の結果は有望ですが、重要な判断ではリーダーボードへの期待よりも、自分の環境でのテストを重視すべきです。

アクセス、機能、現在の制限

Ox Alphaは、StealthのAPIアクセス可能なモデルとしてOpenRouterに掲載されています。比較ページには、1,048,576トークンのコンテキストウィンドウ、マルチモーダル入力、ツール使用機能、ストリームキャンセル、プロンプトを学習に使用しないという表示が記載されています。一方、量子化の詳細や、Artificial Analysisによる知能・コーディング・エージェント性能のスコアなど、一部の項目は不明または利用できません。

このモデルは、2026年8月の一時的なアクセス期間中、無料モデルとしても宣伝されました。報告された無料期間は2026年8月27日頃に終了する予定でしたが、利用可能状況、料金、レート制限は変わる可能性があります。一時的な条件を前提に長期運用のアプリケーションを計画する前に、現在のモデルページを確認してください。

機能現在の掲載状況計画時の注意点
コンテキストウィンドウ1,048,576トークン大規模なリポジトリや長文書に役立つ
マルチモーダル入力対応と記載利用するクライアントで正確なファイル形式やメディア形式を確認する
音声入力拒否されたと報告マルチモーダル表示だけで音声対応と判断しない
ツール使用対応と記載関数スキーマとエラー回復をテストする
プロンプト学習なし対応と記載機密情報を扱う前に、プロバイダーの現在のポリシーを確認する
量子化不明ハードウェアや精度に関する前提は利用できない
トークン料金掲載ページでは100万トークンあたり$0導入前に現在のアクセス条件を確認する
データ利用量掲載された30日間で3.07兆トークン大規模な利用を示すが、品質そのものを示すものではない

現在のアクセス情報を確認するための最も有用な公開情報源は、OpenRouterの比較ページです:OpenRouterでOx AlphaとGLM 5.3を比較。このページでは、プロバイダーの設定とアカウントのアクセス権が適用されるものの、モデルスラッグを変更すれば同じAPI統合を使って2つのモデルを切り替えられることも明確にされています。

Ox Alphaを使用する前に:

  • 現在のモデルスラッグとプロバイダーの利用可能状況を確認する
  • 料金、レート制限、一時的な無料アクセスの状況を確認する
  • 代表的なプロンプトで画像、動画、ツール使用の入力をテストする
  • 現在使用しているモデルとレイテンシおよびスループットを比較する
  • データ保持条件を確認するまで、機密情報を送信しない
利用可能状況は変わる可能性があります

2026年8月の無料アクセス期間は一時的な情報です。Ox Alphaを本番ワークロードで利用する前に、OpenRouterの最新掲載情報とプロバイダーポリシーを確認してください。

結論とよくある質問

入手可能な証拠は、Ox AlphaとGLMエコシステムの間に強い関連があることを示しています。特に、報告された動画トークンのフィンガープリントとトークナイザーの挙動がGLMシステムと一致している点は重要です。ベンチマーク結果も、コーディング、構造化生成、エージェント型ワークフローで特に高い効果を発揮する可能性のある、能力の高いモデルであることを示しています。

それでも、正体に関する疑問は解決していません。最も安全な編集上の結論は、**「おそらくGLMに関連しており、次世代のマルチモーダルチェックポイントである可能性はあるが、公式には確認されていない」**というものです。この表現なら、調査結果を事実に変えてしまうことなく、最も有用な結論を保てます。

Q: Ox AlphaがGLMだと公式に確認されていますか?

いいえ。入手可能な証拠はGLMとの関連を示していますが、Ox AlphaをZ.aiまたはGLMのリリースとして特定する公式確認はありません。

Q: なぜOx AlphaはGLMだと考えられているのですか?

主な手がかりは、GLM 5V Turboと一致すると報告された動画トークンの挙動、GLM 5.3と一致するトークナイザーのカウント、類似した応答スタイル、そして同等の音声入力制限です。

Q: Ox AlphaはGLM 5.3と比べてどの程度の性能ですか?

評価によって結果は異なります。Ox AlphaはKingbenchで87.5%、GLM 5.3は91.25%だったと報告されています。一方、別の10タスクのサブセットではOx Alphaが大きく上回りました。

Q: Ox Alphaは無料で使えますか?

提供された比較情報では、OpenRouterはOx Alphaの入力・出力トークン料金を100万トークンあたり$0と記載しています。ただし、2026年8月のアクセス期間は一時的なものだったため、現在の状況を確認する必要があります。

最終的な推奨

まずは管理された環境でOx Alphaを試験的に利用してください。長いコンテキスト、マルチモーダルモデルとしての位置付け、初期のコーディング結果はテストする価値がありますが、匿名のプロバイダーであるため慎重な判断が必要です。