Ox Alpha deepswe:DeepSWEの結果と評価ガイド - ベンチマーク

Ox Alpha deepswe:DeepSWEの結果と評価ガイド

Ox AlphaのDeepSWE結果、モデルの手がかり、ベンチマークの限界、コンテキストウィンドウ、プライバシーリスク、実践的なテスト方法を解説します。

2026-08-23
Ox Alpha Wikiチーム
クイックガイド
  • Ox Alpha deepswe は、DeepSWEの限定的なサブセットでテストされた正体不明のモデルを指します。
  • 報告された結果:初回の10タスクのテストでは80%に達しましたが、後の実行では約63%に終わりました。
  • モデルのプロファイル:100万トークンのコンテキスト、テキスト・画像・動画入力、テキスト出力に対応しています。
  • 主な手がかり:トークナイザー、エラー文字列、デコード挙動、動画処理はGLMファミリーに類似しています。
  • 安全性の優先事項:提供元の身元が明らかになっていないため、プロンプトは保存されるものとして扱ってください。

Ox Alpha deepswe:この結果が実際に意味すること

Ox Alpha deepsweは、一般的なゲーム、アプリ、または消費者向け製品ではありません。OpenRouterとOpenCodeを通じて提供された匿名の推論モデルであり、コーディング、エージェント型ワークフロー、長いコンテキストを必要とするソフトウェアタスクに重点を置いています。最も広く繰り返された性能の主張は、初期のDeepSWEサブセットテストに基づくものでしたが、入手可能な証拠からは、その数値を完全なベンチマークスコアとして提示することはできません。

初回テストは10タスクを対象とし、Ox Alphaはそのうち8つを解決したと報告されています。これはサブセットで80%という結果になりますが、その後のより広範な実行では約**63%**に終わり、テスターはこの数値のほうが妥当だと説明しました。これらの数値は、安定したリーダーボード順位ではなく、探索的な測定結果として読むべきです。

動画のハイライト:

  • 匿名での提供と無料アクセスが、初期にこのモデルが注目を集めた中心的な要因でした。
  • このモデルは、コーディングエージェント、ツール呼び出し、構造化出力、推論強度の調整に対応しています。
  • テストが最初の10タスクのサブセットを超えると、DeepSWEの性能は変化しました。
  • フィンガープリントの証拠はGLMファミリーを示唆していますが、所有者を公に確認した研究機関はありません。
テストまたは主張報告された観察結果編集上の解釈
初回のDeepSWEサブセット80%、10タスク中8タスク興味深い兆候ですが、信頼できる順位付けにはサンプルが少なすぎます
後のDeepSWE実行63%最初の見出しより有用ですが、完全な評価ではありません
コンテキストウィンドウ1,048,576トークン大規模なリポジトリや長時間のエージェントセッションに適しています
出力上限131,072トークン長時間の推論とコード生成に対応します
利用可能性報告期間中は入力・出力ともに無料と記載利用を前提にする前に、現在の条件を確認してください
80%を完全なベンチマークスコアとして扱わないでください

80%という数値は10タスクから得られたものです。Ox Alphaが完全なDeepSWEベンチマークでより大規模なモデルを打ち負かした証拠として説明すべきではありません。

この主張を評価する読者にとって、後のBen DavisによるDeepSWEの更新のほうが重要な参考情報です。そこでは約63%の結果が説明されており、このモデルは特に長時間かつ複雑な作業において非常に高い能力を持つ一方、実行が遅く、時折デッドコードを残すと評価されています。

モデルのフィンガープリントと推定される系譜

有力な公開仮説は、Ox AlphaをZ.AIのGLMファミリーと結び付けています。この結論は、モデルカード、チェックポイント、公式声明ではなく、観察可能な挙動に基づいています。複数のテストでは、トークン化、エラー処理、決定論的デコード、動画処理において一致する結果が得られたと報告されています。

トークナイザーは、トレーニング前に選択され、デプロイ先が変わっても一貫性を保つ傾向があるため、比較に特に有用です。報告されたテストでは、複数の言語や書式のサンプルにおいて、Ox Alphaのトークン数はGLM 5.3と一致し、約75トークンの一定したオフセットがありました。このオフセットは、異なるトークナイザーではなく、追加されたシステム指示を示している可能性があります。

フィンガープリントの領域Ox Alphaの挙動比較上の手がかり
トークナイザーGLM 5.3のカウントに一定のオフセットを加えたものと一致共通または非常に近い前処理を示唆
エラー処理GLMの挙動に関連するエラー文字列を返した共通のバックエンドコードを示している可能性
貪欲デコード書式、数学的な句読点、回答スタイルが類似関連するモデルまたはデプロイスタックを裏付ける
動画入力フレームサンプリングとトークンコストが類似同じ視覚処理ファミリーを示唆
音声音声入力を拒否したと報告推定されるモデルファミリーと整合

動画テストも注目に値します。制御された動画クリップでは、再生時間、解像度、フレームレートを変更した場合を含め、GLM 5V Turboと一致するトークン数が得られたと報告されています。このモデルは動画入力を受け付けてテキストを出力する一方、テスト構成では音声を理解しないと説明されました。

もう一つの手がかりは、隠された身元に関する指示です。報告によれば、ある jailbreak によって、モデルは自らをOx Alphaと名乗り、非公開組織が開発したものであると説明し、別のモデルや企業名を挙げることを避けました。これは単に提供元のフィールドが欠落しているのではなく、意図的に匿名化されていることを示しています。

フィンガープリントの証拠の読み方

一致する挙動から、所属する可能性の高いファミリーやデプロイ上の関係を特定することはできます。しかし、チェックポイント、技術報告書、公式確認がなければ、所有者を確定することはできません。

証拠には限界もあります。システムプロンプトは、ほぼすべてのベースモデルに対して拒否応答を追加したり、書式を変更したり、身元に関する挙動を変えたりできます。類似したエラーメッセージは、共有された重みではなく、共通のインフラから生じている可能性もあります。最も責任ある結論は、Ox AlphaがGLMエコシステムと密接に関連しているように見える一方、正確な運営者は未検証だというものです。

強いシグナル

トークナイザーの一致と一貫した動画トークンの挙動は、直接測定できるため、簡単には無視できません。

中程度のシグナル

類似した書式、デコード上の癖、エラー文字列は、共通のデプロイまたはバックエンドという仮説を裏付けます。

未解決の問題

公開されたモデルカード、チェックポイント、署名付き技術報告書、所有権に関する声明のいずれも、提供元を確認していません。

DeepSWE評価:Ox Alphaを公平にテストする方法

DeepSWE形式のテストで測定されるのは、モデルが短い関数を書けるかどうかだけではありません。長期的なソフトウェアエンジニアリングタスクには、リポジトリの探索、計画、ツールの利用、デバッグ、コード変更、検証が必要です。小さなサンプルでは強そうに見えるモデルでも、タスクの種類が変わると結果に一貫性がなくなることがあります。

初期のOx Alphaの結果は、サンプル数が重要である理由を示しています。10タスク中8つの成功は決定的に聞こえますが、このように小さなサンプルには大きな不確実性があります。約63%という後の結果は、より慎重なシグナルであり、テスターの実務的な説明にもよく一致します。つまり、コード品質が高く複雑な作業への対応力も優れている一方、実行が遅く、時折コードが残るということです。

評価要素記録する内容重要な理由
タスク数完了したベンチマークタスクの数サンプルが大きいほど、見出しに引きずられた結論を避けられます
合格率試行したタスクに対する成功タスクの割合基本的な性能指標を提供します
パッチ品質正確性、保守性、不要な変更テストに合格しても、質の低いエンジニアリングを隠している可能性があります
実行時間最初に有用な出力が出るまでの時間と最終完了までの時間推論重視のモデルは高性能でも遅い場合があります
リポジトリ上の挙動探索、サブエージェント、テスト、ツール呼び出しモデルがエージェントとして機能するかを示します
リグレッション管理変更前後に合格したテスト見かけ上の修正によって既存の挙動が壊れるのを防ぎます

Ox Alpha deepsweの評価を再現する際は、次のプロセスに従ってください。

1

環境を固定する

すべての比較で同じリポジトリスナップショット、タスク指示、サンドボックス権限、モデル設定、ツール定義を使用します。日付を2026年8月として記録し、正確な構成を保存してください。

2

意味のあるタスクセットを実行する

10タスクだけを根拠に結論を出すことは避けてください。小さなサブセットしか使えない場合は、探索的な評価であることを明確にし、すべてのタスク結果を報告します。

3

合否以外も記録する

実行時間、推論レベル、出力長、ツール呼び出し、テスト結果、デッドコード、リグレッション、完了後に必要となった手動クリーンアップを記録します。

4

不安定なケースを再実行する

タイムアウト、ツールエラー、一貫性のない挙動によって失敗したタスクを再実行します。インフラの失敗とモデルの失敗を分けて扱ってください。

5

完全なコンテキストを公開する

タスク一覧、ハーネスのバージョン、プロンプト、設定、ログ、制限事項を含めます。サンプル数を示さずに単一のパーセンテージだけを公開しないでください。

推奨されるベンチマーク表記

「報告されたDeepSWE実行でOx Alphaは約63%を達成した」のような表現を使用し、「Ox AlphaはGPT-5.6に勝った」とは書かないでください。前者は文脈を維持しますが、後者は証拠を誇張しています。

入手可能な比較結果からは、Ox Alphaはコーディング作業において最先端クラスに近いものの、最先端を明確にリードしているわけではないことが示唆されます。最も実用的な問いは、すべてのリーダーボードで勝てるかどうかではありません。モデルが、許容できる精度、速度、コスト、レビュー工数で、あなたのリポジトリタスクを完了できるかどうかです。

アクセス、プライバシー、本番環境でのリスク

報告されたデプロイでは、100万トークンのコンテキストウィンドウ、マルチモーダル入力、ツール呼び出し、構造化出力、推論強度の調整が提供されていました。これらの機能により、Ox Alphaはリポジトリ分析、サブエージェントワークフロー、コードレビュー、大規模文書処理に適しています。

しかし、アクセス条件には重要なプライバシー上の矛盾がありました。あるインターフェースには、プロンプトと完了結果が提供元によって保持され、トレーニングには使用されないと記載されたバナーが表示されていたと報告されています。一方、OpenCodeでは同じモデルが「データ保持ゼロ」という表現で宣伝されていたとされています。提供元が明らかになっていなかったため、ユーザーには確認や問題のエスカレーションを行う明確な連絡先がありませんでした。

用途適合性推奨される管理策
公開されたコーディング演習高いサンドボックスを使用し、認証情報を削除する
合成リポジトリ高い再現可能な実験に適した環境
非公開の本番コード限定的まず保持、ログ記録、所有者を確認する
機密情報や顧客データ低い検証済みのプライバシー条件なしに送信しない
長時間のエージェント型タスク有望権限を制限し、すべての差分をレビューする

実際に使用する場合は、身元不明のホスト型モデルに対して行うのと同じ管理策を適用してください。

  • APIキー、パスワード、秘密証明書、顧客記録を削除する。
  • ファイルシステム権限を限定した使い捨てのリポジトリコピーを使用する。
  • 生成された変更をマージする前に、テストと人によるレビューを必須にする。
  • 大規模な自動書き換えよりも、小さく元に戻せるコミットを優先する。
  • 後から検査できるよう、ツール呼び出しと生成パッチを記録する。
  • エージェントが無関係なファイルを変更し始めたり、デッドコードを残したりした場合は停止する。
保持とトレーニングは同じではありません

データをトレーニングに使用しないという声明は、プロンプトが直ちに削除されることを必ずしも意味しません。保持条件が確認できるまでは、送信した資料が保存される可能性を前提にしてください。

報告された無料アクセス期間は、キャンペーン中に十分な利用上限が設定されたうえで、2026年8月27日に終了すると説明されていました。利用可能性や上限は変わる可能性があるため、この日付は恒久的なアクセス保証ではなく、報告された期限として扱ってください。

実用的な結論と評価チェックリスト

Ox Alphaは、エージェント評価をすでに理解しており、管理された環境内で安全に作業できる開発者にとって、試す価値があります。報告された強みには、長いコンテキストの処理、有用なコーディング挙動、サブエージェントのサポート、特徴的な会話スタイルがあります。約63%という後のDeepSWE結果により、当初の80%という見出しだけに頼るよりも、強力なコーディングモデルとしての信頼性が高まっています。

弱点も同様に重要です。高い推論レベルでは遅く感じることがあり、デッドコードを残す可能性があり、提供元の身元も透明ではありません。また、その系譜や長期的な信頼性を確定できる公開チェックポイントや再現可能な公式評価も存在しません。

最適な用途

サンドボックス化されたツール、受け入れテスト、手動での差分レビューを用いて、長時間のリポジトリタスクをテストする開発者。

慎重に使用

実行時間、出力の一貫性、保持ポリシーをまだ測定しているコーディングエージェント比較チーム。

現時点では避ける用途

機密性の高いソースコード、規制対象データ、認証情報、説明責任を負う提供元を必要とするワークフロー。

判断基準

リグレッション、セキュリティ上の露出、運用上の不確実性を増やさずにレビュー時間を短縮できるなら、採用を続ける。

実際のワークフローでOx Alphaを使用する前に:

  • 現在の提供元、保持ポリシー、アクセス条件を確認する
  • テスト入力から秘密情報と非公開の顧客情報を削除する
  • 10タスクの見出しに依存せず、代表性のあるタスクセットを実行する
  • 生成されたすべてのパッチに自動テストと人によるレビューを必須にする
  • 実行時間、リグレッション、デッドコード、クリーンアップ作業を記録する
結論

Ox Alphaは、意味のあるDeepSWEの証拠を持つ有望な匿名コーディングモデルです。しかし、変動するスコアと非公開の運営者を考慮すると、誇張ではなく慎重なテストが必要です。

Q: Ox Alpha deepsweとは何ですか?

匿名のコーディング・推論モデルであるOx Alphaについて報告されたDeepSWEテストを指します。よく知られている数値は、10タスクでの初回80%と、その後の約63%の実行結果です。

Q: Ox AlphaはDeepSWEで他の最先端モデルに公式に勝ちましたか?

入手可能な証拠から、その主張を正当化することはできません。80%という結果は小規模なサブセットから得られたものであり、後の結果は約63%でした。どちらも、完全かつ監査済みのリーダーボード上の勝利として扱うべきではありません。

Q: Ox AlphaはGLM 5.3と同じモデルですか?

それはまだ確認されていません。トークナイザーのカウント、エラー文字列、デコード挙動、動画トークンのパターンはGLMファミリーに類似していると報告されていますが、モデルの身元を公に検証した組織はありません。

Q: Ox Alphaは非公開コードに対して安全ですか?

注意して使用してください。報告されたインターフェースでは保持に関する説明が食い違っており、提供元も明らかになっていません。現在のプライバシー条件が独立して検証されるまでは、秘密情報、顧客データ、機密性の高いソースコードを送信しないでください。