ベンチマーク結果

Ox Alpha ベンチマーク

Artificial AnalysisおよびコミュニティによるテストのOx Alphaベンチマーク結果と評価を紹介し、推論とコーディングにおける性能を扱います。

Ox Alpha のベンチマークとは?

ベンチマークは、標準化されたAI評価やコミュニティが設計したテストでOx Alphaがどの程度の性能を発揮するかを測定します。このカテゴリでは、Artificial Analysisや独立したレビュアーが公開した結果を追跡し、推論、コーディング、エージェントタスクの性能スコアを扱います。

ベンチマークを追う理由

1

実際の性能を比較する

標準化された推論・コーディング評価において、Ox Alphaが最先端モデルと比べてどのようなスコアを獲得するかを確認できます。

2

誇大広告に惑わされない

独立した評価結果やコミュニティテストを利用して、匿名で宣伝されているモデルの情報だけに頼らず性能を判断できます。

3

スコアの更新を追跡する

テスターが評価を再実行し、OpenRouterがモデル掲載情報を更新する中で、ベンチマーク結果がどのように変化するかを追えます。

注目・必読

すべてのベンチマーク

Ox Alpha deepswe:DeepSWEの結果と評価ガイド - benchmarks guide
ガイド

Ox Alpha deepswe:DeepSWEの結果と評価ガイド

Ox AlphaのDeepSWE結果、モデルの手がかり、ベンチマークの限界、コンテキストウィンドウ、プライバシーリスク、実践的なテスト方法を解説します。

Ox Alpha人工知能分析:機能とベンチマーク - benchmarks guide
ガイド

Ox Alpha人工知能分析:機能とベンチマーク

Ox Alphaの人工知能分析。コンテキスト、マルチモーダル入力、コーディングベンチマーク、3D生成、実践的な評価方法を解説します。

Ox Alphaベンチマーク結果:DeepSWEスコアと比較 - benchmarks guide
ベンチマークガイド

Ox Alphaベンチマーク結果:DeepSWEスコアと比較

報告されたDeepSWE 80%スコア、モデル比較、タスク別パフォーマンス、評価上の限界を含むOx Alphaのベンチマーク結果を確認します。

Ox Alphaベンチマーク:初期スコア、コンテキスト、モデル比較 - benchmarks guide
ガイド

Ox Alphaベンチマーク:初期スコア、コンテキスト、モデル比較

報告されているOx Alphaベンチマークの結果、コンテキストウィンドウ、マルチモーダル機能、信頼性の限界、競合AIモデルとの比較を確認します。

Ox Alpha evals:ベンチマーク、セットアップ、安全対策 - benchmarks guide
ガイド

Ox Alpha evals:ベンチマーク、セットアップ、安全対策

匿名AIモデル Ox Alpha の評価、報告されたベンチマーク、実践的なテスト方法、アクセス方法、プライバシー対策を紹介します。

Ox Alphaのパフォーマンス:ベンチマーク、レイテンシ、コーディングテスト - benchmarks guide
ガイド

Ox Alphaのパフォーマンス:ベンチマーク、レイテンシ、コーディングテスト

スループット、レイテンシ、信頼性、コーディング、マルチモーダル入力、長時間実行のエージェントワークロードにおけるOx Alphaのパフォーマンスを確認します。