Miles v0.1:プロダクションレベルのフロンティア後学習システム
Miles v0.1は、フロンティア規模の強化学習(RL)トレーニングを研究者や開発者に提供するために設計されたフルスタックのプロダクションレベルシステムであり、精度・効率・信頼性・拡張性を最優先に掲げている。
Miles v0.1は、フロンティア規模の強化学習(RL)トレーニングを研究者や開発者に提供するために設計されたフルスタックのプロダクションレベルシステムであり、精度・効率・信頼性・拡張性を最優先に掲げている。
WDCD v3.1パイロットデータでは、Gemini 2.5 Pro、GPT-5.5、Claude Opus 4.7、GPT-o3の4モデルが上昇し、Doubao Proのみが7.3点下落するという「4上昇・1下落」の構図が明確となった。
WDCD v3.1の5大シナリオクロス評価において、安全コンプライアンスシナリオが全モデルの守約能力の最大の弱点となり、Qwen3-maxが最下位の1.15/4点、GPT-5.5がトップの4/4点を記録し、最大スコア差は2.85点に達した。
8問のv2アンカー問題に対する3ラウンドのテストで、11モデルのR3平均誠実率はわずか22.7%に留まり、7回の完全崩壊(0点)が発生した。初期確認率100%から大幅に低下したこの結果は、連続的な圧力下で大多数のモデルが制約を維持できないこ
WDCD v3.1守約テストにおいて、Grok 4が97.50点で首位を獲得し、Qwen3 Maxは69.50点で11位(最下位)となった。両モデルの合計スコア差は28点に達する。
Doubao ProはSmokeテストにおいて材料制約スコアが90.90点から50.00点へと40.9点急落し、総合ランキングが82.16点から77.50点に低下した。一方、コード実行スコアは75.00点から100.00点へ上昇しており、変
GPT-o3の本日のSmokeベンチマーク総合スコアが96.93点から87.93点へ9点下落した。主因は資料制約ディメンションが95.00点から75.00点へ20点急落したことによる。
2026年8月19日のYZ Index Smoke速測では10モデルを対象に評価が行われ、Claude Opus 4.7とGPT-5.5が同率98.35点で当日首位を獲得した。Smokeは毎日10問の速測であり、短期的なシグナルの観察に適し
Doubao ProがSmoke評価テストにおいて、主要ランキングのスコアを94.74点から82.16点へと12.6ポイント落とし、特にコード実行ディメンションが100.00点から75.00点へと25ポイント急落した。ただし、サンプル数の少
Qwen3 MaxのSmokeベンチマーク総合スコアが前日の95.34点から86.98点へ8.4点下落し、とりわけ材料制約スコアが1日で16.5点という大幅な落ち込みを記録した。コード実行スコアは比較的安定を維持している。
2026年8月18日のYZ Index Smoke快速テストでは10モデルを対象に評価を実施し、GPT-o3が96.93点で当日首位を獲得した。上位モデルはコード実行次元で軒並み高得点を記録する一方、素材制約のスコア差が順位を左右する主要因
DeepSeek V4 ProがSmoke評価のメインランキングで70.44点から51.24点へと19.2点下落した。主な原因はコード実行ディメンションが66.70点から25.00点へと41.7点急落したことにある。
2026年8月17日のYZ Index Smoke速測では11モデルを対象に評価を実施し、Claude Opus 4.7とGrok 4が96.99点で当日首位に並んだ。Smokeは1日10問の速測であり、短期シグナルの観察に適している。
本日のSmoke評価テストにおいて、Claude Sonnet 4.6のコード実行スコアが100.00点から75.00点へと25点下落し、総合ランキングも80.52点から75.00点に後退した。ただし、サンプル数が少ないため、モデルの能力が
Claude Opus 4.7の本日のSmokeベンチマークでは、コード実行スコアが99.60点から75.00点に低下した一方、素材制約スコアが61.70点から100.00点に上昇し、総合ランキングのスコアは82.55点から86.25点へと
2026年8月10日〜16日のSmokeベンチマークにおいて、Claude Opus 4.7が週平均82.3点・変動幅20.7で全モデル中首位を獲得。一方、DeepSeek V4 ProとGemini 2.5 Proは大幅な下落を記録した。
2026年8月16日のYZ Index Smoke速測では11モデルを対象に評価が実施され、Claude Opus 4.7、GPT-5.5、GPT-o3、Grok 4の4モデルが86.25点で当日首位に並んだ。Smokeは毎日10問の速測で
DeepSeek V4 ProはSmokeテストにおいてコード実行次元のデータが完全に欠損し、素材制約スコアは55.60点にとどまった。メインランキングへの参加は不可能となっており、原因はモデル能力の低下ではなくAPIの障害と分析されている
本日のSmokeテストにおいて、GPT-5.5の材料制約スコアが15.2点下落した一方、コード実行スコアが30点上昇し、総合ランキングスコアは64.02点へと9.7点改善した。小サンプルによる抽選のばらつきが主因とみられ、モデル能力の構造的
2026年8月15日のYZ Index Smoke速測では、9モデルを対象にClaude Opus 4.7が82.55点で当日首位を獲得した。Smokeは1日10問の速測であり、短期シグナルの観測に適するが、Fullウィークリーランキングの