AIコーディング能力評価

154 件の記事 · ページ 1/8
どのAIモデルが最もコードを書けるのか?HumanEvalとMBPPは一般的なベンチマークですが、関数レベルの補完テストのみで、実際の開発シナリオとは乖離があります。YZ指数のコード実行次元(Execution)は、隔離されたサンドボックスでモデル生成の完全なプログラムを実行し、コンパイル通過率、ランタイムの正確性、エッジケース処理能力を検証します。モデル相互評価ではなく実際のコード実行検証を採用する数少ない独立ベンチマークの一つです。本トピックでは各モデルのコーディング能力ランキング、プログラミングツールの動向、AI支援開発の業界実践を追跡しています。
レビュー Gemini 2.5 Pro、誠実性評価でfail——プローブスコア25点、主要ランキング18.37点、コード実行23.50点
Gemini 2.5 ProがYZ Indexの2026-08-21 Run#288スモークテストで誠実性評価failを記録し、プローブスコア25.00点・主要ランキング18.37点という当日最低水準の結果を示した。コード実行・資料制約の両次元も低迷しており、引用生成における系統的な問題が指摘されて
2026/08/21
レビュー GPT-5.5のSmokeベンチマーク総合スコアが10.1点急落——資料制約スコアが1日で16.3点下落
GPT-5.5は本日のSmokeベンチマークにおいて総合スコアが98.35点から88.27点へと10.1点下落した。資料制約次元が100.00点から83.70点へと最大の下落幅を記録し、総合スコア低下の主因となった。
2026/08/20
レビュー Claude Opus 4.7の総合スコアが1日で8.2点急落、資料制約スコアは12.1点下落
Claude Opus 4.7は本日のSmoke評価テストで総合スコアが98.35点から90.16点へと8.2点下落した。主な要因は資料制約スコアの100.00点から87.90点への急落(-12.1点)と、コード実行スコアの97.00点から92.00点への低下(-5点)である。
2026/08/20
CursorがコードホスティングプラットフォームをリリースしGitHubに正面挑戦
AIコードエディター大手のCursorが、独自のAI機能を深く統合したコードホスティングプラットフォームを正式リリースし、業界の長期覇者GitHubへの挑戦を鮮明にした。
2026/08/19
レビュー Doubao Pro、材料制約スコアが1日で40.9点下落——コード実行は25点上昇、総合ランキングは4.7点低下
Doubao ProはSmokeテストにおいて材料制約スコアが90.90点から50.00点へと40.9点急落し、総合ランキングが82.16点から77.50点に低下した。一方、コード実行スコアは75.00点から100.00点へ上昇しており、変動はサンプル抽選による分散が主因とみられる。
2026/08/19
レビュー Doubao Pro、主要ランキングで12.6ポイント急落――コード実行が単日で25ポイント下落
Doubao ProがSmoke評価テストにおいて、主要ランキングのスコアを94.74点から82.16点へと12.6ポイント落とし、特にコード実行ディメンションが100.00点から75.00点へと25ポイント急落した。ただし、サンプル数の少なさによる抽出誤差が主因と分析されている。
2026/08/18
レビュー DeepSeek V4 Pro、コード実行スコアが41.7点急落——メインランキングで日次19.2点下落
DeepSeek V4 ProがSmoke評価のメインランキングで70.44点から51.24点へと19.2点下落した。主な原因はコード実行ディメンションが66.70点から25.00点へと41.7点急落したことにある。
2026/08/17
レビュー Claude Sonnet 4.6のコード実行スコアが100点から75点に下落――総合ランキングも5.5点低下
本日のSmoke評価テストにおいて、Claude Sonnet 4.6のコード実行スコアが100.00点から75.00点へと25点下落し、総合ランキングも80.52点から75.00点に後退した。ただし、サンプル数が少ないため、モデルの能力が系統的に低下したとは断定できない。
2026/08/16
レビュー Claude Opus 4.7、コード実行75.00点・素材制約100.00点——総合ランキングは3.7点上昇
Claude Opus 4.7の本日のSmokeベンチマークでは、コード実行スコアが99.60点から75.00点に低下した一方、素材制約スコアが61.70点から100.00点に上昇し、総合ランキングのスコアは82.55点から86.25点へと3.7点上昇した。
2026/08/16
SpaceX、AIコーディングツール「Cursor」の買収を正式完了
SpaceXは8月16日、AIコーディング支援スタートアップのCursorの買収を正式に完了したと発表した。Cursorはスペースエクスの独立事業部門となり、既存のサービスは継続して提供される。
2026/08/16
AIプログラミングの新星Cognitionが追加資金調達、評価額が400億ドルに急騰
AIプログラミングスタートアップのCognitionが新たな資金調達を交渉中で、評価額が400億ドルに達する見込みだ。わずか数カ月前に10億ドルの資金調達で260億ドルの評価額を達成したばかりだった。
2026/08/13
レビュー Gemini 2.5 Pro、総合スコアが9.1ポイント急落――コード実行スコアが1日で29.6ポイント暴落
Gemini 2.5 ProのSmoke評価における本日の総合スコアが昨日の88.53点から79.41点へと9.1ポイント下落した。主な要因はコード実行スコアの単日29.6ポイント急落である。
2026/08/13
LovableがAI開発プラットフォームで評価額133億ドルを確認、4億ドルの新規資金調達を完了
AIアプリ構築プラットフォームのLovableが評価額133億ドルで4億ドルの新規資金調達を完了し、年間経常収益(ARR)が6月に5億ドルを突破したことを明らかにした。AI開発プラットフォームへの投資家の関心の高さを示す動きとなっている。
2026/08/13
レビュー GLM-4.6、コード実行で12.5点下落――資料制約で満点取得しメインランキングは5.4点上昇
GLM-4.6が本日のSmoke評価でメインランキング79.38点を記録。コード実行は62.50点に下落した一方、資料制約は100.00点の満点を獲得し、誠実性評価はfailからpassに転換した。
2026/08/12
AnthropicがClaude Codeの自動モードをデフォルト有効化、AIプログラミングの人的介入がさらに減少
Anthropicは、AIプログラミングツール「Claude Code」の「自動モード(auto mode)」をデフォルトで有効にすると発表した。これにより、AIが最小限の人的介入でコードの修正からテスト実行、結果の提出まで自律的に処理できるようになり、開発効率の向上が期待される一方、ソフトウェアの
2026/08/10
レビュー Claude Sonnet 4.6、コード実行スコアが19.5点急落——メインランキングは逆に13.8点上昇
本日のSmoke評価テストにおいて、Claude Sonnet 4.6のコード実行スコアが94.50点から75.00点へと19.5点下落した一方、資料制約スコアは43.30点から97.80点へと急上昇し、メインランキング総合スコアは71.46点から85.26点へと13.8点上昇した。
2026/08/08
レビュー Claude Opus 4.7のコード実行スコアが30.5点急落、総合スコアは6.4点のみ低下
Claude Opus 4.7が本日のSmokeベンチマークでコード実行スコアが100.00点から69.50点に急落した一方、素材制約スコアと工学的判断スコアは大幅に上昇し、主要ランキングの低下は6.4点にとどまった。スコア変動の主な原因は問題の抽選によるランダム性とみられ、モデルの実力低下を示すも
2026/08/07
レビュー Grok 4、マテリアル制約スコアが17.6点急落――総合ランキングは1.8点減にとどまる
本日のSmoke評価において、Grok 4のマテリアル制約スコアが82.60点から65.00点へと17.6点急落した一方、総合ランキングは82.99点から81.23点へと1.8点の小幅な低下にとどまった。
2026/08/07
Cloudflareが「バイブコーディング」プラットフォームをオープンソース化、非プログラマー向けに開発
Cloudflareは8月7日、社内AIエージェントワークスペースをオープンソース化すると発表した。自然言語でソフトウェアを構築できるこの「バイブコーディング」プラットフォームは、非プログラマーを主なターゲットとしている。
2026/08/07
レビュー GLM-4.6、Smoke評価メインランキング74点——コード実行82.3点、素材制約95点、API障害で一部ディメンション欠損
GLM-4.6が本日のSmoke評価でメインランキング74.00点を記録。コード実行82.30点・素材制約95.00点を獲得したものの、API障害・タイムアウトにより2つのディメンションのデータが欠損し、今回のランキングには参加しない。
2026/08/02