AIコーディング能力評価

139 件の記事 · ページ 1/7
どのAIモデルが最もコードを書けるのか?HumanEvalとMBPPは一般的なベンチマークですが、関数レベルの補完テストのみで、実際の開発シナリオとは乖離があります。YZ指数のコード実行次元(Execution)は、隔離されたサンドボックスでモデル生成の完全なプログラムを実行し、コンパイル通過率、ランタイムの正確性、エッジケース処理能力を検証します。モデル相互評価ではなく実際のコード実行検証を採用する数少ない独立ベンチマークの一つです。本トピックでは各モデルのコーディング能力ランキング、プログラミングツールの動向、AI支援開発の業界実践を追跡しています。
レビュー Claude Sonnet 4.6、コード実行スコアが19.5点急落——メインランキングは逆に13.8点上昇
本日のSmoke評価テストにおいて、Claude Sonnet 4.6のコード実行スコアが94.50点から75.00点へと19.5点下落した一方、資料制約スコアは43.30点から97.80点へと急上昇し、メインランキング総合スコアは71.46点から85.26点へと13.8点上昇した。
2026/08/08
レビュー Claude Opus 4.7のコード実行スコアが30.5点急落、総合スコアは6.4点のみ低下
Claude Opus 4.7が本日のSmokeベンチマークでコード実行スコアが100.00点から69.50点に急落した一方、素材制約スコアと工学的判断スコアは大幅に上昇し、主要ランキングの低下は6.4点にとどまった。スコア変動の主な原因は問題の抽選によるランダム性とみられ、モデルの実力低下を示すも
2026/08/07
レビュー Grok 4、マテリアル制約スコアが17.6点急落――総合ランキングは1.8点減にとどまる
本日のSmoke評価において、Grok 4のマテリアル制約スコアが82.60点から65.00点へと17.6点急落した一方、総合ランキングは82.99点から81.23点へと1.8点の小幅な低下にとどまった。
2026/08/07
Cloudflareが「バイブコーディング」プラットフォームをオープンソース化、非プログラマー向けに開発
Cloudflareは8月7日、社内AIエージェントワークスペースをオープンソース化すると発表した。自然言語でソフトウェアを構築できるこの「バイブコーディング」プラットフォームは、非プログラマーを主なターゲットとしている。
2026/08/07
レビュー GLM-4.6、Smoke評価メインランキング74点——コード実行82.3点、素材制約95点、API障害で一部ディメンション欠損
GLM-4.6が本日のSmoke評価でメインランキング74.00点を記録。コード実行82.30点・素材制約95.00点を獲得したものの、API障害・タイムアウトにより2つのディメンションのデータが欠損し、今回のランキングには参加しない。
2026/08/02
レビュー GPT-o3、本日のSmokeベンチマーク主要ランキングで13.9ポイント急落――コード実行と資料制約の両次元で低下
GPT-o3が本日のSmokeベンチマーク主要ランキングで79.28点を記録し、昨日の93.16点から13.9ポイント下落した。コード実行と資料制約の両次元で13ポイント以上の下落が見られたが、小サンプルによる抽選変動が主因とみられる。
2026/08/01
レビュー Qwen3 Max、材料制約スコアが20点急落し47.70点に——コード実行は37.8点急騰、メインランキングは11.8点上昇
Qwen3 MaxはSmoke評価において、材料制約スコアが前日の67.70点から47.70点へ20点急落した一方、コード実行スコアは54.70点から92.50点へ37.8点急騰し、メインランキング総合スコアは60.55点から72.34点へ上昇した。
2026/07/31
レビュー Grok 4、コード実行スコアが19.5点急落――資料制約は23.2点上昇、総合ランキングは0.3点減にとどまる
本日のSmokeテストにおいて、Grok 4のコード実行スコアが92.00点から72.50点へ19.5点急落した一方、資料制約スコアは60.90点から84.10点へ23.2点上昇し、総合ランキングスコアは78.01点から77.72点へわずか0.3点の微減にとどまった。
2026/07/31
レビュー DeepSeek V4 Pro、コード実行スコアが25点急落――総合スコアも6.7点下落
DeepSeek V4 ProのSmokeテストにおいて、コード実行スコアが前日の100.00から75.00へと25点急落し、総合スコアも83.53から76.85へと下落した。ただし、現時点のデータはモデルの実質的な性能劣化を示すものではなく、サンプルサイズに起因するばらつきの可能性が高い。
2026/07/30
Cursor、インド市場へ大規模進出――現地価格設定で市場獲得を狙う
AIコーディング支援ツールのCursorがインド向けローカライズ価格を発表し、現地採用と企業営業への大幅な投資拡大を計画している。同社はインドを米国・欧州に次ぐ世界第3位の市場と位置づけている。
2026/07/28
レビュー Claude Sonnet 4.6、コード実行スコアが22点急落――資料制約は25.7点上昇
本日のSmokeベンチマークにおいて、Claude Sonnet 4.6のコード実行スコアが97.00点から75.00点へと22点急落した一方、資料制約スコアは60.20点から85.90点へと25.7点上昇した。主要ランキングの総合スコアはわずか0.5点の微減にとどまっている。
2026/07/28
レビュー DeepSeek V4 Pro、コード実行スコアが25点急落——材料制約は26.8点上昇
本日のSmokeベンチマークにおいて、DeepSeek V4 Proのコード実行スコアが100.00点から75.00点へと25点急落した一方、材料制約スコアは68.20点から95.00点へと26.8点上昇し、総合ランキングのスコアは85.69点から84.00点へとわずか1.7点の低下にとどまった。
2026/07/28
レビュー DeepSeek V4 Pro、材料制約スコアが31.8点急落——コード実行は69.5から100点に急上昇
DeepSeek V4 ProのSmoke評価において、材料制約スコアが31.8点急落した一方、コード実行スコアは30.5点急上昇し、ほぼ対称的な変動を示した。専門家はこれをモデルの構造的劣化ではなく、サンプリングのランダム性によるものと分析している。
2026/07/27
レビュー GLM-4.6、材料制約で93.30点を記録も誠実性評価はfail――コード実行25.00点が総合ランキングの足を引っ張る
2026年7月23日実施のRun#243 Smokeテストにおいて、GLM-4.6は総合ランキング55.74点を記録。材料制約で93.30点の高得点を挙げた一方、コード実行は25.00点にとどまり、誠実性評価はfail(プローブ30.00点)となった。
2026/07/23
レビュー GLM-4.6の誠実性評価がpassからfailに転落、コード実行スコアは47点急上昇
GLM-4.6は本日のSmoke評価テストにおいて誠実性評価がpassからfailに急落した一方、コード実行スコアが50.00点から97.00点へと47点上昇し、メインランキング総合スコアも62.83点から74.00点に改善した。
2026/07/22
レビュー GPT-o3のSmokeベンチマーク総合スコアが急落8.3点――コード実行は100点から88.3点へ
GPT-o3が本日のSmokeベンチマークで総合スコアを昨日の96.27点から87.94点へと8.3点落とした。コード実行・工程判断の両次元が大幅に下落し、誠実性評価も「pass」から「warn」に転じた。
2026/07/22
レビュー Claude Opus 4.7、Smoke評価でメインスコアが26.1ポイント急落——コード実行と資料制約の両次元で失守
本日のSmoke評価において、Claude Opus 4.7のメインスコアが100.00点から73.92点へと26.1ポイント下落した。コード実行・資料制約の両次元で25ポイント以上の降下が確認されたが、小サンプルによる変動の可能性が高いと分析されている。
2026/07/21
grepを超えて:コンテキスト豊富なAIプログラミングツールの構築
AIプログラミングツールは従来のgrep式コード検索を超え、プロジェクト全体の文脈を理解する「コンテキストエンジン」へと進化しつつある。Augment CodeのCPOがその技術的挑戦と業界の展望を語った。
2026/07/20
レビュー Qwen3 Max、メインランキングで14.9点急落——コード実行スコアが96.9から65.6へ激減
Qwen3 MaxがSmoke評価テストのメインランキングで前日比14.9点下落し、特にコード実行次元が31.3点の急落を記録した。誠実性評価もpassからwarnに変化し、明確なリスクシグナルが発生している。
2026/07/20
レビュー Gemini 2.5 Pro、コード実行スコアが1日で24.6点下落――メインランキングも6.5点低下
本日のSmoke評価において、Gemini 2.5 Proのコード実行スコアが74.60点から50.00点へと24.6点急落し、メインランキング全体も76.49点から69.98点に低下した。ただし、サンプル数の少なさによる抽選変動が主因と分析されている。
2026/07/20