AIコーディング能力評価
202 件の記事
· ページ 1/11
どのAIモデルが最もコードを書けるのか?HumanEvalとMBPPは一般的なベンチマークですが、関数レベルの補完テストのみで、実際の開発シナリオとは乖離があります。YZ指数のコード実行次元(Execution)は、隔離されたサンドボックスでモデル生成の完全なプログラムを実行し、コンパイル通過率、ランタイムの正確性、エッジケース処理能力を検証します。モデル相互評価ではなく実際のコード実行検証を採用する数少ない独立ベンチマークの一つです。本トピックでは各モデルのコーディング能力ランキング、プログラミングツールの動向、AI支援開発の業界実践を追跡しています。
レビュー Claude Sonnet 4.6、コード実行スコアが27.4点急落——素材制約は37.7点急騰
本日のSmoke評価テストにおいて、Claude Sonnet 4.6のコード実行スコアが71.90点から44.50点へ27.4点急落した一方、素材制約スコアは50.60点から88.30点へ37.7点急騰した。メインスコアは62.32点から64.21点へわずか1.9点の上昇にとどまった。
レビュー Grok 4のコード実行スコアが31.3点急落、資料制約スコアは34.7点上昇
本日のSmoke評価テストにおいて、Grok 4のコード実行スコアが95.30点から64.00点へ31.3点下落した一方、資料制約スコアは48.40点から83.10点へ34.7点上昇し、総合スコアは74.20点から72.60点へ小幅に低下した。
レビュー GPT-6.1 Solのメインランキングが9.2点急落、コード実行スコアが1日で16.7点下降
本日のSmoke評価テストにおいて、GPT-6.1 Solのメインランキングスコアが86.25点から77.07点に下落し、コード実行次元では75.00点から58.30点へと16.7点の大幅な低下を記録した。
レビュー Gemini 2.5 Pro、素材制約スコアが28点急落——コード実行は満点100点に
本日のSmokeベンチマークにおいて、Gemini 2.5 Proの素材制約スコアが昨日の100点から72点へ28点下落した一方、コード実行スコアは71.90点から100点へ上昇し、総合スコアは84.55点から87.40点に改善した。
レビュー GLM-4.6、材料制約で満点・コード実行41.70点・誠実性プローブはわずか15点
GLM-4.6はYZ IndexのSmokeクイックテストで材料制約100点満点を記録した一方、コード実行は41.70点にとどまり、誠実性評価はfailとなった。同日テストした14モデルの中で唯一failとなった点が注目される。
GoogleがGemini 4 Argonを発表——「史上最強モデル」を標榜
Googleは最新世代の大規模言語モデル「Gemini 4 Argon」を正式発表し、同社史上「最も強力なモデル」と位置付けた。コーディング支援とサイバーセキュリティの2分野を主要ターゲットとして設定している。
レビュー GPT-5.5のコード実行スコアが22点急落、素材制約は25.9点急上昇
本日のSmoke評価テストにおいて、GPT-5.5のコード実行スコアが72.00から50.00へと22点下落した一方、素材制約スコアは69.10から95.00へと25.9点上昇した。総合スコアへの影響は限定的で、主要ランキングは70.70から70.25へのわずか0.5点の低下にとどまった。
レビュー Qwen3 Max、コード実行スコアが24点急落——メインランキングも7.4点下落
本日のSmoke評価テストにおいて、Qwen3 Maxのコード実行スコアが94.00点から70.00点へと24点急落し、メインランキングスコアも84.51点から77.16点に低下した。ただし、問題の抽選による変動が主因とみられ、モデル能力の系統的な劣化とは判断しにくい状況だ。
レビュー GPT-o3のコード実行スコアが21.8点急落、資料制約スコアは33.5点上昇、総合ランキングは小幅上昇
本日のSmokeベンチマークにおいて、GPT-o3のコード実行スコアが93.80点から72.00点へと21.8点下落した一方、資料制約スコアは49.30点から82.80点へと33.5点上昇し、総合スコアは73.78点から76.86点へと小幅に上昇した。
レビュー Claude Opus 4.7、コード実行72点・資料制約85点——Smoke評価メインランキングが2.4点微減
Claude Opus 4.7の本日のSmoke評価において、コード実行スコアが72点に下落した一方、資料制約スコアは85点に上昇し、メインランキング総合スコアは77.85点と前日比2.4点減となった。2つの主要ディメンションが逆方向に大きく変動したことから、モデル能力の系統的な低下よりも出題のサン
レビュー GPT-o3のコード実行スコアが24.5点急落、メインランキングも15.2点下落――抽選の偶然か真の性能低下か
本日のSmokeベンチマークにおいて、GPT-o3のメインランキングスコアが96.01から80.78へと15.2点下落し、特にコード実行の次元で97.00から72.50へと24.5点の急落を記録した。ただし、その他の次元は安定または上昇しており、問題の抽選による偶発的な変動である可能性が高いと分析さ
レビュー Claude Opus 4.7、Smoke評価テストの総合スコアが13.9点急落——コード実行部門は1日で22点暴落
Claude Opus 4.7が本日のSmoke評価テストにおいて、総合スコアが96.01点から82.16点へと13.9点下落した。コード実行部門では22点という大幅な落ち込みが記録されたが、サンプル数の少なさによるランダム変動の可能性が高いと分析されている。
レビュー GPT-5.5のSmokeベンチマーク総合スコアが1日で12.5点急落——コード実行スコアは28点下落
GPT-5.5が本日のSmokeベンチマーク評価において総合スコアが91.32点から78.80点へと12.5点下落した。主な要因はコード実行次元のスコアが100.00点から72.00点へと28点急落したことにある。
Supabaseユーザーデータ露出の警鐘
一部のSupabase利用者がデータベースや設定の不備により大量のユーザーデータを公開状態にさらしていることが判明した。AIツールによるアプリ開発の急速な普及が、セキュリティ設定の甘さという旧来の問題を増幅させている。
Lovableの年間収益が6億ドルを突破、バイブコーディングが世界を席巻
スウェーデンのAIプログラミングプラットフォームLovableの年間収益が6億ドルを超え、プラットフォーム上で作成されたアプリの月間閲覧数が約10億回に達した。「バイブコーディング」と呼ばれるAI駆動の新たな開発手法が世界規模で急速に普及している。
Grok 4.7リリース:DeepSWEベンチマーク71%、従量課金制の「半額」という逆説が隠す実際のコスト
xAIが2026年9月21日にGrok 4.7を正式リリース。DeepSWEベンチマークで71%を達成したが、トークン消費量の大幅増加により「競合の半額」という宣伝文句と実際のコストには大きな乖離がある。
レビュー GPT-o3のコード実行スコアが32.5点急落——メインランキングは96.01点から80.48点に低下
GPT-o3が本日のSmokeベンチマークにおいてメインランキングスコアを96.01点から80.48点へと15.5点落とし、特にコード実行次元が97.00点から64.50点へと32.5点の大幅下落を記録した。小サンプルによる確率的変動の可能性が高く、モデル全体の能力低下を示す証拠は現時点では見られな
レビュー Grok 4のコード実行スコアが96.30点から69.50点に急落、メインランキングは1日で10点下落
Grok 4が本日のSmokeベンチマークでメインランキングスコアを前日の90.86点から80.89点に下落させ、特にコード実行ディメンションが96.30点から69.50点へと急落した。ただし、この変動は問題抽選のランダム性によるものと分析されており、モデル自体の能力低下ではないと判断されている。
レビュー Grok 4の材料制約スコアが15.8点急落――メインランキングが95.44から90.86に低下
本日のSmoke評価テストにおいて、Grok 4の材料制約スコアが昨日の100.00から84.20へと15.8点急落し、メインランキング全体が95.44から90.86に低下した。
レビュー Claude Sonnet 4.6、材料制約スコアが15.8点急落——コード実行は47点上昇
本日のSmoke評価において、Claude Sonnet 4.6の材料制約スコアが100.00点から84.20点へと15.8点下落した一方、コード実行スコアは50.00点から97.00点へと大幅上昇し、総合ランキングは72.50点から91.24点へと改善した。