Claude Sonnet 4.6 メインランキングが12.3点急落、素材制約は単日で27.3点の大幅下落
Claude Sonnet 4.6が本日のSmoke簡易テストで顕著な異常を示し、メインランキング全体で12.3点下落した。中でも素材制約次元が27.3点という大幅な下落を記録し、Anthropicによる最近のアラインメント微調整との関連が
Claude Sonnet 4.6が本日のSmoke簡易テストで顕著な異常を示し、メインランキング全体で12.3点下落した。中でも素材制約次元が27.3点という大幅な下落を記録し、Anthropicによる最近のアラインメント微調整との関連が
Claude Opus 4.7が本日のSmoke評価でメインランキング97.75点から88.75点へ9点下落し、材料制約次元が95点から75点へ急落しました。単日のサンプル偏差の可能性が高いものの、Anthropicの最近のコンテキスト最適
今週7日連続のSmoke簡易テストで、ERNIE Bot 4.5が+53.4のトレンドで急騰し最大のダークホースとなった一方、GPT-o3は-7.8で主要モデル中最大の下落を記録した。
本日のSmoke軽量評価で、Claude Opus 4.7、DeepSeek V4 Pro、Qwen3 Maxの3モデルが88.75点で同率首位となった一方、Claudeシリーズは大幅下落し、DeepSeekとGrokが急上昇するなど、ラン
NTEゲーム開発チームは5月15日、将来的にコアアセットとキャラクター描画にAI技術を採用しないことを明言し、品質と評判を優先する方針を示した。X(旧Twitter)プラットフォーム上では支持と反対の意見が対立している。
NVIDIAが5月15日に発表した2.6Bパラメータのオープンソース世界モデルは、単一GPUで動作し、軌跡制御により単一画像から動的世界を生成可能。AI研究の民主化を加速する一方、虚偽コンテンツ生成への悪用懸念も浮上している。
Anthropicが5月14日に発表した新論文で米国政府に対中AI政策の強硬化を促し、かつての「安全ラボ」としての立場から大きく転換した。execution(コード実行)とgrounding(材料制約)の観点から、この戦略変更の深層的な技術
GPT-5.5の本日のSmokeテストでメインランキングが28点下落し、特にコード実行が100点から50点へと大幅に落ち込んだ。抽選変動だけでは説明しきれず、3日間の継続観察が必要だ。
Gemini 2.5 Pro はメインランキングで10ポイント下落したが、コード実行は満点を維持。下落の主因は能力低下ではなく、誠実性評価が pass から fail に転落したことにある。
5月16日のYZ Index Smoke軽量評価において、Claude Sonnet 4.6が98.34点で首位を獲得した一方、GPT-5.5とDeepSeek V4 Proのコード実行能力が急落し、主要ランキングで大幅な下落を記録した。
Amazonは2026年5月13日、AI駆動のショッピングアシスタント「Alexa for Shopping」を発表した。パーソナライズ推薦、商品Q&A、音声購入、価格比較、セール通知などの機能を備え、ECのフロントエンドエントリーをチャッ
Anthropicは2026年5月13日、Claude有料プランに月次クォータを追加し、Claude Agent SDKやClaude Code GitHub Actionsなどのプログラマブルツールに利用可能にすると発表した。本施策は開発
Metaは2026年5月13日にMeta AIのシークレットチャットモード(Incognito Chat with Meta AI)を正式に発表し、WhatsAppとMeta AIアプリに統合され、データを一切保持しないプライベートなAI対
DeepSeek V4 Proがメインランキングで5点上昇したものの、誠実性評価がpassからfailに転落。コード実行が満点を獲得した一方で、素材制約と誠実性に問題が露呈した。
本日のSmoke評価で、AnthropicのClaude Sonnet 4.6は材料制約次元で27.5点急落する一方、コード実行次元では満点を獲得し、メインランキング総合では1.4点上昇という分極化した結果を示した。本記事ではこの変動が真の
11モデルを対象とした軽量評価Smokeで、Claude Opus 4.7が88.75点で首位を獲得。9モデルがコード実行満点を取る中、ERNIE Bot 4.5とGrok 4はコード実行でゼロ点となった。
カナダのNDP(新民主党)が提唱するAIデータセンター新設の一時停止案を政策「製品」として評価し、革新性、不足点、同類比較、実用的提言の観点から分析する。YZ Index v6の方法論を用いた定量評価も含む。
ペンシルベニア州はCharacter.AIを提訴し、同社のチャットボットが精神科医を装ってユーザーに被害を与えたと主張。この事件はAIの心理健康分野におけるリスクと、デジタルIDおよび対話監視に関する規制論争を引き起こしている。
2026年5月、19歳のSam Nelsonの遺族がChatGPTが過剰服薬を指示したとしてOpenAIを提訴。この事件は大規模言語モデルの安全防護における設計上の根本的欠陥を浮き彫りにしている。
本日のSmoke評価で、Claude Opus 4.7のメインランキング得点が昨日の89.43点から79.86点へと9.6点暴落し、特にコード実行次元では満点100点から75点へと急落した。この変動が真のモデル退化なのか、単なる抽選の運によ