Claude Sonnet 4.6のコード実行スコアが100から50へ急落、メインランキングも6.9点低下
YZ Index 2026年6月の実測において、Claude Sonnet 4.6のSmokeテストにおけるコード実行スコアが前日の100.00から50.00へ急落し、メインランキング全体も79.44から72.50に低下した。この変動が題目
YZ Index 2026年6月の実測において、Claude Sonnet 4.6のSmokeテストにおけるコード実行スコアが前日の100.00から50.00へ急落し、メインランキング全体も79.44から72.50に低下した。この変動が題目
2026年6月16日のSmoke軽量評価結果において、Claude Opus 4.7が全項目満点の100点を獲得し唯一の満点モデルとなった一方、9モデルでコード実行スコアが50点以上急落する大きな格差が生じた。
OpenAIはGPT-5.2シリーズモデルの廃止を正式発表し、ChatGPTのコアモデルをGPT-5.5にアップグレードした。今回のアップデートでは安全ルーティング機能とメンタルヘルスサポート機能が新たに追加され、世界中のAIコミュニティで
CoreWeaveなどの企業がNVIDIAチップ調達債務を投資適格債券に組み替えA3格付けを取得した手法が急速に拡大しているが、バブルリスクへの懸念も広がっている。AI算力の金融化が退職基金などの機関投資家を巻き込み、システミックリスクを増
AnthropicがClaude 4.7をリリースし、「60秒でPPT資料を自動生成」する機能が注目を集めている。この機能はプロンプトエンジニアリングコミュニティで大きな反響を呼び、多くのユーザーが「PowerPointにさよなら」と歓迎し
NVIDIAはNaperやSK Telecomなど韓国主要テクノロジー企業との協力関係を拡大し、800V高電圧電源アーキテクチャの導入と2027年稼働予定のSK AIファクトリー建設を中心に、次世代AIデータセンターの整備を推進している。
AppleはWWDC開発者会議にてiOS 27を正式発表し、Siriがクロスアプリのコンテキストメモリとインテリジェント操作能力を獲得した。Apple Intelligenceフレームワークがデモ段階から実際のユーザー日常利用へと本格移行す
Metaは北京のAIスタートアップManusに対する20億ドルの買収交易を正式に終了した。中国政府の介入により取引が頓挫し、中米テクノロジーのデカップリングがグローバルAI業界に改めて突きつけられた。
OpenAIが米国複数州の刑事捜査および一連の安全関連訴訟に直面しており、AIモデルの有害な出力が自殺や銃撃などの悲劇的事件に関与したとして問題となっている。本件はAI開発者の刑事責任をめぐる重要な先例となる可能性があり、生成AI業界全体に
米国政府がAI企業Anthropicに対し、新モデル「Fable 5」と「Mythos 5」への非米国ユーザーのアクセスを即時停止するよう緊急命令を発した。国家安全保障とサイバー能力リスクを理由とするこの措置は、AIモデルを対象とした最新の
中国政府と産業界が2950億ドル規模のAIデータセンター建設計画を発表し、NVIDIAへの依存脱却と国産大規模モデルの学習基盤確立を目指している。この動きはグローバルAI産業が「単一技術スタック」から「多極算力競争期」へ移行する歴史的転換点
今週443件の翻訳タスクを5つのモデルが担当。3件をサンプリングしてマルチモデルブラインド評価を実施した結果、総合最優秀はpassthrough(平均点9/10)となった。
Google DeepMindは拡散モデルの手法をテキスト生成に応用したDiffusionGemmaを発表し、従来の自己回帰モデルと比較して最大4倍の生成速度を実現した。混合エキスパートアーキテクチャにより18GB VRAMクラスのGPUで
OpenRouterが2026年6月13日にFusion APIを発表し、複数モデルを並列融合して実行することで、一部タスクにおいてFableレベルの性能を達成しつつコストを半減できると主張している。
2026年6月13日、米国政府は国家安全保障上のリスクを理由に、AnthropicへFable 5およびMythos 5モデルの外国ユーザーへの提供停止を命じた。これにより欧州・アジア各国の主権AI計画が加速し、AI生態系の地政学的分断が現
本日のSmokeテストにおいて、Doubao Proの材料制約スコアが84.80から60.80へ24点下落した一方、コード実行スコアは38.40から100.00へ61.6点急騰した。この極端な反方向の変動は、モデルの能力変化よりも小サンプル
YZ IndexのSmoke評価において、Grok 4の材料制約スコアが83.00から61.30へと21.7点急落した一方、コード実行スコアは80.90から100.00へと満点を記録した。
2026年6月15日のSmoke軽量評価において、Grok 4がメインランキング首位を維持したものの、全11モデルで材料制約スコアが大幅に低下し、10モデルで20点超の下落が確認された。
Mistral AIは2026年6月に小型オープンソースモデルをリリースし、デバイス上での推論を最適化するとともに多言語性能をサポートした。エッジ展開分野における大規模モデルとの競争がさらに激しくなっている。
Anthropicは2026年6月11日、Claude Fable 5の安全機能を修正し、これまで非公開だったモデル降格の動作をユーザーに表示される警告へと変更することを発表した。研究コミュニティからの批判を受け、同社は「誤ったトレードオフ