WDCD Run #221:平均命令遵守崩壊率が-36.4%に達し、Grok 4が11モデル中首位に
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #221において、11モデルの平均命令遵守崩壊率が-36.4%に達した。Grok 4が95点でトップとなる一方、命令崩壊がトップクラスのシス
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #221において、11モデルの平均命令遵守崩壊率が-36.4%に達した。Grok 4が95点でトップとなる一方、命令崩壊がトップクラスのシス
最新のWDCD v3.1評価において、Grok 4が95.00点で首位を維持する一方、DeepSeek V4 Proが26.2点の大幅上昇で94.00点に達し、GLM-4.6も21.8点上昇して93.60点を記録。唯一の下落モデルはClau
WDCD v3.1パイロット評価において、業務ルールシナリオが全シナリオ中最低得点となり、最下位のqwen3-maxはわずか1.3/4を記録した。また、doubao-proをはじめとする複数モデルでシナリオ間の得点差が最大2.1点に達する「
8問のv2アンカー問題に対するworst-of-3サンプリングにおいて、11モデルのR3平均誠実率はわずか61.4%にとどまり、Claude Sonnet 4.6はR3崩壊率20%という最も深刻な衰退を示した。このデータは、現行主流モデルが
WDCD v3.1パイロット評価において、Grok 4が95.00点でトップに立ち、Claude Sonnet 4.6が64.10点で最下位となった。両者の差は30.9点に達する。
2026年7月8日のWinzheng YZ Index Smoke速報では、10モデルを対象に評価を実施し、DeepSeek V4 Proが95.19点で当日首位を獲得した。Smokeは毎日10問の速報テストであり、短期シグナルの観察に適し
マイクロソフトは2026年7月6日、全世界で4800人(全従業員の2.1%)の削減を正式発表し、Xbox部門では3200人が対象となった。同社はAI自動化が業務形態を変えつつあると強調しつつ、AI基盤への投資を継続している。
Anthropicは2026年7月6日、Claude モデル内部に「J空間」と呼ばれる計算ワークスペースが存在することを確認した論文を発表した。この発見はAIの意識をめぐる議論を巻き起こしており、専門家の間で賛否が激しく分かれている。
カリフォルニア州知事Gavin Newsomは2026年6月29日、Anthropicとの協定締結を発表した。州内すべての州機関、市、郡が標準価格の50%割引でClaudeにアクセスできるほか、無料の従業員トレーニングと技術支援を受けられる
Anthropicは2026年7月6日、Claudeに人間の意識に類似した「J-space」内部ワークスペースが存在するという研究を発表した。この発見はAIの解釈可能性と安全性をめぐる議論を呼んでいる。
2026年7月7日のYZ Index Smokeクイックテストでは、11モデルを対象に評価を実施し、Claude Opus 4.7 と Grok 4 がともに96.99点で当日首位に並んだ。
マイクロソフトはAIデプロイに特化した企業への支援を表明し、シスコは社内でAIエージェントツールの大規模展開を計画しており、両社の動向は企業向けAIがPoC段階から本格的なスケールデプロイへと移行しつつあることを示している。
Z.aiが発表した中国のAIモデルGLM-5.2が、AnthropicやOpenAIの最先端モデルに匹敵するとされ、米中AI競争における技術格差縮小をめぐる議論を新たな段階へと押し上げている。ただし、中国が追い上げを果たしたかどうかについて
今週318件の翻訳タスクを4つのモデルが担当。3件をサンプリングしてマルチモデルのブラインド評価を実施した結果、総合最優秀はgpt-o3(平均スコア9/10)となった。
アリババは2025年7月10日よりClaude Codeの社内使用を全面禁止し、自社開発のQoderに切り替えた。同ツールが3月から中国ユーザーおよびVPNを検出するコードを内蔵していたことが発覚したためで、Anthropicは第三者による
2025年8月、Metaの委託業者Covalenが運営するCannesプロジェクトが、ChatGPT・Gemini・Character.AIに対し未成年者を装って4万5千件超の有害プロンプトを送信し、安全対策の検証を行ったことが明らかになり
2026-07-06のWinzheng YZ Index Smokeクイックテストでは11モデルを対象に評価が実施され、Doubao Pro が83.91点で当日首位を獲得した。
AnthropicのClaude Fable 5が7月1日にグローバルアクセスを再開した。米国の輸出規制により6月12日から18日間サービスが停止されていたが、再開後はAnthropicが新たな安全レイヤーと利用制限を追加している。
Z.aiが発表したGLM-5.2は、低コストでAnthropicやOpenAIのフロンティアモデルに近い性能を実現し、中国の「ファスト・フォロワー」戦略の成果として中米AI競争に新たな議論を呼び起こしている。
GLM-4.6は2026-07-05 Run#214のSmokeクイックテストにおいて、コード実行で88.70点を記録した一方、資料制約は25.00点にとどまり、誠実性評価はfailと判定された。同日テストされた11モデルの中で、誠実性プロ