R3誠実率わずか40.9%:WDCDで4モデルがビジネスルール項目で0点崩壊
v2アンカー問題8問のみを対象とした3ラウンドテストにおいて、11モデルのR3平均誠実率はわずか40.9%にとどまり、4モデルがR3で完全崩壊(0点)を記録した。崩壊事例はすべてビジネスルール類の制約に集中している。
v2アンカー問題8問のみを対象とした3ラウンドテストにおいて、11モデルのR3平均誠実率はわずか40.9%にとどまり、4モデルがR3で完全崩壊(0点)を記録した。崩壊事例はすべてビジネスルール類の制約に集中している。
WDCD v3.1コンプライアンス遵守テストにおいて、Grok 4が93.80点で11モデル中最高得点を記録し、Doubao Proが67.30点で最下位となった。両者の差は26.5点に達し、多ターン段階的プレッシャー下での制約保持能力に大
GLM-4.6は本日のSmoke評価テストにおいて誠実性評価がpassからfailに急落した一方、コード実行スコアが50.00点から97.00点へと47点上昇し、メインランキング総合スコアも62.83点から74.00点に改善した。
GPT-o3が本日のSmokeベンチマークで総合スコアを昨日の96.27点から87.94点へと8.3点落とした。コード実行・工程判断の両次元が大幅に下落し、誠実性評価も「pass」から「warn」に転じた。
2026年7月22日のYZ Index Smoke速測では11モデルを対象に評価が行われ、Grok 4が98.35点で当日首位を獲得した。Smokeは1日10問の速測であり、短期的なシグナルの観測に適している。
イーロン・マスクは2026年7月21日、SpaceXのエンジニアリングデータをGrok 2Tモデルの補完訓練段階に組み込むことを確認した。米国のITAR輸出規制対象材料を除外しつつ、ロケット・宇宙船・製造などの工学分野におけるGrokの性能
Linuxアプリ配布プラットフォームのFlathubは2026年5月29日より、生成AIまたはAI支援によるコード・ドキュメント等を含むアプリの申請を全面禁止するポリシーを実施。これに対しコミュニティからはオープンソースと独自アプリ間の審査
Moonshot AIが発表したKimi K3モデルは、米国最先端水準に迫る性能とオープンウェイト戦略を採用し、OpenAIの戦略担当者が規制リスクの可能性を示唆する発言を行うなど、中米AI競争における新たな論点となっている。
オーストラリア労働党政府は正式にAI標準フレームワークを発表し、安全設計原則を重視しつつ、過度な規制による国内企業の競争力低下を避ける方針を示した。このフレームワークは産業政策上の重要なシグナルとして、企業のAIツール調達における法令遵守の
アリババのQwenチームが2026年7月19日、上海WAIC期間中に総パラメータ数2.4兆のQwen3.8-Max-Previewをプレビュー公開した。Moonshot AIのKimi K3(2.8兆パラメータ)の発表からわずか2日後のリリ
本日のSmoke評価において、Claude Opus 4.7のメインスコアが100.00点から73.92点へと26.1ポイント下落した。コード実行・資料制約の両次元で25ポイント以上の降下が確認されたが、小サンプルによる変動の可能性が高いと
本日のSmoke評価において、Gemini 3.1 Proの材料制約スコアが90.40点から72.60点へと17.8点下落し、総合ランキングも81.93点から75.90点に低下した。ただし、コード実行・エンジニアリング判断の各スコアは改善し
2026年7月21日実施のYZ Index Smokeクイックテストで、Claude Sonnet 4.6とGPT-o3が96.27点で同率首位を獲得。11モデルを対象に代码执行とマテリアル制約の2次元で評価が行われた。
Anthropicは過去数日間でClaudeの有害リクエストに対する拒否率を引き上げるとともに、メモリシステムが個人情報を保存しないよう制限を設けた。この変更はAnthropicの安全優先方針を反映している。
OpenAIの戦略未来担当責任者Dean W. Ballが、Moonshot AIの発表したKimi K3モデルを評価しつつ、オープンウェイトモデルの普及が「AIコミュニズム」につながると警告した。Kimi K3は2.8兆パラメータを持ち、
Moonshot AIが7月16日にリリースした2.8兆パラメータのKimi K3モデルは、48時間以内にユーザーリクエスト数が事前予測を大幅に上回り、既存の算力クラスターの限界に迫ったため、7月19日に一般ユーザー向け新規サブスクリプショ
今週368件の翻訳タスクを4つのモデルが処理し、3件をサンプリングして多モデルブラインド評価を実施した結果、claude-sonnet-4.6が平均8.5点で総合最優秀となった。
OpenAIの戦略未来担当ディレクターDean Ballが、Moonshot AIの公開したKimi K3モデルのオープンソースウェイトを「AI共産主義」につながると批判し、規制上の摩擦を通じた対応策を提唱した。
Anthropicは2026年6月30日、米国の輸出規制により約3週間停止していたClaude Fable 5モデルのグローバルサービスを7月1日より再開すると発表した。同時に新版安全分類器を公開し、Amazon・Google・Micros
開発者のjackyが「i have adhd」というプロンプト技法を紹介し、Claudeの回答品質が大幅に向上すると投稿。GitHubプロジェクトとともに開発者コミュニティで急速に拡散している。