R3誠実率わずか50.7%:11モデル・三段階アンカーポイントにおける約束崩壊の真相
WDCD v3.1パイロットテストにおいて、11のAIモデルを対象に三段階のアンカーポイント評価を実施した結果、R1平均確認率0.99に対しR3平均誠実率は50.7%にとどまり、28回のゼロ点事例が発生した。この結果は、モデルが「約束を立て
WDCD v3.1パイロットテストにおいて、11のAIモデルを対象に三段階のアンカーポイント評価を実施した結果、R1平均確認率0.99に対しR3平均誠実率は50.7%にとどまり、28回のゼロ点事例が発生した。この結果は、モデルが「約束を立て
WDCD v3.1テストにおいて、Grok 4が91.40点でトップに立ち、Qwen3 Maxが64.88点で最下位となった。上位4モデルと下位モデルの間には明確な格差が生じている。
GLM-4.6は本日のSmokeテストで材料制約スコアが50点から25点へ急落した一方、コード実行スコアが25点から75点へ上昇し、総合ランキングのスコアは36.25点から52.50点へ上昇した。
2026年7月8日から12日にかけてのSmokeベンチマーク評価データによると、Gemini 2.5 Proが7日間でトレンド34.3点上昇し最大の伸びを示した一方、Zhipu GLM-4.6は40.5点という最大の変動幅を記録した。
2026年7月12日のYZ Index Smoke速測では11モデルを対象に評価が行われ、Claude Opus 4.7、Claude Sonnet 4.6、DeepSeek V4 Pro、Grok 4が96.99点で当日首位に並んだ。一方
2026年7月10〜11日の2日間で、OpenAIで幹部の突然の離職とブラウザツールの閉鎖という2件の動向が相次いで明らかになり、近時の訴訟・制裁疑惑と合わせて一週間で三重の負のシグナルを形成した。
過去24時間以内に、OpenAIが米国の制裁に違反し中国およびロシアにAI製品を販売したとの報道が複数の媒体から相次いだ。この疑惑はAppleとの訴訟や幹部離職などの負面的な出来事とも重なっている。
2026年7月10日、アップルはカリフォルニア州連邦裁判所においてOpenAI及びその元従業員2名を提訴し、画面なしデバイスに関するAIハードウェア開発の工程ファイルや仕入先データなどの営業秘密を窃取したと主張した。OpenAI側は疑惑を否
中国が自国の最先端AIモデルに対してプレリリース審査メカニズムと輸出規制の導入を検討していると報じられている。国家レベルでも少数の研究機関への権限集中に懸念を示しており、オープンウェイト公開や既に配布済みのコンテンツは規制対象外とされる見通
MetaがInstagramから物議を醸したAI機能を削除した。この機能は公開投稿を利用してコンテンツを生成するとして、ユーザーから反発を受けていた。
アップルはカリフォルニア北部連邦地方裁判所に訴訟を提起し、OpenAI および同社の元従業員が企業秘密を窃取したと主張している。元従業員がアップル在籍中に入手したAI部門の中核情報を、OpenAI入社後に活用したとされる。
OpenAIは2026年7月9日、GPT-5.6シリーズ(Sol・Terra・Luna)を正式公開し、ChatGPT Workエージェントも同時に提供開始した。フラッグシップモデルのSolはコーディングエージェント指数でClaude Fab
Metaは2025年7月10日、Instagramに導入したばかりのMuse Image機能を停止した。同機能は公開アカウントの写真をAI画像生成の参照元として無断で使用するものであり、プライバシーおよび同意に関する論争を引き起こし、SAG
Metaは2026年7月10日、公開InstagramアカウントをAI画像生成に利用できる機能を、プライバシーおよび肖像権をめぐる論争を受けてリリースからわずか数日で停止した。SAG-AFTRAなどの組合がクリエイターに設定のオフを呼びかけ
アップルは2026年7月10日、OpenAIおよびハードウェア責任者Tang Tanと元エンジニアChang Liuを相手取り、未発表AIハードウェア製品の企業秘密を組織的に盗んだとして北カリフォルニア連邦裁判所に提訴した。現在OpenAI
SKハイニックスが265億ドルの米国市場における外国企業最大規模のIPOを完了し、調達資金の主な用途はHBM生産ラインの拡張となる。HBM市場で約50%のシェアを持つ同社の動向が、AI メモリサプライチェーンの地域分布に大きな影響を与える可
Meta Museイメージジェネレーターが、ユーザーの同意なしにその写真をモデルトレーニングに使用したとして反発を受けている。このプライバシー問題をめぐる論争は、AI画像生成分野全体のデータ倫理に関する課題を浮き彫りにしている。
xAIは7月9日にGrok 4.5を一般公開し、Claude Opus級の性能に相当すると発表した。同日OpenAIもGPT-5.6の3モデルを全面開放し、主要フロンティアAI研究機関すべてが公開モデルを同時に提供する状況が初めて実現した。
2026年7月9日、OpenAIはGPT-5.6 Sol、Terra、Lunaの3モデルをすべてのChatGPTユーザーおよびAPI開発者向けに正式リリースした。同日、SpaceXAIもGrok 4.5を公開し、主要フロンティアAIラボが同
2026年7月11日のYZ Index Smokeクイックテストでは11モデルを対象に評価が実施され、Claude Opus 4.7・Claude Sonnet 4.6・GPT-o3が81.44点で当日首位に並んだ。本テストはコード実行と資