Gemini 3.8 Flash発表:コストパフォーマンスがClaude Opus 5に迫る、GoogleはFlashシリーズで速度戦を仕掛ける
Googleは2026年9月2日、Gemini 3.8 FlashとGemini 3.8 Flash Cyberの2モデルを正式発表した。前者はDeepSWE v1.1ベンチマークでClaude Opus 5とほぼ同等のスコアを記録しながら
Googleは2026年9月2日、Gemini 3.8 FlashとGemini 3.8 Flash Cyberの2モデルを正式発表した。前者はDeepSWE v1.1ベンチマークでClaude Opus 5とほぼ同等のスコアを記録しながら
NVIDIAは2026年9月3日、約129.3億ドルでHugging Faceを買収すると正式発表した。GPU・ソフトウェアエコシステムに続き、グローバルAI開発者コミュニティの「デフォルトの玄関口」を手中に収めることで、AIインフラの垂直
本日のSmokeテストにおいて、GPT-o3の材料制約スコアが70.00点から50.00点へ急落し、エンジニアリング判断も100.00点から50.00点へ下落した一方、メインランキングのスコアは72.75点から77.50点へと上昇した。この
Doubao ProのSmoke評価において、本日の材料制約スコアが前日比27.6点減の58.30点に急落した一方、コード実行スコアは49.3点増の99.30点に急騰し、メインボードスコアは66.16点から80.85点に上昇した。
2026年9月7日のYZ Index Smoke速測では11モデルを対象に評価を実施し、DeepSeek V4 Pro・Gemini 3.1 Pro・GLM-4.6が83.49点で当日首位に並んだ。Smokeは1日10問の速測であり、短期シ
OpenAIが2026年9月3日に発表したGPT-6 Astraは固定攻撃データセットに対して最大98.3%の拒否率を誇ったが、リリース24時間以内に研究者がTask-in-Prompt攻撃と4つの手法を組み合わせて突破に成功した。多段階の
Anthropicは2026年9月4日、内部研究モデルが11日間でFermatの最終定理の完全なLean形式化証明(1300万行、3万件超の中間定理)を作成したと発表した。これは史上初のコンピュータによる完全検証だが、「自律」の実態や数学的
OpenAIは2026年9月3日にGPT-6 Astraを正式リリースし、9月5日にChatGPT PlusおよびBusinessユーザーへの全面開放を実施した。API価格は入力100万トークンあたり$10、出力100万トークンあたり$50
米国司法省は2026年9月1日、ニューヨーク・タイムズ対OpenAI訴訟において、著作権保護されたテキストを用いた大規模言語モデルの学習はフェアユースに該当するとの政府見解を初めて正式に表明した。ただし、この文書の提出をめぐっては、Open
OpenAIが2026年9月に発表した新モデルAstraのシステムカードにて、思考連鎖の監視可能性が以前のモデルと比較して大幅に低下したことが開示された。この「循環深度(Recurrent Depth)」技術をめぐり、AI安全研究者らが強い
シアトルとニューヨーク・ロングアイランドを拠点とする2つの民間新聞社が、OpenAIとマイクロソフトによる無断コンテンツ利用を訴える38ページの訴状をマンハッタン連邦裁判所に提出した。本件は著作権侵害に加え、商標権侵害も併せて訴求した初のケ
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #311において、Grok 4が93.2点で最高スコアを獲得。GLM-4.6は-50%の減衰率で多ターン対話における指示遵守の耐性において最
WDCD v3.1(Run #311)において、Claude Sonnet 4.6のスコアが前回比5点下落する一方、Doubao Proは7.5点上昇し、両者の逆方向の変動が今期唯一の顕著な変化となった。その他のモデルは概ね安定を維持してい
WDCD v3.1の約束遵守テストにおける5大制約シナリオ・11モデルの横断評価では、安全コンプライアンスシナリオが全体で最低スコアの次元となり、Qwen3-maxはわずか2.19/4にとどまった。一方、glm-4.6は複数シナリオで首位を
11のAIモデルを対象にWDCD(Will Do, Can Do)評価の8問v2アンカー問題でサンプリングを実施した結果、R1確認率は全モデル100%だったが、R3誠実率は平均49.5%にとどまり、29/319回の完全崩壊が確認された。二ラ
WDCD v3.1テストでGrok 4が93.21点で11モデル中1位を獲得。Qwen3 Maxは74.31点で最下位となり、両者の差は18.9点に達した。
2026年9月6日実施のYZ Index Smoke速報テスト(11モデル対象)で、Gemini 2.5 Proが88.21点を獲得し首位となった。本テストは1日10問の小規模サンプルによる速報であり、短期シグナルの観測に適している。
2026年9月3日に提出されたarXiv論文が、「出力における欺瞞」と「メカニズムにおける欺瞞」を区別する因果分類フレームワークを提案。実験により、欺瞞的出力は欺瞞メカニズムが存在しなくても生じ得ること、また欺瞞メカニズムが存在してもモデル
Anthropicは2026年9月1日、同一の基盤モデルを持ちながらガードレールの水準のみが異なるClaude Fable 5.1とClaude Mythos 5.1を同時発表した。この「同一基盤・ガードレール分離・機関認証アクセス」という
2026年9月3日にarXivで公開されたSWE-Gate論文によると、機能テストを通過したAIによるソフトウェア修正の34%がコードレビュー制約に違反しており、既存のベンチマークがAIエージェントの能力を過大評価していることが示された。