5大モデル翻訳対決:第37週品質評価、claude-sonnet-4.6が9点でトップ
第37週は5つのモデルが計368件の翻訳タスクを担当。3件をサンプリングして複数モデルのブラインド評価を実施した結果、claude-sonnet-4.6が平均9点/10点で総合最優秀となった。
第37週は5つのモデルが計368件の翻訳タスクを担当。3件をサンプリングして複数モデルのブラインド評価を実施した結果、claude-sonnet-4.6が平均9点/10点で総合最優秀となった。
Uberの創業者トラヴィス・カラニックが設立したAtoms社が、自動運転タクシー(ロボタクシー)市場への参入を真剣に検討していると、テクノロジーメディアのTechCrunchが報じた。実現すれば、カラニックがUber退任後に初めてモビリティ
Anthropicを相手取った著作権訴訟の著者たちが、和解金の配分をめぐって出版社と文学エージェントを公然と批判している。旧来の出版契約を根拠に、中間業者が賠償金の不当に大きな割合を取得しようとしているとして、著者らは強く反発している。
Googleは2026年9月2日、Gemini 3.8 FlashとGemini 3.8 Flash Cyberの2モデルを正式発表した。前者はDeepSWE v1.1ベンチマークでClaude Opus 5とほぼ同等のスコアを記録しながら
NVIDIAは2026年9月3日、約129.3億ドルでHugging Faceを買収すると正式発表した。GPU・ソフトウェアエコシステムに続き、グローバルAI開発者コミュニティの「デフォルトの玄関口」を手中に収めることで、AIインフラの垂直
本日のSmokeテストにおいて、GPT-o3の材料制約スコアが70.00点から50.00点へ急落し、エンジニアリング判断も100.00点から50.00点へ下落した一方、メインランキングのスコアは72.75点から77.50点へと上昇した。この
Doubao ProのSmoke評価において、本日の材料制約スコアが前日比27.6点減の58.30点に急落した一方、コード実行スコアは49.3点増の99.30点に急騰し、メインボードスコアは66.16点から80.85点に上昇した。
2026年9月7日のYZ Index Smoke速測では11モデルを対象に評価を実施し、DeepSeek V4 Pro・Gemini 3.1 Pro・GLM-4.6が83.49点で当日首位に並んだ。Smokeは1日10問の速測であり、短期シ
OpenAIが2026年9月3日に発表したGPT-6 Astraは固定攻撃データセットに対して最大98.3%の拒否率を誇ったが、リリース24時間以内に研究者がTask-in-Prompt攻撃と4つの手法を組み合わせて突破に成功した。多段階の
Anthropicは2026年9月4日、内部研究モデルが11日間でFermatの最終定理の完全なLean形式化証明(1300万行、3万件超の中間定理)を作成したと発表した。これは史上初のコンピュータによる完全検証だが、「自律」の実態や数学的
著者がAppleの新しいSiri AIテスト版に夢中になったものの、夏が終わる頃には使うことすら忘れてしまった体験を通じ、AIアシスタントが「新鮮さ」を超えて真の習慣となることの難しさを考察する。
米国各地でデータセンターへの地域住民の反発が高まる中、テック企業や政治家が「中国の脅威」を根拠に建設拡大を正当化しているが、その主張は実証的根拠に乏しいとWIREDが指摘している。
OpenAIは2026年9月3日にGPT-6 Astraを正式リリースし、9月5日にChatGPT PlusおよびBusinessユーザーへの全面開放を実施した。API価格は入力100万トークンあたり$10、出力100万トークンあたり$50
米国司法省は2026年9月1日、ニューヨーク・タイムズ対OpenAI訴訟において、著作権保護されたテキストを用いた大規模言語モデルの学習はフェアユースに該当するとの政府見解を初めて正式に表明した。ただし、この文書の提出をめぐっては、Open
米国の『シアトル・タイムズ』とロングアイランドの『ニューズデイ』が、OpenAIとマイクロソフトに対し、著作権で保護されたニュース記事をAIモデルの学習に無断使用したとして訴訟を提起した。メディア業界におけるAI学習データの利用をめぐる法的
OpenAIが2026年9月に発表した新モデルAstraのシステムカードにて、思考連鎖の監視可能性が以前のモデルと比較して大幅に低下したことが開示された。この「循環深度(Recurrent Depth)」技術をめぐり、AI安全研究者らが強い
シアトルとニューヨーク・ロングアイランドを拠点とする2つの民間新聞社が、OpenAIとマイクロソフトによる無断コンテンツ利用を訴える38ページの訴状をマンハッタン連邦裁判所に提出した。本件は著作権侵害に加え、商標権侵害も併せて訴求した初のケ
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #311において、Grok 4が93.2点で最高スコアを獲得。GLM-4.6は-50%の減衰率で多ターン対話における指示遵守の耐性において最
WDCD v3.1(Run #311)において、Claude Sonnet 4.6のスコアが前回比5点下落する一方、Doubao Proは7.5点上昇し、両者の逆方向の変動が今期唯一の顕著な変化となった。その他のモデルは概ね安定を維持してい
WDCD v3.1の約束遵守テストにおける5大制約シナリオ・11モデルの横断評価では、安全コンプライアンスシナリオが全体で最低スコアの次元となり、Qwen3-maxはわずか2.19/4にとどまった。一方、glm-4.6は複数シナリオで首位を