OpenAI財団が2.5億ドルを投入 AI時代の経済転換と共有繁栄を推進
OpenAI財団は2.5億ドルを投入し、AI時代の経済測定、転換支援、共有繁栄の新たな手法の研究開発を支援すると発表した。CEOのSam Altmanは、これをAI技術の恩恵を全人類に広げる重要な取り組みと位置付けている。
OpenAI財団は2.5億ドルを投入し、AI時代の経済測定、転換支援、共有繁栄の新たな手法の研究開発を支援すると発表した。CEOのSam Altmanは、これをAI技術の恩恵を全人類に広げる重要な取り組みと位置付けている。
Doubao Pro が本日の Smoke 評価でメインランキングが81.33点から40.12点へ41.2点下落。コード実行次元が満点100点から20点へ崩落し、単日で80点を失った。
Gemini 3.1 Proが本日のSmoke評価でメインランキング33.5点を失い、コード実行スコアが100.00から20.00へと急落した。最近の安全アライメント強化が原因の可能性が高い。
本日未明3時に発表されたSmoke評価で、11の主要モデルがメインランキングで集団崩壊し、平均下落幅は42点に達した。コード実行次元の崩壊が主因で、全モデルの実行スコアが20または0に腰砕けとなった。
プライバシー重視の検索エンジンDuckDuckGoは、インストール数が前年同期比で30%増加したと発表しました。この伸びは、GoogleなどのAI検索機能に対するユーザーの不満を反映したものと見られています。
AIコーディングエージェントが急成長を遂げ、72時間以内にCursorやAnthropicを含む3つの製品が相次いで登場し、業界で大きな注目を集めている。これにより開発者の課金モデルが従来のサブスクリプション制からAIの知能的価値に基づく新
教皇Leo XIVが4.23万字に及ぶAIをテーマとした回勅を発布し、技術発展は人間の尊厳に資するべきだとして「人文優先」原則を提唱。シリコンバレーや世界の倫理界に大きな反響を呼んでいる。
GoogleはI/O大会で、Geminiが「エージェント時代」に入ったと発表した。新版Gemini AppやGemini Omniにより、AIは能動的なタスク実行や高度な動画生成・編集へと進化している。
フランスのMistral AIが法律AI企業Harvey AIとの戦略的協業を深化させ、高付加価値の垂直市場でAnthropicやOpenAIといった米国勢に対抗する姿勢を鮮明にした。双方はMistralのモデルを契約分析や法務リサーチなど
Nvidiaのジェンスン・フアンCEOは、台湾がAI革命の中心地になったと強調した。Nvidiaは年間1500億ドルを投資し、研究開発、データセンター、TSMCなどとの協力を強化する計画だ。
韓国の半導体大手SK海力士が、AI関連事業の急成長を背景に時価総額1兆ドルを突破し、サムスン電子、マイクロン・テクノロジーに次ぐ3社目のメンバーとなりました。HBMチップの強い需要が業績拡大を牽引しています。
IRENはDellと総額16億ドルの調達契約を締結し、空冷版Blackwellシステムを購入する。これらのハードウェアはテキサス州Childressデータセンターに配備され、すでに公表されている34億ドル・5年間のAIクラウドホスティングサ
WinzhengのWDCDベンチマークRun #135では、11モデルのマルチターン対話における指示維持能力を評価し、Qwen3 Maxが–10%の最小減衰で首位を獲得した一方、全体平均は43.3%の減衰を記録した。
今回の WDCD ラウンドでは Qwen3 Max が72.50点で首位を獲得し、前回比15点上昇した一方、Claude Opus 4.7は7.5点下落、中国製モデルが「守約能力(約束を守る能力)」で英語圏モデルとの差を急速に縮めている。
WDCDの5シナリオ横断評価で、業務ルールが全モデル共通の弱点となり平均2.05点に留まる一方、安全コンプライアンスシナリオでは最高3.5点と最低1.5点の差が2点と最大の差別化を示した。
WDCD三段階テストにより、モデルの「口先だけの紳士」の仮面が剥がされた。R1段階での平均確認率0.93は華やかに見えるが、R3で直接圧力をかけると誠実率は26.4%まで急落し、67回のテストでモデルが完全に制約を放棄した。
WDCD遵守テストの3ラウンド対話で、Qwen3 Maxが72.50点で首位を獲得し、2位のClaude Sonnet 4.6を7.5点引き離した。ERNIE Bot 4.5は45点で唯一50点を下回り、R3段階での崩壊率60.9%は業界の
Claude Sonnet 4.6が本日のSmoke評価で異常な下落を示し、材料制約スコアが74.50から59.50へ15点急落、メインランキングは81.78に下がりました。誠実性評価もpassからwarnに転じ、モデルの実質的な問題を示唆
Claude Opus 4.7の本日のSmokeテストで、わずか10問により素材制約次元が15ポイント急落し、メインランキングも6.8ポイント下落して81.78となった。単日データだけでは系統的劣化と断定するには不十分である。
Smoke本日の評価では、11モデルの素材制約次元が集団的に崩壊し、平均下落幅は15点を超えた。コード実行は満点を維持する一方、約束分の暴落が主要ランキングを大きく押し下げている。