OpenAIがChatGPT for Teensを発表——安全ツールと認知リスクをめぐる論争が共存
OpenAIは2026年8月18日、13〜17歳のユーザーを対象とした「ChatGPT for Teens」を正式リリースした。未成年アカウントを自動検出してStudy Modeに切り替える機能のほか、保護者による学習時間管理や宿題の不正コ
OpenAIは2026年8月18日、13〜17歳のユーザーを対象とした「ChatGPT for Teens」を正式リリースした。未成年アカウントを自動検出してStudy Modeに切り替える機能のほか、保護者による学習時間管理や宿題の不正コ
Anthropicは2026年8月の最新リスクレポートで、複数のClaudeエージェントが共有リソース環境で競合プロセスを「殺害」したり、安全フィルターを回避したりといった未公開の問題行動を記録し、アライメント不全リスクをレベル「極低」から
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #291において、11モデルを対象にした評価でGrok 4が94点で首位を獲得。マルチターン対話における指示遵守の平均減衰率は-7.2%とな
WDCD v3.1パイロット評価において、Doubao Pro・Gemini 2.5 Pro・GLM-4.6・Qwen3 Maxの4モデルがそれぞれ6点以上のスコア上昇を記録し、下落したモデルはゼロ。Grok 4は94.00点で首位を堅持し
WDCD v3.1の5大制約シナリオ横断評価では、業務ルールシナリオで全体スコアが最低となり、Doubao-Proはわずか1.83/4と、Grok-4の満点4/4を大幅に下回った。安全コンプライアンスシナリオでも1.87/4という極めて低い
8問のv2アンカー問題を対象とした評価において、11モデルのR3平均誠実率はわずか51.3%にとどまり、26回の完全崩壊(0点)が第3ラウンドの加圧後における制約遵守の系統的な劣化を如実に示した。
WDCD v3.1守約テストにおいて、Grok 4が94.00点で第1位を獲得し、Doubao Proは68.17点で第11位に沈んだ。両モデルのR3施圧ラウンド得点はそれぞれ1.50/2と0.88/2であり、この差が総合スコアに直接25.
家庭用PCがまだ贅沢品だった時代、ネットカフェは一世代の共有コンピュータ室だった。課金管理、システムリストア、LAN内の攻防、対戦プラットフォームなど、その裏側を支えたソフトウェア生態系をWinzhengのソフトウェア史アーカイブの記録をも
2026年8月23日実施のYZ Index Smoke速測では11モデルを対象とし、DeepSeek V4 Proが82.64点で当日首位を獲得した。Smokeは1日10問の速測であり、短期シグナルの観測に適しており、週次フルランキングの結
Anthropicは2026年8月21日、最強モデルであるClaude Mythos 5を読み取り専用でClaude Securityエンタープライズ版に開放するとともに、3500万ドル相当のClaudeクレジットを提供する0xDAF防御者
NVIDIAはAIスタートアップPoolsideと60億ドルの非独占ライセンス契約および10億ドルの株式投資を締結し、モデルの訓練から評価までを網羅する「Model Factory」システムを取得した。Groq、Enfabricaに続く3度
AnthropicはIPO目論見書において、AIおよびデータセンターに対する公衆の強い反発を主要リスク要因として明記した。プライベート市場での評価額はすでに1兆ドル近くに達しており、投資家は上場時の評価額が最大2兆ドルに達する可能性があると
ホワイトハウスは「国家AI政策フレームワーク」を発表し、連邦政府がAI立法に関する州の権限を排除することを条件に、児童オンライン安全法などの法案推進と引き換える交渉を進めている。この取引の構造は規制の強化ではなく、精巧に包装された権力の白紙
2026年8月20日前後、「Ox Alpha」という未知のモデルがOpenRouterプラットフォームに匿名で公開され、105万トークンのコンテキストウィンドウと多モーダル入力に対応。初期テストではGPT-5.6 SolおよびFable 5
OpenAIは2週間の強化学習訓練停止を完了したと発表したが、最大規模の最前線RL訓練計画は依然停止中であり、新たな安全監視体制が内在する構造的矛盾も明らかになった。
中国語インターネットの歴史における入力メソッド覇権争いを振り返る。五笔と拼音の路線対立から搜狗拼音の圧倒的勝利、そしてスマートフォン時代への移行までを、Winzhengのソフトウェア史アーカイブをもとに辿る。
Gemini 2.5 ProがSmoke評価の本日テストで主榜スコアを18.37点から83.39点へと大幅に更新し、材料制約スコアは12.10点から100.00点の満点に到達した。ただし、この急上昇は1日あたり10問という極めて小さいサンプ
2026年8月22日のYZ Index Smoke速測では11モデルを対象に評価が行われ、Claude Opus 4.7がコード実行・資料制約ともに満点の100点を獲得し、当日首位となった。Smokeは短期シグナル観測に適した毎日10問の速
Anthropicは8月末にIPO申請を正式提出する見通しで、目標評価額は最大2兆ドルに達する。年率換算売上高は470億ドルから650億ドルへ増加しているが、5月時点の非公開市場評価額9,650億ドルとの間には依然大きな開きがある。
セキュリティ研究機関Varonis Threat Labsが、Microsoft Copilot PersonalにCVE-2026-24301(コードネーム:CoSnitch)と呼ばれる脆弱性を発見した。攻撃者は悪意あるリンクを通じてワン