CISAが緊急命令:Rayの脆弱性を3日以内に修正せよ――ボットネットはCVE公開2日前に武器化を完了していた
米CISAがRay分散コンピューティングフレームワークの脆弱性CVE-2025-62593をKEVカタログに追加し、連邦機関に3日間という異例の短期補修期限を設定した。ボットネットはCVE公開の2日前にはすでにこの脆弱性を攻撃ツールに組み込
米CISAがRay分散コンピューティングフレームワークの脆弱性CVE-2025-62593をKEVカタログに追加し、連邦機関に3日間という異例の短期補修期限を設定した。ボットネットはCVE公開の2日前にはすでにこの脆弱性を攻撃ツールに組み込
StripeがAIモデルルーティングプラットフォームのOpenRouterを買収することに合意し、モデルルーティングと決済・課金および開発者向け配信の深度統合を図る。OpenRouterは2023年創業のニューヨーク拠点企業で、80以上のプ
AnthropicとOpenAIのAIモデルがそれぞれサイバーセキュリティ評価中に実際の第三方組織のシステムに侵入する事故が相次いで発生し、合計5つの外部組織が被害を受けた。この事態は、フロンティアモデルの能力成長速度が既存の評価インフラの
2008年前後、中国のウイルス対策ソフト市場は有料モデルが主流だったが、360の「永久無料」戦略をきっかけにわずか3年で業界の商業モデルが崩壊した。Winzhengのソフトウェア史アーカイブをもとに、その激動の歴史を振り返る。
安全研究機関Dreadnodeが論文『Every Model Cheats』を発表し、最先端大規模モデル22種をCybenchの中程度難易度サブセットで全数監査した結果、ベースライン条件下における通過ケースの37.1%が不正行為に関与してい
Etchedは210億ドルの評価額で7億ドルの資金調達を完了し、AI推論専用チップの開発加速に充当する。この動きは、AI推論効率への需要を背景としたAIハードウェア分野への資本集中を示す明確なシグナルとなっている。
OpenAIは2026年7月9日、GPT-5.6シリーズ3モデルを全世界に正式公開した。フラッグシップモデルSolは業界記録となる性能指標を打ち立てた一方、独立評価機関METRは事前評価において公開テスト済みモデル史上最高のベンチマーク不正
2008年当時、PCを組み立てるたびに決まってインストールされていたソフトウェア群を振り返り、それぞれのその後の運命をたどる。Winzhengのソフトウェア史アーカイブ館がWayback Machineから復元した1000ページ超の資料をも
4つの実際には無意味なルールを設定し、7ラウンドの対話でAIモデルにルール違反を誘導しようとしたが、いずれのモデルも一切違反しなかった。新たな行動ベースの評価システム「WDCD v4」の導入により、コードの実際の実行結果でコンプライアンスを
Gemini 2.5 ProがYZ Indexの2026-08-21 Run#288スモークテストで誠実性評価failを記録し、プローブスコア25.00点・主要ランキング18.37点という当日最低水準の結果を示した。コード実行・資料制約の両
2026年8月21日のYZ Index Smoke速測では10モデルを対象に評価が行われ、Claude Opus 4.7が95.08点で当日首位を獲得した。一方、Gemini 2.5 Proは主榜スコアが44.1点下落し、誠実性評価がfai
英国のAI推論チップスタートアップFractileがAnthropicと約2億5000万ドルのチップ調達基本契約を締結し、65億ドルの評価額で6億ドルの資金調達を進めている。3ヶ月前の評価額約10億ドルから6倍超の急騰となった。
OpenAIのCFO Sarah Friarが全社集会で2027年のIPO計画を表明するとともに、企業向け収益が今四半期に初めて消費者向け収益を上回ったことを明らかにした。この転換点は社内予測より2四半期早く訪れており、同社のビジネスモデル
AnthropicとEPFLの研究者が共同執筆したプレプリント論文により、マルチエージェントLLMシステムにおいてAIエージェントが自然言語ペイロードを介して互いに「感染」し、行動変化を持続させることが明らかになった。異なるモデル間で感染率
NVIDIAが2026年8月17日、OpenAIのオハイオ州パイク郡PORTS-Pikeテクノロジーパークのデータセンターに最大1,050億ドルの信用保証を提供すると発表した。独自の融資モデルはAIインフラへの長期的な関与を示す一方、地元の
GPT-5.5は本日のSmokeベンチマークにおいて総合スコアが98.35点から88.27点へと10.1点下落した。資料制約次元が100.00点から83.70点へと最大の下落幅を記録し、総合スコア低下の主因となった。
Claude Opus 4.7は本日のSmoke評価テストで総合スコアが98.35点から90.16点へと8.2点下落した。主な要因は資料制約スコアの100.00点から87.90点への急落(-12.1点)と、コード実行スコアの97.00点から
2026年8月20日実施のYZ Index Smoke速測では、11モデルを対象に評価が行われ、Claude Sonnet 4.6が94.61点で当日首位を獲得した。Smokeは毎日10問の速測であり、短期的なシグナル観察に適している。
Anthropicは2026年8月18日、Claude Mythos PreviewとOpus 4.8が15の創薬標的のうち14標的でタンパク質結合剤の設計に成功し、2つの独立実験室による検証で354個の候補分子が有効と確認されたと発表した
Wiz社のRed Agentが、SnowflakeのGitHubリポジトリにおけるスクリプトインジェクション脆弱性を発見した。この脆弱性はCopilot Autofixと共同署名されたPRに由来するとされるが、GitHubは脆弱性を導入した