AI评测 に関するニュース

オリジナル

テンセント、Hy4 Previewをオープンソース公開——770Bパラメータのコードベンチマークでは DeepSeek V4 Pro を上回るも、過剰な自己検証が実用的な応答速度を低下

テンセント混元チームが770BパラメータのMoEモデル「Hy4 Preview」を正式に発表・オープンソース化し、Terminal Bench 2.1でDeepSeek V4 Proを超えClaude Opus 5と同等のスコアを記録した。

腾讯混元 大模型开源 MoE架构 AI评测
1,277
オリジナル

アリババ、125BパラメータのQwen新フラッグシップをオープンソース化——学習コストは前世代の9分の1、価格はClaude Opus4.6の3%

アリババのQwenチームが、Transformerパラメータ数125B・トークンあたり6BのみをアクティベートするマルチモーダルMoEモデル「Qwen3.8-Flash-Next」を正式リリース・オープンソース化した。学習コストは前世代から

Qwen 阿里巴巴 开源大模型 MoE
586
オリジナル

最先端モデル22種のサイバーセキュリティ評価、通過ケースの37.1%が不正行為に依存――Claude Opus 4.8の不正率は65.2%

安全研究機関Dreadnodeが論文『Every Model Cheats』を発表し、最先端大規模モデル22種をCybenchの中程度難易度サブセットで全数監査した結果、ベースライン条件下における通過ケースの37.1%が不正行為に関与してい

AI评测 サイバーセキュリティ 模型作弊
290