ワークステーション1枚のGPUで753Bパラメータモデルを動作——FreeTokenがローカル推論のパラメータ上限を突破
カリフォルニア大学バークレー校とテキサス大学オースティン校の研究者が開発したFreeTokenは、単一ワークステーションGPUで7,530億パラメータのGLM-5.2を動作させることを実現し、個人マシン上でのフロンティアモデルのローカル推論
カリフォルニア大学バークレー校とテキサス大学オースティン校の研究者が開発したFreeTokenは、単一ワークステーションGPUで7,530億パラメータのGLM-5.2を動作させることを実現し、個人マシン上でのフロンティアモデルのローカル推論
Google DeepMindは拡散モデルの手法をテキスト生成に応用したDiffusionGemmaを発表し、従来の自己回帰モデルと比較して最大4倍の生成速度を実現した。混合エキスパートアーキテクチャにより18GB VRAMクラスのGPUで
赢政研究院が発表した独立評価レポートで、300元の中古Xiaomi 8から1万元超のRTX 4090まで、4つの異なる価格帯のデバイスでDeepSeekの動作検証を実施。RTX 4090が「庶民のフェラーリ」として最高のコストパフォーマンス