ワークステーション1枚のGPUで753Bパラメータモデルを動作——FreeTokenがローカル推論のパラメータ上限を突破
カリフォルニア大学バークレー校とテキサス大学オースティン校の研究者が開発したFreeTokenは、単一ワークステーションGPUで7,530億パラメータのGLM-5.2を動作させることを実現し、個人マシン上でのフロンティアモデルのローカル推論
カリフォルニア大学バークレー校とテキサス大学オースティン校の研究者が開発したFreeTokenは、単一ワークステーションGPUで7,530億パラメータのGLM-5.2を動作させることを実現し、個人マシン上でのフロンティアモデルのローカル推論
SGLang RLチームがINT4量子化認識トレーニング(QAT)のエンドツーエンドソリューションを実現し、約1TB規模のモデルを単一H200 GPUでのデプロイを可能にしました。