12GB 显存可实现 128K 上下文 5 并发会话，IBM 预览 Granite 4.0 Tiny 模型

IT之家 05月10日 11:53

../../../zaker_core/zaker_tpl_static/wap/tpl_guoji1.html

IBM发布了Granite 4.0 Tiny预览版，该模型以高计算效率和低内存需求为特点。在FP8精度下，仅需12GB显存即可运行5个128KB上下文窗口的并发对话，一张RTX 3060显卡即可满足。虽然预览版仅训练了2.5T Token，但已能提供与训练12T Token的Granite 3.3 2B Instruct相当的性能，同时在128KB上下文窗口16并发会话下内存需求降低了约72%。该模型总参数规模为7B，实际活动参数为1B，基于混合Mamba-2 / Transformer架构，兼顾速度与精度。预览版本已在Hugging Face上提供，IBM计划今年夏天正式推出Granite 4.0系列模型的Tiny、Small和Medium版本。

💽 Granite 4.0 Tiny预览版最大的优势在于其极高的计算效率和极低的内存需求，在FP8精度下，仅需12GB显存即可运行，这使得消费级显卡也能轻松驾驭。

🚀 该模型采用了混合Mamba-2 / Transformer架构，这一架构融合了两者的优点，既保证了速度和精度，又有效降低了内存消耗，从而在性能和资源占用之间取得了良好的平衡。

📚 尽管Granite 4.0 Tiny Preview目前仅训练了2.5T Token，但其性能已经可以与训练了12T Token的Granite 3.3 2B Instruct模型相媲美，这表明其训练效率非常高。

🤝 Granite 4.0 Tiny 的预览版本现已在 Hugging Face 上以标准 Apache 2.0 许可证提供，这意味着开发者可以免费使用和修改该模型，促进了 AI 技术的开源和共享。

IT之家 5 月 10 日消息，IBM 本月 2 日介绍了其 Granite 4.0 系列模型中的最小版本之一：Granite 4.0 Tiny 的预览版本。

Granite 4.0 Tiny Preview 的优势在于高计算效率和低内存需求：在 FP8 精度下，运行 5 个 128KB 上下文窗口的并发对话仅需 12GB 显存，一张建议零售价 329 美元（IT之家注：现汇率约合 2383 元人民币）的英伟达 GeForce RTX 3060 12GB 消费级显卡即可满足。

Granite 4.0 Tiny 计划的训练 Token 数至少为 15T，目前 Preview 预览版本仅训练了 2.5T，但已能提供与 12T 训练 Token 的 Granite 3.3 2B Instruct 相当的性能，同时在 128KB 上下文窗口 16 并发会话下内存需求降低了约 72%，预计最终性能可与 Granite 3.3 8B Instruct 相当。

Granite 4.0 Tiny Preview 的总参数规模为 7B，实际活动参数为 1B，其基于被 Granite 4.0 系列全线采用的混合 Mamba-2 / Transformer 架构，结合了两者的速度与精度，降低了内存消耗而不明显损失性能。

Granite 4.0 Tiny 的预览版本现已在 Hugging Face 上以标准 Apache 2.0 许可证提供，IBM 将于今年夏天正式推出 Granite 4.0 系列模型的 Tiny 和 Small、Medium 版本。

Fish AI Reader

FishAI

联系邮箱 441953276@qq.com

相关标签