IBM发布了Granite 4.0 Tiny预览版,该模型以高计算效率和低内存需求为特点。在FP8精度下,仅需12GB显存即可运行5个128KB上下文窗口的并发对话,一张RTX 3060显卡即可满足。虽然预览版仅训练了2.5T Token,但已能提供与训练12T Token的Granite 3.3 2B Instruct相当的性能,同时在128KB上下文窗口16并发会话下内存需求降低了约72%。该模型总参数规模为7B,实际活动参数为1B,基于混合Mamba-2 / Transformer架构,兼顾速度与精度。预览版本已在Hugging Face上提供,IBM计划今年夏天正式推出Granite 4.0系列模型的Tiny、Small和Medium版本。
💽 Granite 4.0 Tiny预览版最大的优势在于其极高的计算效率和极低的内存需求,在FP8精度下,仅需12GB显存即可运行,这使得消费级显卡也能轻松驾驭。
🚀 该模型采用了混合Mamba-2 / Transformer架构,这一架构融合了两者的优点,既保证了速度和精度,又有效降低了内存消耗,从而在性能和资源占用之间取得了良好的平衡。
📚 尽管Granite 4.0 Tiny Preview目前仅训练了2.5T Token,但其性能已经可以与训练了12T Token的Granite 3.3 2B Instruct模型相媲美,这表明其训练效率非常高。
🤝 Granite 4.0 Tiny 的预览版本现已在 Hugging Face 上以标准 Apache 2.0 许可证提供,这意味着开发者可以免费使用和修改该模型,促进了 AI 技术的开源和共享。
IT之家 5 月 10 日消息,IBM 本月 2 日介绍了其 Granite 4.0 系列模型中的最小版本之一:Granite 4.0 Tiny 的预览版本。
Granite 4.0 Tiny Preview 的优势在于高计算效率和低内存需求:在 FP8 精度下,运行 5 个 128KB 上下文窗口的并发对话仅需 12GB 显存,一张建议零售价 329 美元(IT之家注:现汇率约合 2383 元人民币)的英伟达 GeForce RTX 3060 12GB 消费级显卡即可满足。

Granite 4.0 Tiny 计划的训练 Token 数至少为 15T,目前 Preview 预览版本仅训练了 2.5T,但已能提供与 12T 训练 Token 的 Granite 3.3 2B Instruct 相当的性能,同时在 128KB 上下文窗口 16 并发会话下内存需求降低了约 72%,预计最终性能可与 Granite 3.3 8B Instruct 相当。

Granite 4.0 Tiny Preview 的总参数规模为 7B,实际活动参数为 1B,其基于被 Granite 4.0 系列全线采用的混合 Mamba-2 / Transformer 架构,结合了两者的速度与精度,降低了内存消耗而不明显损失性能。
Granite 4.0 Tiny 的预览版本现已在 Hugging Face 上以标准 Apache 2.0 许可证提供,IBM 将于今年夏天正式推出 Granite 4.0 系列模型的 Tiny 和 Small、Medium 版本。