index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_guoji1.html
![]()
第四范式一体机解决方案SageOne IA全新升级,推出“模型弹性伸缩”技术,旨在解决企业在应对流量波动时面临的算力成本和运维复杂性问题。该技术通过系统根据负载状况自动切换同一系列下不同参数大小的模型,提供模型服务,无需额外扩展计算节点,从而节省算力成本并提升资源使用效率。结合模型预加载等技术,实现模型服务切换时的平滑过渡,避免服务中断或输出质量波动。系统还支持预设多种基于负载的触发条件,形成动态切换策略和任务路由机制,使弹性方案更贴近业务需求。
💡**模型弹性伸缩技术**:SageOne IA通过此技术,在负载较小时使用满血版模型提供高精度推理服务,高峰时段自动降级为蒸馏版/量化版模型实例处理大量并发请求。
🔄**平滑切换保障**:结合模型预加载等技术,确保模型服务切换过程中用户无感知,避免服务中断或输出质量波动。
📊**动态切换策略**:系统可预设多种基于负载的触发条件,如GPU使用率、请求队列长度、响应延迟等,形成动态切换策略和任务路由机制,使弹性方案更贴合实际业务需求。
原创 第四范式 2025-04-07 10:45 北京

近期,第四范式一体机解决方案 SageOne IA 全新升级,推出“模型弹性伸缩”技术来应对流量波动。当前企业一般采用传统扩缩容方案,即当应用负载增加时,通过人工干预或系统按既定规则扩展计算节点,保证服务可用;当负载减少时释放多余的计算节点,这一定程度上增加了算力成本和 IT 运维复杂度。“模型弹性伸缩”是系统根据负载状况,自动灵活切换同一系列下不同参数大小的模型提供模型服务,无需额外扩展计算节点,节省算力成本,提升资源使用效率的同时还大大降低运维工作量。
例如在大模型推理场景下,负载较小时,满血版模型提供高精度的推理服务;进入高峰时段时,系统会自动将满血版降级为一个或多个蒸馏版/量化版模型实例,来处理大量并发请求。结合模型预加载等技术,可避免模型服务切换时,导致服务中断或输出质量波动问题,做到用户无感知的平滑切换;当流量回归常态后,系统再自动升级到满血版模型服务,并释放多余的较小参数模型实例。同时,系统可预设多种基于负载的触发条件,如结合 GPU 使用率、请求队列长度、响应延迟等资源健康度指标,形成动态切换策略和任务路由机制,使弹性方案在实际应用中更贴近业务需求。了解产品详情,可致电 400-898-7788,也可扫描下方二维码或点击【阅读原文】。


阅读原文
跳转微信打开