Prefill / Decode 加速
针对长上下文、多轮对话和流式生成分别优化计算路径,提升首 token 响应与持续输出速度
更快响应核心能力
协同硬件、驱动与运行时,统一提升本地部署的速度、稳定性和资源利用率
从上下文预取到持续解码,缩短等待并保持输出节奏
针对长上下文、多轮对话和流式生成分别优化计算路径,提升首 token 响应与持续输出速度
更快响应通过权重预取、缓存复用和量化格式适配,缩短冷启动时间,减少显存抖动与重复搬运
更低占用统一编排 CPU、GPU、统一内存与本地存储,让多模型、多任务在弱网和离线环境下持续稳定运行
更稳部署性能表现
围绕 BS 系列设备,覆盖模型加载、首 token 响应与持续生成
多路推理并行运行,让长上下文和流式生成保持稳定速度
通过硬件、驱动和模型运行时协同,让本地 AI 在不同算力平台上保持一致的部署体验
性能提升
支持模型
面向通用对话、长上下文问答与高并发推理,已完成本地适配。
适合复杂推理、代码生成与多轮工具调用,覆盖主流本地部署需求。
面向高性价比部署与中大参数推理,在资源占用和效果之间保持平衡。
资源管理
自动分配算力和内存,让多个模型一起运行也保持稳定
按任务需要分配资源,减少一个模型波动对其他服务的影响
资源控制
统一调节设备功耗,按需分配每个模型的算力,让多个服务稳定共用设备
为每个模型设定可用内存,避免一个服务占满资源,影响其他任务运行
占用对比
| 服务 | 启动前 | 启动后 |
|---|---|---|
| LLM 服务 | 可用内存 110GB 能耗 11.6W | 可用内存 40GB 能耗 90W |
| OCR 服务 | 可用内存 110GB 能耗 11.6W | 可用内存 75GB 能耗 50W |
运行栈
从模型格式适配、设备调度到服务监控,统一纳入 DeepSophon 本地 AI 运行栈
从模型适配到服务监控,把本地推理纳入统一运行栈
覆盖 Qwen 系列与主流量化格式,按设备能力选择最合适的模型版本
支持单模型、多模型和多 Agent 服务组合,按任务和负载动态分配资源
持续观察吞吐、延迟、显存和日志,让性能变化可量化、可追踪、可复现
数据、模型与推理过程留在企业设备内,适配弱网、离线和合规部署环境