推理引擎

让本地模型跑得更快

DeepSophon Optimizer 统一管理模型、算力与资源,让每一台 设备都能稳定输出

核心能力

从加载到生成,优化每一步

协同硬件、驱动与运行时,统一提升本地部署的速度、稳定性和资源利用率

路径优化
让每一次 token 流动都更快

从上下文预取到持续解码,缩短等待并保持输出节奏

Prefill 与 Decode 加速数据流
01

Prefill / Decode 加速

针对长上下文、多轮对话和流式生成分别优化计算路径,提升首 token 响应与持续输出速度

更快响应
02

权重加载与显存管理

通过权重预取、缓存复用和量化格式适配,缩短冷启动时间,减少显存抖动与重复搬运

更低占用
03

异构调度与稳定运行

统一编排 CPU、GPU、统一内存与本地存储,让多模型、多任务在弱网和离线环境下持续稳定运行

更稳部署

性能表现

每一次推理,都有清晰提升

围绕 BS 系列设备,覆盖模型加载、首 token 响应与持续生成

持续吞吐
把吞吐提升变成持续输出

多路推理并行运行,让长上下文和流式生成保持稳定速度

持续推理吞吐数据流

从启动到持续生成,统一优化四个关键环节

通过硬件、驱动和模型运行时协同,让本地 AI 在不同算力平台上保持一致的部署体验

  • 01模型加载权重预取、缓存复用与格式适配
  • 02Prefill缩短首 token 等待,提升长上下文响应
  • 03Decode优化流式生成,保持持续输出速度
  • 04资源治理算力、功耗与内存边界管理
模型加载启动更快
−50%首 token 时延响应更快
+170%Prefill 吞吐处理更多上下文
更稳长任务运行持续输出稳定

性能提升

推理引擎性能提升

支持模型

支持模型

02

Qwen3.6-35B-A3B

适合复杂推理、代码生成与多轮工具调用,覆盖主流本地部署需求。

03

Qwen3.6-27B

面向高性价比部署与中大参数推理,在资源占用和效果之间保持平衡。

资源管理

让每个模型都用好设备资源

自动分配算力和内存,让多个模型一起运行也保持稳定

资源治理
让算力、内存与功耗各得其所

按任务需要分配资源,减少一个模型波动对其他服务的影响

算力、内存与功耗资源治理

资源控制

分配算力与功耗

统一调节设备功耗,按需分配每个模型的算力,让多个服务稳定共用设备

保护内存边界

为每个模型设定可用内存,避免一个服务占满资源,影响其他任务运行

占用对比

服务启动前后的资源占用

服务启动前启动后
LLM 服务可用内存 110GB
能耗 11.6W
可用内存 40GB
能耗 90W
OCR 服务可用内存 110GB
能耗 11.6W
可用内存 75GB
能耗 50W

运行栈

一套引擎,贯通本地模型服务

从模型格式适配、设备调度到服务监控,统一纳入 DeepSophon 本地 AI 运行栈

运行编排
一条运行链路,贯通多种模型服务

从模型适配到服务监控,把本地推理纳入统一运行栈

本地 AI 运行栈编排
01

模型适配

覆盖 Qwen 系列与主流量化格式,按设备能力选择最合适的模型版本

02

服务编排

支持单模型、多模型和多 Agent 服务组合,按任务和负载动态分配资源

03

运行监控

持续观察吞吐、延迟、显存和日志,让性能变化可量化、可追踪、可复现

04

本地安全

数据、模型与推理过程留在企业设备内,适配弱网、离线和合规部署环境