《Pi Agent + DeepSeek 深度优化》
作者基于两台懒猫AI算力舱本地部署Pi Agent与DeepSeek模型,完成三项关键优化:将上下文长度从131K提升至328K以充分利用显存;默认启用DeepSeek思考模式(--reasoning-parser)与自动工具调用(--enable-auto-tool-choice);实测吞吐达每秒60 tokens,24小时满负荷运行成本为1.9元。
上下文长度从131K提升至328K
最开始的版本是131K,但是只占用了100GB的显存,每台还剩20GB显存没用,我觉得浪费了,直接把DeepSeek max-model-len 和 kv-cache-memory-bytes 都拉到 328K,拉到328K后,每台显存还剩7~9GB,挺好。这样优化以后,就可以跑更大的项目而不需要压缩上下文,显存最后还是留一点,保证7x24小时运行的稳定性。

默认启用DeepSeek思考模式
把DeepSeek的 --reasoning-parser 参数默认打开,这样 Pi Agent 中就可以通过 Shift + Tab 快速切换 DeepSeek 的思考模式,当切换到 think:high 模式后,你就可以认为 DeepSeek 进入 GPT Max的模式,更加聪明。但是因为我们懒猫AI算力舱是本地部署的,所以默认就 high 吧,无限Tokens使劲蹬。
默认开启自动工具调用
默认把 --enable-auto-tool-choice 打开,要不是 Pi Agent 无法使用 DeepSeek 自动调用工具的能力,问几个问题DeepSeek就停止了。优化后,相当于 Pi Agent 配合 DeepSeek 就可以进入 yolo 模式了。只用许愿,剩下的事情让AI搞定。
实测性能与成本
优化完成以后,就可以直接重启 Pi Agent 享受深度优化的 DeepSeek 模型啦,下面是 Pi Agent + DeepSeek 跑的实际效果。

很多朋友也在问,两台算力舱 + DeepSeek 离线跑有多快?可以看下面的视频感受一下速度,每秒 60 tokens ,超级能打了,很多国产模型的在线版本还没这个快呢。
最后,很多朋友关心,成本呢?
一天24小时100%负荷使用,一天成本1.9元,是不是世界上最便宜的 DeepSeek ?
JOTO 企业落地观察
- 本地化智能体系统对显存利用率提出精细调控要求,单纯堆显存不等于高吞吐,需同步调整kv-cache、max-model-len等底层参数实现负载均衡。
- 思考模式与工具调用的默认开启,降低了企业用户对LLM推理链路的干预门槛,但也将责任前移至部署阶段——配置错误将直接导致任务中断。
- 每秒60 tokens的离线吞吐与日均1.9元成本,凸显边缘侧智能体在长周期、低交互密度场景中的经济性优势,但该性价比高度依赖硬件选型与模型量化水平。
- 此类轻量级本地智能体尚未内置RAG知识更新机制或安全沙箱,企业若将其接入生产环境,需额外构建知识热更通道与执行隔离层。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


