模型亮点及性能
数据:比DeepSeek-VL多一倍优质训练数据,引入梗图理解、视觉定位、视觉故事生成等新能力;
架构:视觉部分使用切图策略支持动态分辨率图像,语言部分采用低成本、高性能的MoE架构;
训练:继承DeepSeek-VL的三阶段训练流程,同时通过负载均衡适配图像切片数量不定的困难,对图像和文本数据使用不同流水并行策略,对MoE语言模型引入专家并行,实现高效训练。
开发者评价
作为为数不多真正享誉国内外AI社区的“国产之光”,DeepSeek以其低调务实但实力超群的做事风格赢得了广大开发者的喜爱。
现在,你可以在SiliconCloud上接入并体验这款出色的视觉模型了。
Token工厂SiliconCloud
Qwen2.5(7B)等20+模型免费用
作为一站式大模型云服务平台,SiliconCloud致力于为开发者提供极速响应、价格亲民、品类齐全、体验丝滑的模型API。
