相关文章
495 篇高质量内容Om AI第二弹!VLX-Seek来了:3B小模型,细粒度感知反超Gemini
Om AI发布3B小模型VLX-Seek,在细粒度视觉感知任务上反超Gemini Pro,展现精准定位新突破。 核心内容: 1. VLX-Seek模型的核心能力:解决VLM“看懂却看不准”的难题 2. 技术突破:将物理实体转为region token,提升定位精度与推理效率 3. 性能表现:在多项基准测试中超越Gemini,适配端侧实时场景
小参数,大能力 | 星际视觉语言大模型再进化,0.8B轻量版正式发布
轻量级大模型如何实现端侧高效部署?极视角发布0.8B版星际视觉语言大模型,为产业终端带来低成本、高隐私的AI能力。 核心内容: 1. Stellaris-VL-0.8B模型的三大核心优势与产业级能力 2. 模型在架构轻量化、推理稳吞吐方面的关键优化 3. 终端广适配与本地高安全的落地价值
PaddleOCR 3.7 正式接入ONNX Runtime,一个参数换后端,轻量部署新选择
PaddleOCR 3.7.0 正式引入ONNX Runtime后端,仅需一个参数即可灵活切换推理引擎,为轻量级部署提供新选择。 核心内容: 1. 推理引擎抽象化与统一接口设计 2. ONNX Runtime后端的优势与特性 3. 多后端支持带来的灵活部署方案
正式推出 Gemma 4 12B: 一款统一、免编码器的多模态模型
无需编码器,Gemma 4 12B将先进多模态AI直接装进你的笔记本电脑,解锁本地智能体新体验。 核心内容: 1. 全新统一架构:免编码器设计,直接处理视觉与音频输入 2. 强大性能与轻量化:性能接近26B模型,仅需16GB内存即可本地运行 3. 开源生态与应用:Apache 2.0协议发布,已支持丰富开发者应用场景
还在用 MinerU 解析 PDF?这个 2B 小模型直接把 olmOCR-bench 刷到 87.6%,速度还快 3.68 倍
还在用传统工具解析PDF吗?Infinity-Parser2开源模型刷新SOTA,一行命令实现极速精准转换。 核心内容: 1. Infinity-Parser2在权威基准测试中的突破性表现 2. 统一架构如何通过多任务强化学习实现六大功能 3. 极速2B小模型与SOTA 35B大模型的对比与开源获取
Qwen-VLA:迈向通用具身智能的统一动作框架
从“各司其职”到“一脑多用”,通义实验室的Qwen-VLA让机器人真正拥有了统一行动的大脑,迈向通用具身智能。 核心内容: 1. 打破传统模型割裂现状,提出统一动作轨迹预测框架 2. 通过本体感知提示条件化,实现跨11种机器人平台的通用控制 3. 结合Qwen3.5-4B与DiT解码器,构建视觉-语言-动作统一模型
罗福莉说的“伪多Agent”,我试了OmniWork后发现,真全干专家长这样
OmniWork如何解决多Agent系统的常见痛点,实现真正的“全干专家”? 核心内容: 1. 剖析市面多Agent系统“伪智能”的三大核心问题 2. 对比sub-agent与team-agent架构的适用场景与选择标准 3. 展示OmniWork从零生成品牌短片的丝滑全流程实践
PDF解析折腾半年,最后靠这套方案搞定了
想用AI分析PDF却总被格式问题困扰?别急,这套整合方案帮你搞定复杂版式、表格和公式的精准解析。 核心内容: 1. PDF解析的三大主流方案(DeepSeek-OCR、PaddleOCR-VL、MinerU)的适用场景与优劣对比 2. 利用vLLM框架进行推理加速,实现高效本地部署 3. 解析输出的结构化数据(Markdown/JSON)如何无缝接入AI工作流
一个神奇的视频生成 Skills,实测,狂喜
用HTML代码直接生成视频?HyperFrames让AI agent轻松实现视频创作自动化! 核心内容: 1. HyperFrames技术原理:基于HTML+headless Chrome的创新视频生成方案 2. AI agent集成:通过skills系统让Claude等AI掌握视频制作能力 3. 完整工作流:从文字到带字幕、配音的成品视频全自动生成
你的一人公司品牌部,带着Image-2模型的lovart中文版来了
AI设计神器星流Image-2上线,国内用户也能轻松玩转创意设计! 核心内容: 1. 星流Image-2作为Lovart中文版的功能实测体验 2. 用AI进行个人形象分析的趣味案例解析 3. 如何将AI设计工具融入PPT制作等创意工作流
MNN-Sana-Edit-V2:端侧运行的图像漫画风编辑大模型
手机端15秒完成漫画风转换!淘宝联合高校研发的MNN-Sana-Edit-V2模型,兼顾隐私与效率,比云端方案快2.5倍。 核心内容: 1. 模型架构与核心技术解析 2. 端侧部署优化与性能表现 3. 实际应用场景与开源信息
刚刚!Codex 居然能直接画图了,OpenAI 凌晨甩出 Image 2.0
OpenAI 再次突破想象,Codex 不仅能写代码还能直接生成专业架构图,开发效率再上新台阶! 核心内容: 1. Codex 原生集成 Images 2.0 实现代码与绘图无缝衔接 2. 中文渲染和架构图专业度大幅提升的突破性表现 3. Images 2.0 在分辨率、知识更新和细节控制上的技术升级
PaddleOCR 3.5 发布:Web 端直用、文档一键转 Markdown,生态交互新体验
PaddleOCR 3.5带来浏览器端OCR新体验,文档转换更智能,生态融合更便捷。 核心内容: 1. 发布PaddleOCR.js,支持浏览器端轻量调用OCR能力 2. 新增文档转换功能,支持Word/Excel/PPT转Markdown 3. 融入Hugging Face生态,统一推理引擎配置方式
用Claude Code剪视频,自动去口癖、加字幕、调色,完全免费开源
告别繁琐剪辑!这款开源工具用Claude Code对话就能自动完成专业级视频处理,从去口癖到调色一气呵成。 核心内容: 1. 开源工具video-use的核心功能:自动剪辑/调色/字幕/动画叠加 2. 创新技术架构:LLM通过音频转录实现精确到单词的智能剪辑 3. 三步极简使用流程:克隆安装→配置API→对话生成成品视频
刚刚,李飞飞最新成果发布,手机也能跑亿级粒子的 3D 世界了|附体验地址
李飞飞团队最新突破:用浏览器就能体验上亿粒子的3D世界,彻底打破设备限制! 核心内容: 1. Spark 2.0如何实现亿级粒子3D场景在手机端流畅运行 2. 3D高斯点云技术原理及其突破性优势 3. 开源渲染引擎的技术架构与创新设计
豆包「打电话」升级 Seeduplex:周围再吵,只认准你的声音
豆包全新语音模型Seeduplex上线,嘈杂环境中也能精准识别你的声音,让对话如面对面般自然流畅。 核心内容: 1. Seeduplex全双工语音模型的突破性技术 2. 在公园嘈杂环境下的实际使用体验 3. 与传统半双工语音AI的对比优势
美团发布原生多模态 LongCat-Next:当视觉和语音成为AI的母语
美团LongCat-Next突破性实现多模态统一建模,让AI真正拥有物理世界的"母语"。 核心内容: 1. 传统多模态模型的局限性分析 2. DiNA架构实现视觉、语音、文本的统一离散化表示 3. 原生自回归建模带来的三大根本性改变
全解读|智谱 GLM-5V-Turbo 发布,多模态 Coding 基模
智谱 GLM-5V-Turbo 重磅升级,原生视觉能力让AI看懂设计稿直接生成代码,多模态编程新时代来临! 核心内容: 1. GLM-5V-Turbo 的核心升级:原生视觉理解与多模态编程能力 2. 在多项多模态基准测试中超越竞品,同时保持纯文本编程能力不退化 3. 典型应用场景:设计稿转代码、网页界面生成等开发效率革命
GLM-5V-Turbo:多模态Coding,图像即代码
GLM-5V-Turbo突破多模态编程边界,让AI真正看懂画面写出代码,开启视觉编程新时代。 核心内容: 1. 原生多模态Coding基座能力解析 2. 在视觉编程与纯文本场景的双重优势 3. 与行业Agent的深度协同应用案例
突破零样本TTS音色克隆上限:LongCat-AudioDiT 的声音克隆艺术
美团LongCat团队突破传统TTS技术瓶颈,推出直接生成波形的LongCat-AudioDiT模型,实现零样本音色克隆的SOTA性能。 核心内容: 1. 传统TTS系统的多阶段流程缺陷与误差累积问题 2. LongCat-AudioDiT在波形潜空间直接建模的创新架构 3. 关键技术创新:训练-推理匹配优化与自适应投影引导方法











