JOTO
Contact us
← AI 智库
模型与技术专题

多模态模型

整理多模态模型相关的技术判断、实施方法与企业级实践,重点关注可部署性、安全性和业务价值。

相关文章

495 篇高质量内容
多模态模型
多模态模型
多模态模型

【AI生成图片】无需技术,一键生成非遗剪纸!

无需技术就能一键生成非遗剪纸,效果超棒!快来试试。 核心内容: 1. 展示非遗剪纸的效果图 2. 介绍简单的制作步骤 3. 提及往期相关文章

多模态模型
多模态模型
多模态模型

PipeCat - 打造实时语音 AI 应用的开源架构方案

这是一个强大的实时语音 AI 应用开源架构方案,值得探索! 核心内容: 1. Pipecat 在媒体流和实时 API 间的转换 2. 构建语音 AI 应用程序的示例 3. Pipecat 的优点及功能扩展

多模态模型
多模态模型
多模态模型

爱奇艺基于多模态的台词说话人识别技术

这是爱奇艺在台词说话人识别技术上的创新突破,极具应用价值! 核心内容: 1. 台词说话人识别技术的产生背景与应用场景 2. 现有识别方案及存在的问题 3. 爱奇艺基于多模态的创新技术及优势

多模态模型
多模态模型
多模态模型

多模态RAG破局:ImageSearch引领图像搜索新革命

这是关于革新脑肿瘤诊断技术的探讨,有望极大提升效率! 核心内容: 1. 脑肿瘤诊断的挑战 2. 向量数据库搜索系统的解决方案 3. 相关技术的操作流程演示

多模态模型
多模态模型
多模态模型

V-RAG | 大型视觉文档检索与推理

这是关于解决大型视觉文档检索与推理难题的创新研究,成果显著。 核心内容: 1. 现有模型在大型图像推理方面的局限 2. 新基准测试的引入及挑战 3. V-RAG 框架的卓越性能及意义

多模态模型
多模态模型
多模态模型

统一多模态Embedding, 通义实验室开源GME系列模型

这是通义实验室解决多模态检索难题的创新成果,不容错过! 核心内容: 1. 多模态检索的背景与挑战 2. GME 统一多模态表征的特点 3. 模型的训练数据与评测方式

多模态模型
多模态模型
多模态模型

智谱发布新模型,“实时多模态”惊艳所有人

智谱新模型发布,多模态能力惊艳!行业首个端到端模型,为开发者送福利。 核心内容: 1. 介绍端到端多模态模型的创新能力 2. 阐述模型的免费调用及相关代码 3. 展示模型的语音对话和唱歌功能

多模态模型
多模态模型
多模态模型

阶跃星辰Step-1o重大升级,多模态视觉双榜夺冠,国内第一!

国内首个千亿参数端到端语音大模型 Step-1o 系列重大升级,多模态视觉双榜夺冠,这是小贤看到的关于模型升级最好的消息,没有之一。 核心内容: 1. Step-1o 系列模型上新动态 2. Step-1o Vision 多模态理解大模型的优势 3. 两款模型的使用入口及获取成绩

多模态模型
多模态模型
多模态模型

Kimi 发布k1.5思考模型:首个达到o1满血水平的多模态模型,还有完整训练技术报告

Kimi 发布超强 k1.5 多模态模型,性能卓越,训练技术公开,这是小贤看到的关于此模型最好的介绍,没有之一。 核心内容: 1. Kimi k1.5 模型的重磅升级历程 2. 与全球最强模型的性能对比 3. k1.5 模型设计和训练的关键要素

多模态模型
多模态模型
多模态模型

谷歌发布Gemini2.0,开启Agent新时代

多模态模型
多模态模型
多模态模型

我构建多Agent平台的探索与愿景

多模态模型
多模态模型
多模态模型

Github揽获1.6K星!南大、腾讯发布VITA-1.5: 迈向GPT-4o级实时视频-语音交互

多模态模型
多模态模型
多模态模型

千问又放大招!720亿参数的视觉语言模型什么样?

多模态模型
多模态模型
多模态模型

2025 年10大AI 方向:高效推理、多模态等

多模态模型
多模态模型
多模态模型

利用多模态RAG实现图文并茂的内容生成

多模态模型
多模态模型
多模态模型

2025年开篇|AI Agent与多模态大模型:智能革命的新纪元

多模态模型
多模态模型
多模态模型

多模态RAG技术:从语义抽取到VLM应用与规模化挑战

多模态模型
多模态模型
多模态模型

戴上眼镜的Kimi能力超强,领先 o1 和 Gemini

多模态模型
多模态模型
多模态模型

Gemini 2.0 Flash Thinking:谷歌推出实验性多模态推理模型,在快速生成的同时展示详细的思考过程

多模态模型
多模态模型
多模态模型

GPT-4o掀起全模态热潮!一文梳理全模态大模型最新研究进展