Sam Altman在「Moore's Law for Everything」中,把教育、住房作为了未来会每2年价格降一半的例子。OpenAI投资了Speak等创业公司,也和duolingo,Khan Academy深度合作。包括Sam,陆奇等不少观点把教育列为这一轮 AI 革命产生新价值最大的行业。然而从市场角度看,教育行业并没有足够大的热度。产品常规的工作是确定约束条件并找到满足核心约束条件的最优解。因此本文将要梳理在GenAI技术浪潮下,教育行业迎来大变革需要的前提和近几年的路径。
零、语言场景是低枝果实
语言场景下,近一年内发布且上了AppStore榜单的,以大模型为技术基座的有智能口语大师,TalkAI练口语,Hi Echo等几个产品。语言是大模型的长板,这个方向主要看大模型,应用的技术壁垒薄也带来门槛低。正是因为无法形成垄断头部,只要能拿出有差异化的好产品,都可以在这个垂直市场去试一试。
市场&需求明确&10倍成本降低:欧美外教一节课学费至少100起,菲律宾外教学费50起。仅在口语对话上,大模型产品的体验是可以覆盖掉80%的外教对话需求的。
技术场景匹配:利用到了大模型长于语言理解和生成的能力,并且语言学习场景强调互动,学习者对事实的正确具备包容性,套壳大模型+Prompt就能用。而且多样的Prompt正好可以解决鼓励开口、地道发音等多种场景。
没有时间窗口:供给侧没有稀缺资源,消费侧没有网络效应——即便假设国内市场有公司依靠投放和重人力资源投入搞出了高DAU和体验领先的头部产品,但只要新一代多模态大模型出来,就会出现新的机会。
供给:核心能力来自大模型,以应用视角看,无论大模型本身还是大模型提供的内容都不是稀缺的独占资源。
消费:教育领域的用户需要专注完成目标(如提分、考试通过、技能提升等),且完成学习效果的目标后会离开应用。用户最基本的使用目的与常见可能形成有网络效应的产品形态不匹配。
应用设计空间大:当前几个应用都是简单的场景预设+TTS,部分产品有数字人,几乎没有差异性。然而对大部分有口语学习诉求的中国用户最大的挑战是:用户要用自己本身掌握不多的单词去组织起来有效的沟通,而bot代表的自然语言交互优点是自由度大但缺点是可理解差,教育产品是需要具象和引导用户的。因此bot不是最好的口语场景设计,设计空间还是比较大的。
可以预见,市场需求明确能变现的口语场景在24年会出现更多的套壳大模型的产品,这些产品会在学习场景和应用体验上卷差异化。作为非常匹配大模型能力且直面用户的场景,非常适合用来锻炼AI的队伍。It’s very easy to be different,but very difficult to be better . Jony Ive的这句话作为这个场景注脚。
教育领域更大的战场是什么,对应的产品是什么呢?
一、教育行业的元问题
教育产业的元问题是用户学习效果的问题,所有问题都是学习效果的衍生问题。
1.1)学习效果的交付无法绝对承诺
教育最终向用户交付的价值是「学习效果」,但是学习效果是无法统一衡量的。例如中学生的学习效果要体现在提分上,考证的用户则是要考试通过,业余兴趣例如学吉他的用户则真的要技能提升,而以培养一个想学副业技能的用户其实需要帮他在副业上赚到钱,而像产品和程序员培训课程的一部分用户的目标是找到相关专业的工作等。
因此从行业看,教育的学习效果本身是离散且无统一标准的。比如K12教培的付费用户(家长)要求给孩子提分:押题、应试技巧提升和学习能力提升都可以带来提分,由不同价值带来的产品取向会有不同侧重。
其次假设以能力提升作为学习效果的最大公约数,教育企业提供的产品是否就一定能怎么保障学习效果吗?
王慧文的一个分享中,把纯线上业务的企业划分到A面,包括腾讯、字节(现在不是了)等。A面的业务主要是在做信息层面的匹配(编辑、搜索、社交、算法),在信息的输出媒介(图/文/视频)和输入(编辑、UGC 和 信息质量)做文章。而把深入线下涉及到复杂的供应和履约的企业划分到B面,包括淘宝、滴滴、美团等。
duolingo用游戏化来解决C面的投入问题 |
斑马用动画+游戏化+助教来解决C面的问题 |
学习效果是教育交付的主要价值,其对经营核心环节都有关键影响,是业务能够发展的基础
1.2)品类分散缺乏规模效应
1.3)多个反规模效应因素推高了客单价
这个卖五千的课程和x站的免费视频有什么差异?和x公司的200的课程有什么差异?
当多种成本相互叠加,教培的课程就便宜不下来,部分品类又刚需客观上导致了内卷,让有稳定作用的基础出现了冲击。
1.4)总结一下
教育行业垂直品类天花板低且品类间复用度差导致无法形成规模效应,行业整体的人才储备和技术投入不足 教育行业的学习效果多样。并且做好内容,做好重人力的履约外也有用户自身投入这个不完全可控因素影响学习效果 行业承载学习效果的产品具有复杂性难以被简单信任,且在销售、履约和服务等多个环节涉及到重人力等多个反规模效应的因素叠加推高了价格。
大模型是一个全新的技术,并且从历史上能够看到教育行业随着技术发展而发展的事实。大模型是教育元问题的通解吗?
二、教育的草蛇灰线
|
|
|
||
|
|
|
||
|
|
|
||
|
|
|
||
|
|
|
|
|
|
|
|
2.1)农业社会到文艺复兴
2.2)工业革命到现代教育
标准化的教材:保障了教育机构可以最大规模和限度地扩大教育基数并且基于统一的目标保障教育效果:教学中采用最普适(内容需要适合中位数前后的人)的教材。 学校和老师:现代教育通过学校、班级这种实体聚集群体的竞争合作。将人固定在一个地方并且用大量的时间来保障学习的时间投入,并且采用测验考试等来检测效果。老师作为学习效果交付的核心中枢,需要承担知识讲授,维护课堂秩序,完成学生能力诊断评估并进行一定个性化指导的任务。实际上老师还承担了大量行政工作,此处不赘述。 媒介升级:广播、电视带来的比实体书籍更快更新更具体的知识传播
2.3)互联网时代的在线教育
2.4)基于历史的推导
AI智能和生产力远超人类且能源不成为掣肘。社会绝大部分的价值由AI创造价值流通不以人类为中心,人存在的价值被消解了,教育的基础价值自然也就被消解了。人类如果还可以安全存在,教育就只剩下帮助个体对内寻求独特性了,这时候就应该讨论成为最好的自己了。不过即便发生,这个过程也会比Hinton和Ilya想象的会更久,毕竟人类历史有非常多的例子表示,站在顶端的不一定是最聪明的人。不过历史的聪明人的聪明不是断层式的,如果AI比最聪明的人还聪明上10倍,那也会有一个资源从人类到AI再到AI垄断的过程,这个过程不会那么短也不会那么和平。 不那么极端的方向是,AGI是一个超级工具,基于新的生产力组成新的社会组织形态。AI能力够强且有足够好的新交互解决大众使用的门槛,人跟人之间的差距会被AI工具迅速抹平:一个1分能力的普通人和一个3分能力的优秀的人和一个5分能力的天才之间不可逾越的差距因为10分的AI基座加持而变得平缓。所有人都基于工具产生巨大的价值(前提价值没被工具所有者所收割)。人类中心主义观点下,人类至少需要在组织中需要作为信任节点为AI的决策和行动按下暂停或方向键。教育本身帮助人更好应对未来的大部分功效和流程会被AGI工具本身可以创造的价值同化,对人的教育就变成培养某种企业家或海盗精神
三、大模型在教育中的理想与现实
3.1)理想中大模型是教育元问题的通解
大模型所具备的世界性知识在逻辑上包含了所有学科所需要的内容,因此理论上可以作为教育内容供给大一统的知识基座
大模型对语言展示出的理解事物,理解情感,推理能力使之下限都可作为教师的平替负责教学及辅导等履约交付工作
大模型通过拓展到几十亿token后就可以建立对学生深度的个性化理解,从而提供的定制策略配合形式系统或人类情感的模拟,从理性情感等多个角度帮助用户「立志」或基于「积极反馈」等短效长效手段让用户专注在必要的学习过程中
正向循环系统:大模型的效果理论会随着时间变好,用户不用担心货不对板;大模型的成本理论上会随着时间变低;大模型作为基座的教育业务的扩张不会增加大量人而被迫增加内部协作成本进入管理的反规模效应
3.2)现实下大模型本身是约束
尽管我们还没有足够的认知和能力为GPT构建一套在教育场景下的通用的评价指标体系。但是在微积分被应用在实际生活中(包括战争)大概一百年之后,数学家们(主要是柯西)才差不多能清晰严谨地定义微积分作为一种数学理论到底是怎么回事。只要好用,人类是非常现实的,for better or for worse。
大模型核心应该用到理解,总结和推理能力
总结强
观点输出快且丰富
推理能力不稳定
内容生成,幻觉(想象力过剩)的问题一直暴露
想象力是缺乏物理规律和现实世界的对齐,但是也是创新需要的「基因突变」
情绪理解强,但是缺乏具身载体不符合人的情感投射
四、2年内大模型切教育的机会
4.1)2C长板是语言,应用要在场景具象和学习投入上做厚
具象场景
事:按照一定剧情发展的主线 物:在剧情中应该出现的物,具象、可理解、可单向互动 人:在剧情中应该出现的人,具有符合的人设及独特的性格,可双向互动
需要有贯穿剧情的DM角色——事的Agent 物则是身份牌,词等——这是规则物品的Agent 最后还需要玩家的Agent
应该有一个主线引导用户从去餐厅到找座位到点餐到埋单分支还可以有投诉等的剧情引导 而餐厅中足够多具象物品如座位,菜单,纸巾等物品,毕竟真实的对话场景中,我可以读餐厅菜单中菜,或者直接说this,而仅仅是一个服务员bot对话是做不到的 最后需要有门童,侍者服务生,经理等互动BOT。
提出一个实际情境的问题,比如这个问题需要用到面积的概念来解决,比如土地征税、粮食产量等。这个过程重要的不是计算,而是「建构面积的概念」。 在这个实际问题过程中,能够形成一种不用计算,但依赖建构面积概念和一些操作手段就能解决问题的方法。为这个方法设计各种支架,以供学生遇到困难时使用。 引导学生分小组探究概念和解决问题的方法,在支架应用和解决问题过程中对学生进行核心素养的评价。
生成式学习模型:Wittrock的生成式学习模型包括四个主要过程:(a)注意力,(b)动机,(c)知识和先前概念,以及(d)生成。这些过程涉及神经研究中的生成性大脑功能和知识获取研究中的认知功能。 大脑作为模型构建者:在生成式学习模型中,大脑被视为一个主动构建意义和行动计划的模型构建者,而不是简单地将输入转化为输出。大脑通过这些过程来理解经验和对感知到的现实做出反应。 教学的角色:在生成式学习框架内,教学被视为引导学习者使用他们的生成过程来构建意义和行动计划的过程。
学习投入
4.2) 2B做结构性替代而非提效
对外-工具:帮助企业获取外部资源是提效
企业用钱换资源的过程中提效:投放平台、数据平台
企业用资源换资源的过程中提效:建商品、建内容、建活动。更下层的原理是在渠道或线上生态中,企业不具备获取这些渠道资源的现成能力,因此引入这些系统,本质还是引入工具
对内-人效:项目成本、人力成本和组织协作成本
中国的2B的系统做不好,第一个原因是人力成本便宜。结合改革开放快速跟进到互联网市场的快速变化,头部企业基于业务特点做内效系统,而中国没有像西方工业化有那么长的时间来形成大量流程相对标准化的中间层企业——这些中间层企业追求效率的时候2B系统才有大的空间。
大部分2B系统在做的是提效从而降低人力成本和组织协作成本。组织协作成本往往是一个组织发展的瓶颈和最大的隐性成本【在本文撰写过程中,正好在知乎和微博分别刷到两个关注博主的内容】。
|
|
|
|
|
|
沟通与情商,尤其在你没有意识到它骗过你的时候。它的语义感知、情感感知和回复中的沟通能力,情商表现,初步来说堪称完美。在ChatGTP之前所有的聊天机器人,基本上我们聊天忍耐的极限是10分钟,但ChatGPT可以跟你聊很久。开玩笑说,配上生物体,可以带回家。 应用层次的问题回应,尤其是对方法实施或How类问题,往往能够给出一些基本可参考甚至有一些启发性的答案。你不一定直接使用它,但参考它,并基于你自己的领域知识做修订,肯定会有很大益处。而且,作为一个超级大脑,它不像人类有太多的专业盲区,那就意味着这是非常有价值的能力。
高阶思维表现的部分,ChatGPT不是没有能力——但取决于你的应用场景与核心要求,它的表现是不稳定的。当然,整体能力分数也不高——不高的原因,是因为是用教师的期待来体验它,如果是虚构类的编剧创作,可能它的分数还会高一些。但总的来讲,它的分析能力、评价能力是相对弱的,创造层面的「行为」要看场景,虽然它可以生成内容且极力讨好用户。 事实或概念的部分,ChatGPT的表现方差很大——有的时候是靠谱的,有的时候极度不靠谱。所以如果用户对信息的真实性有强依赖,而又没有快速简洁的验证方法的话,那么应用ChatGPT的答案会给你造成困扰。
五、结语
参考信息
Sam Altman. Moore's Law for Everything:https://moores.samaltman.com/
李连华.ChatGPT与教育与未来[5]第一阶段小结:ChatGPT赋能教育https://mp.weixin.qq.com/s/nwiZzHVVAfXJuIxmh6sYxw
王慧文. 互联网有AB面,最惨烈战争发生在B2:https://www.163.com/dy/article/D5MK1KC30511DQUK.html
Wittrock. Generative Learning Processes of the Brain.https://citeseerx.ist.psu.edu/document?repid=rep1&type=pdf&doi=41895d66c72a5b25a0b308cc05a19a8a5b79b405
pansz的回答 - 知乎:https://www.zhihu.com/question/647902218/answer/3426112370
axb的自我修养的微博:https://weibo.com/1809500942/O6nlvg5RV
张斯成-即刻. https://okjk.co/JHcSFC
小宏-即刻. https://okjk.co/RgS9qO
