收藏 分销(赏)

人类经验与AI算法的镜像之旅.pptx

上传人:宇*** 文档编号:14544780 上传时间:2026-10-08 格式:PPTX 页数:42 大小:15.11MB 下载积分:20 金币
下载 相关
人类经验与AI算法的镜像之旅.pptx_第1页
第1页 / 共42页
人类经验与AI算法的镜像之旅.pptx_第2页
第2页 / 共42页


点击查看更多>>
资源描述
,人类经验与,AI,算法的镜像之旅,报,告提,纲,语,言的奥秘:人类如何解,码,世界,DeepSeek-R1,:推理模型的,诞,生与突破,从符号到智能:,AI,的,语,言理解之路,智能体,时,代:,AI,如何重塑教育未来,DeepSeek-V3,:大,语,言模型的构建与,进,化,语言对我们有多重要,语言,造就了人类,人和动物的根本区别就是人具有创造性,地运用语言的能力,语言赋予人类秩序,语言是思维的工具,语言是合作的纽带,如果想要实现通用的人工智能,理解人类使用的,不太精确,、,可能有歧义,、,混乱的,语言是一个有效途径。,语言对我们有多重要,光明日报,刘松青,2019-06-,01,维克多-,D.O,.-桑托斯的是什么让我们成为人类,人类是如何理解语言的?,下雨了我要赶紧回家.,“下雨”/“家”/“收衣服”这些词语,基于我们的经验,在我们大脑中已经建,立了固定的神经连接。,人类是如何理解语言的?,下雨了我要赶紧回家,收衣服。,人类大脑通过理解每个词语的意思、进行词语组装,从而得到句子的意思,甚至推断出句子背后的含义。因此,理解语言的基础,是,理解词语及词语间的关联关系,。,人类是如何理解语言的?,人类语言的精准解译与语义歧义的消解具有显著的语境依,赖性,需通过系统性整合,上下文信息,构建语义解析模型。,这个苹果品质真,高,,已通过欧盟有机认证,每颗果,实都带有,NFC,溯源标签。,报,告提,纲,语,言的奥秘:人类如何解,码,世界,DeepSeek-R1,:推理模型的,诞,生与突破,从符号到智能:,AI,的,语,言理解之路,智能体,时,代:,AI,如何重塑教育未来,DeepSeek-V3,:大,语,言模型的构建与,进,化,计算机的数字化世界,Towards,Seamless,Communication,for,Sign,Language,Support:,Architecture,Algorithms,and,Optimization,计算机理解一切信息的基础是将信息进行数字化。在处理图像时,计算机会将图像的每一个像素,转换为数字信号,通常使用颜色的,RGB,值来表示每个像素。,语言的数字化,计算机无法直接理解离散的,人类语言,词向量,(word,embedding),和词与词之间的位置关系,词向量及单词之间的相似度,欧式距离,:两个点(或向量,),在,空间中的“直线距离”。它反映了,两个向量的绝对差异。欧氏距离值越小,说明两个向量越接近;,值越大,,说明差异越大,。,余弦相似度,:两个向量之间夹角,的余弦值来衡量它们的相似度。它反映了两个向量的方向是否相似,而不关心向量的大小。更适,用于比较两者相似性(,如文本相,似度),。,dog,cat,man,词向量模型的缺陷,在序列数据中,同一个元素处在,不同的上下文,中意思是不同的。如:,(1),The,animal,didnt,cross,the,street,because,i,t,w,as,too,t,i,r,e,d,.,(那只,动物,没有过马路,因为它太累了。),(2,),The,animal,didnt,cross,the,street,because,i,t,w,as,too,w,i,d,e,.,(那只动物没有过马路,因为,马路,太宽了。),然而,传统的词向量模型中同一个词只有一个向量,这对于一些词语会造成歧义问题,如何解决这个问题呢?,https:/jalammar.github.io/illustrated-transformer/,注意力机制与上下文建模,大语言模型通过使用,Transformer,架构,,可以为每个词生成一个,上下文相关的词向量,,这解决了传统词向量无法处理多义词和,上下文依赖,的问题。,一个单词的真实含义,不仅仅取决于它自身,还取决于句子中的其它上下文信息(,来自其它单词的信息),。,一个单词的向量值,需要,融合,从句子上下文中的其他单词中的信息,在数学上可以表达为,所有单,词的向量值的加权平均,。这些权重值,我们可以称之为,注意力权重,(,attention,weights,)。,it,与其他单词之间的注意力权重。蓝色的深浅表达了权重的相对大小。,https:/jalammar.github.io/illustrated-transformer/,报,告提,纲,语,言的奥秘:人类如何解,码,世界,DeepSeek-R1,:推理模型的,诞,生与突破,从符号到智能:,AI,的,语,言理解之路,智能体,时,代:,AI,如何重塑教育未来,DeepSeek-V3,:大,语,言模型的构建与,进,化,文字接龙游戏,大语言模型(LLM)最令人印象深刻的能力是它能够,通过对话的方式,回答用户的问题。那么,LLM,回答问题的原理是什么呢?,不同于传统问答系统中答案来源于现成的网络或者数据库,大语言模型的回答是随着提问的进行,自动生成,的。,这一点很像文字接龙游戏,大语言模型会,基于前面的话不断地生成下一个合成的词汇,,直到觉得,不必继续生成为止。,苹果是一种水果吗?,大语言模型,下一个,可能的词,概率,确,是,苹,实,的,果,0.,8,9,没,不,香,错,是,蕉,0.0,9,5,6,对,好,西,的,吃,瓜,0.0,4,3,2,.,是的,,是,苹,的,果,是,,确,的苹,实,果,被归,类为一种水果。,.,王一博,ChatGPT,发展史:从基础神经元到多模态智能体,科学杂志,大模型是如何工作的,数学家陶哲轩:大模型不是魔法,是,基于概率的猜测机,。,那么大模型是如何不断生成下一个词的概率的呢?,实际上,这一过程依赖于模型内部的,参数,,这些参数通过大量数据的训练来不断调整,,蕴含,了数据的分布规律,从而使模型能够在特定上下文下预测出最合适的下一个词。并且,当这些参数单元的数量级提升时,系统的认知能力通常会呈现出显著的进化趋势。,-,0,.,0,1,2,.,3,4,1,.,0,9,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,.,DeepSeek-,V3 满血版是,67,模型,B:Billion,10,亿,(,苹果是一种水果吗,?,),是的,大模型的参数实际是什么东西?通俗解释,大模型是如何工作的,Spreadsheets-,are-,all-,you-,need,:在,Excel,中完全实现了,GPT2,的前向推理过程。,大模型的参数实际是什么东西?通俗解释,大模型参数是如何通过学习得到的?,y=,0.,516,x,+,0.,856,7,(高尔顿,),父亲身高,(米,),儿子身高,(米,),1.65,1.69,1.72,1.75,1.78,1.80,1.83,1.79,1.90,1.83,希望能够得到一个模型:基于父亲的身高预测儿子的未来身高。,=,+,类似地,大语言模型的参数也是通过大量数据的学习,逐渐调整和优化的,,将数据的规律压缩到参数中,,以便对新的数据进行更准确地预测和生成合适的输出。,大模型训练流程,数据集,训练耗时,模型,算法,预训练,原始数据,万亿级别词汇海量数据,语言模型预训练预测下一个词,基座模型,千级别,GPU,,数月,示例:,GPT,、,LLaMA,、,PaLM,指令微调指令数据,数万提示回复对,语言模型监督微调预测下一个词,指令微调模型,1-,100,个GPU,,数天,示例:Vicuna-,13B,奖励函数,对比数据,百万次比较,二元分类模型,预测偏好一致的奖励,奖励模型,1-,100,个GPU,,数天,强化学习,指令数据,十万次指令,强化学习,生成最大化奖励的词,强化学习模型,1-,100,个GPU,,数天,示例:ChatGPT,Claude,State,of,GPT,Microsoft,Build,2023,Andrej,Karpathy,预训练阶段,在模型,预训练,(,Pretraining,),环节,系统通过整合多种来源的数据资源构建训练集,这些数据涵盖,互联网网页、,维基百科、书籍、,GitHub,代码库、学术文献及社区问答平台,等各类数据源,形成总量达,万亿,单词级的多样化,语料库。,基于超级计算集群(集成,数千块,高性能GPU)和分布式训练算法,逐步优化深度神经网络的,数千亿,参数,最,终形成具备通用语义理解能力的基座模型,(,Base,Model,),。,DeepSeek-,V3,模型的训练语料库包含,14.8,万亿词元,(Token)。,若让一个人每秒读,1,个词:需要,47,万年才能读完,相当于从智人走出非洲开始昼夜不停读到今天。,假设每个,token,是一颗沙粒,,14.8,万亿颗沙可填满,4.5个北京水立方。,预训练阶段,原话,:,一,辆,列,车,缓,慢,行,驶,在,崎,岖,的,山路,上,移除单词,:,一,辆,列,车,行,驶,在,崎,岖 的,山路,上,预测填空,:,一,辆,列,车,缓,慢,行,驶,在,崎,岖,的,山路,上,预训练阶段的训练方法:,完形填空下的自监督学习,(Self-,supervised,Leaning),在预训练阶段,人工智能模型会不断地在句子中挖去一个单词,根据剩下单词的上下文来填空,即预测最合适的填空词出现的概率,这一过程为自监督学习。,指令微调阶段,指令微调阶段的训练方法:,指令微调(Instruction,Tuning),,亦称,有监督微调(Supervised,Finetuning),,是一种通过向模,型提供明确,任务指令,来实现参数优化的方法。在此过程中,模型不仅学习输入与输出的映射关系,更重要的是掌握如何理解并执行各类任务指令。,该阶段的训练数据通常由少量高质量样本构成,这些样本包含用户输入的提示词,(prompt),及其,对应的理想输出(,response,)结果,从而确保模型能够准确理解和响应特定任务需求。,指令微调数据示例,提示词(Prompt),:浙江大学的发展历史?,理想输出,(Response),:浙江大学前身是创立于,1897,年的求是书院,,1914,年停办。,1928,年于求是书院旧址新建,国立浙江大学。,1937,年举校西迁,在遵义、湄潭等地办学,,1946,年秋回迁杭州。,1952,年部分系科转入中国科学院和其他高校,主体部分在杭州重组为若干所院校,后分别发展为原浙江大学、杭州大学、浙江农业大学和浙江,医科大学。,1998,年,同根同源的四校实现合并,组建了新的浙江大学。,奖励建模和强化学习,奖励建模,(Reward,Modeling):,构建一个能够评估模型生成内容质量的奖励模型,(Reward,Model),。,在强化学习阶段,模型通过与奖励模型的交互,优化其生成策略以最大化奖励。主要采用基于人类反馈的,强化学习(RLHF,Reinforcement Learning from Human Feedback),方法。模型根据奖励模型的反馈调整参数,从而生成更符合人类偏好的文本。,报,告提,纲,语,言的奥秘:人类如何解,码,世界,DeepSeek-R1,:推理模型的,诞,生与突破,从符号到智能:,AI,的,语,言理解之路,智能体,时,代:,AI,如何重塑教育未来,DeepSeek-V3,:大,语,言模型的构建与,进,化,什么是推理模型,Understanding,Reasoning,LLMs,Sebastian,Raschka,;,DeepSeek-R1,赏析,潜云思绪,问题:,Joy,能在,20,分钟内读,8,页书。她需要多少小时才能读完,120,页书?,Joy,读,5,个小时才能读完,120,页。,简单回答,一个小时有,60,分钟,,20,分钟可以,分成几组呢?,60,20,=3,组。,所以,,Joy,每小时可以读,8,页,3,组,=,24,页。,接着,,Joy,需要读,120页,计算她需要的时间:,120,24,=5,小时。,因此,,Joy,需要,5,小时才能读完,120,页书。,带有中间推理步骤的回答,推理模型:推理模型是指能够进行复杂推理任务的大型语言,模型,(LLMs),。,这些模型能够处理需要,多步推,导、计算或分析,的问题,通常涉及多个中间步骤。推理模型,不仅能够解决基本的推理问题,,还能应对更复杂的任务,如,解谜、数学证明,等。,推理模型中的中间步骤可以通过两种方式呈现。首先,它们可能会显式地出现在回答中,如示例所示。其次,一些推理,型LLM(如OpenAI的o1),会,进行多次迭代,而这些中间步骤则不会展示给用户。,推理模型是怎样炼成的,Understanding,Reasoning,LLMs,Sebastian,Raschka,;,DeepSeek-R1,赏析,潜云思绪,推理模型,R1-Zero,是怎样炼成的,纯强化学习,DeepSeek-R1-Zero,的模板。在训练过程中,,prompt,将被,替换为具体的推,问题。,激励类型,准确度激励:1+1=?答对2得1分,否则0,分,格式激励:是否遵循,的格式,遵循得,1,分,,否则0,分,没有推理过程的激励!,训练模版,Understanding,Reasoning,LLMs,Sebastian,Raschka,;,DeepSeek-R1,赏析,潜云思绪,推理模型是怎样炼成的,DeepSeek-R1-Zero,在,RL,过程中训练集上的平均响应长度。,DeepSeek-R1-Zero,自然地学会,通过,多,的思考时间来解决推,任务。没有用到中间的过程推理数据来监督训练模型!,Understanding,Reasoning,LLMs,Sebastian,Raschka,;,DeepSeek-R1,赏析,潜云思绪,推理模型,R1,是怎样炼成的,有监督微调和强化学习,DeepSeek-,R1-,Zero,缺陷:可读性差,(poor,readability),和语言混淆,(language,mixing),左脚踩右脚,Understanding,Reasoning,LLMs,Sebastian,Raschka,;,DeepSeek-R1,赏析,潜云思绪,模型蒸馏,有监督微调,利用,DeepSeek-,R1,和,DeepSeek-,V3,产生的数据进一步微调小规模,LLM,。,超大规模的推理模型产生的数据,可以大幅提升小规模模,型的效果。,Understanding,Reasoning,LLMs,Sebastian,Raschka,;,DeepSeek-R1,赏析,潜云思绪,报,告提,纲,语,言的奥秘:人类如何解,码,世界,DeepSeek-R1,:推理模型的,诞,生与突破,从符号到智能:,AI,的,语,言理解之路,智能体,时,代:,AI,如何重塑教育未来,DeepSeek-V3,:大,语,言模型的构建与,进,化,DeepSeek+Kimi,:自动生成,PPT,打开,Kimi,,点击左侧状态栏,找到,PPT,向,PPT,助手中粘贴刚刚生成的内,容,助,手,DeepSeek,辅助编程,DeepSeek+,即梦,AI,:生成图片,复制生成的提示词,到即梦AI,中,苏格拉底式教学智能体,智海-三乐教育大模型,InfiAgent,推理大模型,知识问答,逻辑推理,大模型更多是以知识问答的形式向学生传授知识,苏格拉底教学法,(Socratic,Method)的核心在于,,教师并不,直接向学生传授知识,,而是根据学生已有的知识和经验,,通过一,系列的问题引导、讨论、问答和辩论,,揭示学生思维中的矛盾和,不足,,促使他们自主地推理和反思,,最终得出正确的结论。,构建,苏格拉底式教学智能体,,赋能教与学,实现,从,知识本位教育,向,能力本位教育,转变,苏格拉底式教学智能体,习题,解题步骤,列表,学生,智海-三乐,引导提问,人类教师,(,智能助教,),逻辑,推理,代码,生成,1,.解题步骤拆解,InfiAgent,解题框架,3,.引导解题,2,.苏格拉底式提问,修改反馈,作答,检查,反馈,围绕,苏格拉底式教学智能体,,构建教与学赋能平台,鼓励学生思考与探索,培养,学生批判性思维和自主学习能力,推动教育从,知识本位,向,能力本位,转变,感谢聆听,敬请批评指正,
展开阅读全文

开通  VIP、SVIP  下载更划算
下载10份以上建议开通 VIP 会员
下载20份以上建议开通SVIP会员


开通VIP      成为共赢上传

当前位置:首页 > 通信科技 > 人工智能

移动网页_全站_页脚广告1

关于我们      便捷服务       自信AI       AI导航        关注我们

©2010-2026 宁波自信网络信息技术有限公司  版权所有

客服电话:0574-28810668  投诉电话:18658249818

gongan.png浙公网安备33021202000488号   

icp.png浙ICP备2021020529号-1  |  浙B2-20240490  

关注我们 :微信公众号    抖音    微博    LOFTER 

客服