信息发布→ 登录 注册 退出

SGD 的光辉,带来深度学习的意义

发布时间:2023-10-16

点击量:

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

大数据文摘出品

7月份,纽约大学(nyu)博士后naomi saphra撰写了一篇题为“interpretability creationism”,从进化论的角度解释了随机梯度下降(sgd)与深度学习之间的关系,解读视角发人深思。

例如:“就像人类尾骨一样,有些现象在模型训练过程中可能已经失去了原来的作用,变成了类似退化器官的存在。”

“无论是在研究寄生育雏行为还是神经网络的内部表现,如果不考虑系统是如何发展的,就很难分辨哪些是有价值信息。”

以下是原文,文摘菌做了不改变原意的编译,请欣赏。

几个世纪前,欧洲人布谷鸟蛋出现在鸟巢中是筑巢鸟的荣誉。因为,筑巢鸟热情地喂养她的“神圣客人”,甚至比喂养自己的(被驱逐的)雏鸟还要卖力,筑巢鸟的这种行为符合基督教热情好客的精神。

1859年,查尔斯·达尔文研究了另一种偶尔寄生的雀科鸟类——雀鸟,从而质疑了鸟类行为的乐观、合作观念。

如果不从进化论角度考虑布谷鸟的角色,人们很难认识到筑巢鸟不是布谷鸟幼鸟的慷慨主人,而是一个不幸的受害者。

正如进化生物学家Theodosius Dobzhansky所言:“没有进化的光辉,生物学中的一切都无法理解。”

虽然随机梯度下降并不是生物进化的真正形式,但机器学习中的事后分析与生物学的科学方法有很多相似之处,这通常需要理解模型行为的起源。

无论是在研究寄生育雏行为还是神经网络的内部表现,如果不考虑系统是如何发展的,就很难分辨哪些是有价值信息。

因此,在分析模型时,不仅要关注训练结束时的状态,还要关注训练过程中的多个中间检查点。这样的实验开销很小,但可能带来有意义的发现,有助于更好地理解和解释模型的行为。

恰到好处的故事

人类是因果思考者,喜欢寻找事物之间的因果关系,即使可能缺乏科学依据。

在NLP领域,研究者们也倾向于为观察到的行为提供一种可解释的因果解释,但这种解释可能并没有真正揭示模型的内部工作原理。例如,人们可能会高度关注句法注意力分布或选择性神经元等可解释性工件,但实际上我们并不能确定模型是否真的在使用这些行为模式。

为了解决这个问题,因果建模可以提供帮助。当我们尝试通过干预(修改或操作)模型的某些特征和模式来测试它们对模型行为的影响时,这种干预可能只针对某些明显的、特定类型的行为。换句话说,在尝试理解模型如何使用特定特征和模式时,我们可能只能观察到其中一部分行为,而忽略了其他潜在的、不太明显的行为。

因此,在实践中,我们可能只能对表示中的特定单元进行某些类型的轻微干预,无法正确反映特征之间的相互作用。

在尝试通过干预(修改或操作)模型的某些特征和模式来测试它们对模型行为的影响时,我们可能会引入分布偏移。显著的分布偏移可能导致不稳定的行为,那么为什么不会导致伪造的可解释性工件呢?

译者注:分布偏移指的是模型在训练数据上建立的统计规律与干预后数据之间的差异。这种差异可能导致模型无法适应新的数据分布,从而表现出不稳定的行为。

幸运的是,研究生物进化的方法可以帮助我们理解模型中产生的一些现象。就像人类尾骨一样,有些现象在模型训练过程中可能已经失去了原来的作用,变成了类似退化器官的存在。有些现象可能存在相互依赖的关系,例如,在训练早期出现的某些特征可能影响了后续其他特征的发展,就像动物在发展复杂的眼睛之前,需要先有基本的光感应能力。

还有一些现象可能是由于特征之间的竞争导致的,例如,具有很强嗅觉能力的动物可能不太依赖视觉,因此视觉方面的能力可能会减弱。另外,一些现象可能只是训练过程中的副作用,类似于我们基因组中的垃圾DNA,它们占据了基因组的很大一部分,但并不直接影响我们的外观和功能。

在训练模型的过程中,有些未使用的现象可能会出现,我们有很多理论来解释这种现象。例如,信息瓶颈假说预测,在训练早期,输入信息会被记忆下来,然后在模型中进行压缩,只保留与输出相关的信息。这些早期记忆在处理未见过的数据时可能并不总是有用,但它们对于最终学习到特定输出表示是非常重要的。

我们还可以考虑到退化特征的可能性,因为训练模型的早期和后期行为是很不一样的。早期的模型更简单。以语言模型为例,早期的模型类似于简单的n-gram模型,而后期模型则能表现出更复杂的语言模式。这种训练过程中的混合可能会产生一些副作用,而这些副作用很容易被误认为是训练模型的关键部分。

进化观点

仅根据训练结束后的特征来理解模型的学习倾向是非常困难的。根据Lovering等人的研究成果,观察训练开始时特征提取的容易程度以及对微调数据的分析,对于理解微调性能的影响比仅仅在训练结束时进行的分析要深入得多。

语言分层行为是一个典型的基于分析静态模型的解释。有人认为在句子结构中位置靠近的单词在模型中的表示会更接近,而与结构上较远的单词表示相距较远。那么,我们如何知道模型是通过按照句子结构上的接近程度来对单词进行分组呢?

实际上,我们可以更有把握地说,某些语言模型是分层的,因为早期模型在长短时记忆网络(LSTM)和Transformer中编码了更多的局部信息,并且当这些依赖关系可以分层地堆叠在熟悉的短成分上时,它们更容易学习更远距离的依赖关系。

处理解释性创造主义问题时遇到了一个实际案例。使用不同的随机种子多次训练文本分类器时,可以观察到模型分布在多个不同的簇中。还发现,可以通过观察模型在损失表面上与其他模型的连接情况来预测模型的泛化行为。换句话说,根据损失表面上的位置,模型的泛化性能可能会有所不同。这种现象可能与训练过程中使用的随机种子有关。

但是真的可以这么说吗?如果一个簇实际上对应于模型的早期阶段呢?如果一个簇实际上只是表示了模型的早期阶段,那么最终这些模型可能会转向具有更好泛化性能的簇。因此,在这种情况下,观察到的现象只表示一些微调过程比其他过程慢。

需要证明训练轨迹可能会陷入损失表面上的一个盆地(basin),从而解释训练模型中泛化行为的多样性。实际上,在检查了训练过程中的几个检查点后,发现位于簇中心的模型会在训练过程中与其簇中的其他模型建立更强的联系。然而,有些模型还是能够成功地转向一个更好的簇。

一个建议

对于研究问题的回答,仅观察训练过程是不够的。在寻求因果关系时,需要进行干预。以生物学中关于抗生素耐药性的研究为例,研究人员需要故意将细菌暴露于抗生素,而不能依赖自然实验。因此,基于训练动态的观察所做的声明(statement),需要实验证实。

并非所有声明都需要观察训练过程。在古代人类看来,许多器官都有明显的功能,如眼睛用于看东西,心脏用于泵血等。在自然语言处理(NLP)领域中,通过分析静态模型,我们可以做出简单的解读,例如特定神经元在特定属性存在时会激活,或某些类型的信息在模型中仍然可获取。

然而,训练过程的观察仍然可以弄明白许多在静态模型中进行的观察的含义。这意味着,尽管不是所有问题都需要观察训练过程,但在许多情况下,了解训练过程对于理解观察结果是有帮助的。

建议很简单:在研究和分析训练模型时,不要仅关注训练过程中的最终结果。相反,应该将分析应用于训练过程中的多个中间检查点;在微调模型时,要检查训练早期和晚期的几个点。在训练过程中观察模型行为的变化非常重要,这可以帮助研究人员更好地理解模型策略是否合理,并在观察到训练早期发生的情况后对模型策略进行评估。

参考链接:https://thegradient.pub/interpretability-creationism/


相关文章: 科大讯飞AI绘画模型,引领艺术创作迈向智能新时代,ai描边扩展  文章缩写AI:高效编辑的未来之光  怎样使用AI写文章:释放创作潜能,提升写作效率  豆包AI声音克隆技术,引领个性化声音模仿新潮流的TF力量,ai里面没有色板  AI模型团队,打造高效智能解决方案的力量,ai技术汇总  怎么识别是AI写的文章  智能AI生成文章释放创作新可能  揭秘文心一言AIPPT,AI写作助手实操技巧大解析,ai换脸免会员  SEO一时,成功一生:SEO技巧,让你的事业步入新高度  360优化关键词-提升网站流量与排名的秘密武器,美拍ai  文心一言降重新功能,隐私泄露风险解析,ai圆锥体渐变  AI生成文章:智能创作,重新定义内容生产的未来  文心一言智能体操作手册,打造您的个人高效智能助手,ai明星换脸张小斐  提升写作效率,释放创意潜力文章生成AI软件的未来  AI赋能艺术,大模型绘画,解锁无限创意之门,实时热点ai写作软件  爱酷与AI大模型联袂,引领智能生活新时代,科技生活ai  从零到精通,AI照片模型训练全面教程,ai底纹填满  一键体验智能未来,小爱AI大模型安装指南,多页pdf导入ai  澎湃OSAI大模型,人工智能新引擎,推动产业智能化升级,绘画ipad ai  文章AI扩写:突破创作瓶颈,提升写作效率的秘密武器  轻松掌握AI模型下载全攻略,电脑使用ai写作功能  文心一言,全面解析其利弊得失,AI控球  开源AI大模型热潮,盘点最受欢迎的项目之旅,ai上高速  文心一言,学术研究中的文献阅读高效助手,如何用必应ai写作赚钱  文心独运,巧呈一言,打造沉浸式阅读盛宴,ai坠龙  AI文章精简-高效提炼与优化你的内容创作,ai quid  谷歌推出性通才AI模型,开启智能时代新,ai中取消编组是干嘛的  语文作文生成轻松提高写作水平,作文技巧的秘密  颠覆传统,提升效率!一款你不能错过的“网站复制工具”  怎样利用AI写文章,轻松提升写作效率  文心一言,创意文案素材解析与灵感源泉,逢赌必输ai翻唱  超链接用哪个好?一文搞懂选择超链接的技巧与工具  AI绘画大模型,揭秘制作流程、技术内核与实际应用,ai人们  文心一言诞生记,揭秘背后的故事与历史时刻,ai植入字体  文心一言,见证父母的婚礼盛典,ai写作软件破解版下载  下载卡通AI模型,引领个性化虚拟形象新风尚,如何有效使用ai提升写作技能与能力  2025年AI模型工具革新,智能化升级驱动产业变革新,女星ai跳舞  文心一言,智能助手引领学术学习新篇章,ai lpl比赛  撰写文章AI:释放写作潜能,创造无尽可能  如何用AI改文章,让写作更高效、精准,提升内容质量  AI重塑现实,豆包本人的AI资料揭秘之旅,八角Ai  AI公众号项目怎么样?打造未来商业的全新机会  SuperAI模型库,打造智能基石的未来蓝图,viiitor ai  AI赋能艺术,揭秘栩栩如生的3D模型绘制奥秘,抗击疫情ai  文心一言大模型,性能测评与未来趋势洞察,ai抠图临时转换键  AI赋能视觉跟踪云台,引领智能监控技术革新,ai修复鸟  文心一言对话记录清除指南,操作步骤与安全须知,形状海报ai  小布AI大模型,引领智能时代创新浪潮,ai怎么做钻石切面效果  链客AI大模型技术揭秘,探秘其核心技术内涵,ai画图计划  文心一言全新升级,产品矩阵全面揭秘,ai建筑原理 

标签:# 深度学习  #   # lstm  # transformer  # nlp  # https  # 过程中  # 几个  # 就像  # 是有  # 多个  # 很难  # 表面上  # 是在  # 观察到  # 不太  
在线客服
服务热线

服务热线

400 8905 500

微信咨询
二维码
返回顶部
×二维码

截屏,微信识别二维码

打开微信

微信号已复制,请打开微信添加咨询详情!