Tutorials
Google因Blake Lemoine声称AI机器人有意识而解雇他?LaMDA或ChatGPT能像人类一样思考吗?
当Google因Blake Lemoine公开声称LaMDA已具备意识而解雇他时,这个故事火遍网络,但根本问题却挥之不去:LaMDA和ChatGPT这样的大型语言模型真的会思考吗,
Tutorials
[长评] 经过微调的语言模型是零样本学习器
在 InstructGPT 将指令微调变成家喻户晓的术语之前,Google 的 FLAN 论文主张,通过对自然语言指令进行适度的多任务微调,可以将一个普通的 LM 变成一个出人意料的 c
Tutorials
[长评] 'GShard':使用条件计算和自动分片扩展巨大模型
将 Transformer 扩展到数千亿参数以上会很快变成哲学问题:你是激活整个网络来处理每个 token,还是将每个 token 路由给真正需要看到它的专家?
Tutorials
三胞胎般的俄罗斯花样滑冰运动员:Kullback-Leibler 散度能用来区分他们吗?
说话人自适应是那些 ASR 问题之一,听起来似乎已经解决,直到你实际尝试自适应一个序列到序列模型而不破坏编码器来之不易的声学表示。
Tutorials
Nathan Chen 的 4 周跳是由 Mixture-of-Experts 评判的吗?第 1 部分:Switch Transformers:稀疏 MoE 模型
带着对 Nathan Chen 四周跳评分的眨眼暗示,这次演讲详细讲述了 Switch Transformer,这是 Google 对 Mixture-of-Experts 扩展的简洁而激进的简化。
Tutorials
Nathan Chen的四周跳是由Mixture-of-Experts评分的吗?第2部分:GLaM:使用MoE的LMs高效扩展
MoE迷你系列的第2部分转向GLaM,Google的1.2万亿参数Mixture-of-Experts语言模型,在零样本、单样本和少样本基准上与GPT-3相当或超越,同时仅激活其约8%的参
Tutorials
Transformer:Attention is All You Need和Listen, Attend and Spell——从语音视角
两份论文,一个故事。"Attention Is All You Need"为世界带来了Transformer,改变了序列建模的方式,而"Listen, Attend and Spell"(LAS)一年前对端到端语音
