Tutorials
Google 因 Blake Lemoine 說 AI 機器人具有感知能力而解僱他?LaMDA 或 ChatGPT 像人類一樣思考嗎?
當 Google 因 Blake Lemoine 公開聲稱 LaMDA 已變得具有感知能力而解僱他時,這個故事引起了轟動,但底層問題仍然存在:像 LaMDA 和 ChatGPT 這樣的大型語言模型是否真正思考,
Tutorials
[長評] 微調語言模型是零次學習器
在 InstructGPT 使指令調優成為家喻戶曉的術語之前,Google 的 FLAN 論文表明,對自然語言指令進行適度的多任務微調可以將一個普通的 LM 轉變為令人驚訝的強大
Tutorials
[長評] 'GShard':使用條件計算和自動分片擴展巨型模型
將 Transformer 擴展到超過一千億個參數很快會變成哲學問題:你是為每個令牌激活整個網絡,還是將每個令牌路由到真正需要查看它的專家?
Tutorials
像三胞胎一樣的俄羅斯花滑運動員:Kullback-Leibler 散度能用來區別他們嗎?
說話者自適應是那種 ASR 問題之一,聽起來已經解決,直到你實際嘗試在不破壞編碼器苦心獲得的聲學表示的情況下自適應序列到序列模型。
Tutorials
Nathan Chen 的 4 周跳是由 Mixture-of-Experts 評分的嗎?第一部分:Switch Transformers:稀疏 MoE 模型
以 Nathan Chen 的四周跳評分為框架,這個演講詳細介紹了 Switch Transformer,Google 對 Mixture-of-Experts 擴展的簡潔而激進的簡化版本。
Tutorials
Nathan Chen 的 4 Flip 是由 Mixture-of-Experts 評分嗎?第 2 部分:GLaM:使用 MoE 高效擴展 LM
MoE 小型系列的第 2 部分轉向 GLaM,Google 的 1.2 兆參數 Mixture-of-Experts 語言模型,在 zero-shot、one-shot 和 few-shot 基準測試中匹配或超越 GPT-3,同時每個 token 只激活約 8% 的參
Tutorials
Transformer:注意力就是一切,以及 Listen, Attend and Spell - 從語音視角
兩篇論文,一個故事。《Attention Is All You Need》給世界帶來了 Transformer 並重新定義了序列建模的方式,而《Listen, Attend and Spell》(LAS) 一年前為端到端語音識別做了同樣的事情
