Disclosing OpenAI GPT-4's vision+text model, data, and cost to train (speculated)

Tutorials

披露 OpenAI GPT-4 的视觉+文本模型、数据和训练成本(推测)

众所周知,OpenAI 拒绝披露 GPT-4 的架构、参数数量、训练数据或计算预算,这使得技术报告成为 ML 社区的罗夏测试。

众所周知,OpenAI 拒绝披露 GPT-4 的架构、参数数量、训练数据或计算预算,这使得技术报告成为 ML 社区的罗夏测试。本视频采取相反的方法:从公开泄露、之前的 GPT-3 和 ChatGPT 扩展定律以及报告中散布的视觉+文本提示中拼凑合理答案。这是明确标注为推测的内容,但建立在任何从事大型模型工作的人都能推理的数字基础之上。

讲解将涵盖可能的模型大小范围、专家混合假设、多模态训练数据组成、GPU 小时估计,以及与这种规模训练运行相关的惊人美元数字。对于考虑多模态语音+文本系统或试图向 CFO 证明自身计算预算的语音 AI 团队,即使确切数字变化,此处的框架仍然有用。将其视为结构化假设而非泄露,看看猜测与随后泄露的内容相比有多接近。如果您想获得前沿训练经济学的心理模型,值得花 15 分钟。