Deduct OpenAI GPT-4o's Neural Network Architecture

Tutorials

OpenAI GPT-4o의 신경망 아키텍처 추론

OpenAI는 GPT-4o에 대한 논문을 발표하지 않았으므로, 이 비디오는 그 다음 최선의 방법을 시도합니다: OpenAI가 실제로 시연한 기능을 기반으로 신경망 아키텍처가 거의 확실하게 어떤 모습일지를 역엔지니어링합니다

OpenAI는 GPT-4o에 대한 논문을 발표하지 않았으므로, 이 비디오는 그 다음 최선의 방법을 시도합니다: OpenAI가 실제로 시연한 기능을 기반으로 신경망 아키텍처가 거의 확실하게 어떤 모습일지를 역엔지니어링합니다. 초기 증거는 인상적입니다 — 232ms 오디오 응답 시간(기본적으로 인간 대화 지연시간), 텍스트, 오디오, 이미지, 비디오 전반에 걸친 공동 추론이 단일 통합 모델에서 이루어지며, GPT-4 Turbo보다 50% 저렴한 API 가격과 훨씬 더 나은 다국어 텍스트, 비전, 오디오 이해를 가집니다. 내부적으로 뭔가 구조적인 변화가 일어났으며, 명백히 GPT-4의 단순한 미세조정이 아닙니다.

분석은 단일 통합 모델이 옴니모달 입출력을 다루는 데 필요로 하는 것을 다룹니다: 오디오가 이전 ChatGPT Voice Mode에서 음성 지연시간을 야기한 클래식 Whisper-plus-LLM-plus-TTS 파이프라인을 어떻게 우회할 것 같은지, 어떤 토큰화 및 임베딩 선택이 서브초 크로스모달 응답을 가능하게 하는지, 그리고 GPT-4o가 OpenAI의 Whisper, Voice Engine, 비전 연구 및 Google의 Project Astra와 같은 인접 작업에서 어떻게 차용하는지를 다룹니다. 멀티모달 시스템을 설계하고 있거나 GPT-4o의 음성 상호작용이 이전의 조합된 파이프라인과 범주적으로 다르게 느껴지는 이유를 이해하려고 한다면, 아키텍처적 추론을 위해 재생을 누르세요.