💬 观点Simon Willison
Gemini Live audio — Simon Willison 用 AI 现场写了个零依赖网页 UI,试玩 Goo
Simon Willison 用 AI 现场写了个零依赖网页 UI,试玩 Google 新发布的 Gemini 3.8 Live 语音模型
2026-09-15原文
本文为要点摘要,完整细节以原文为准。
- Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 两个语音对语音模型,形态类似 OpenAI 的 GPT-Live 系列,支持打断模型说话。对 agent 的含义:实时双向语音正成为主流模型厂商的标配接口层。
- 他用 GPT-6 Astra Extra High 读文档后直接生成一个试用网页,可选模型、语音预设、系统提示词,并在浏览器里发起语音对话。对开发者的含义:读文档写胶水代码这类工作已可整体外包给模型。
- 实现不依赖任何库,直接连 WebSocket 端点(BidiGenerateContent),用 Web Audio API 的 AudioContext 同时做采集与播放。对工具链的含义:浏览器原生 API 已足够支撑实时语音 agent,无需引入 SDK。
原文:Gemini Live audio · 作者 Simon Willison