精选Simon Willison短讯
Gemini 3.8 Live 语音模型发布,附浏览器试用界面
simonwillison.net教程观点模型产品AI评分:70/100
谷歌今天发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两个语音到语音模型,形态类似 OpenAI 的 GPT-Live 系列。作者让 GPT-6 Astra Extra High 根据文档生成了一个网页 UI,可选择模型和语音预设、输入系统提示词,并在浏览器里进行语音对话,还能在模型说话时打断。实现不依赖任何库,直接连接 WebSocket 端点,用 Web Audio API 的 AudioContext 完成采集与播放。
Google 今天发布了 Gemini 3.8 Live 和 3.8 Live Extended Thinking——两个新的语音到语音模型,形态与 OpenAI 的 GPT-Live 系列类似。
我把 GPT-6 Astra Extra High 指向文档,让它为我构建了这个 Web UI,用来试用这些新模型。你可以选择模型和语音预设,输入可选的系统提示,然后通过浏览器开始语音对话,包括在模型说话时打断它的能力。

该实现不使用任何库。它连接到 wss://generativelanguage.googleapis.com/ws/google.ai.generativelanguage.v1alpha.GenerativeService.BidiGenerateContent?key=... WebSocket 端点,并使用 Web Audio API 的 AudioContext 进行采集和播放。
这是 Gemini Live 教程,可帮助你开始使用该 WebSockets API。