美股投资网获悉,谷歌(GOOGL)公布了Gemini 3.5 Transcribe,并称这是该公司迄今为止精确度最高的语音转文本模型。谷歌表示“与传统语音识别模型在处理背景噪音、复杂专业术语以及口语停顿和不流畅表达清理等问题时表现不佳不同,Gemini 3.5 Transcribe能够将原始音频直接转换为准确、经过润色且格式规范的文本。”
据悉,该模型旨在轻松接入开发者的工作流程,从而支持构建语音代理、实时字幕或通话后分析处理流程。开发者可以通过Live API实现实时流式处理,也可以通过Interactions API处理预先录制的音频。其部分功能包括智能转录,可自动清理文本,例如删除口头停顿;识别自定义词汇;支持超过85种语言;并能够识别最多3名说话者。
该模型在流式处理场景下的错误率为4%,非流式处理场景下的错误率为2.6%。在涵盖多种语言的FLEURS基准测试中,其表现也更好。例如,Gemini Transcribe 3.5 Live的词错误率为5.5%,相比之下,OpenAI的GPT Live Transcribe词错误率为8.9%。
新模型从今天起面向开发者和企业用户开放公开预览。对于其他所有用户,该模型目前可在macOS版Gemini应用中以英语使用,并可在部分国家的Android版Rambler中使用。该模型很快还将登陆Chrome。
本月早些时候,谷歌发布了Gemini 3.7 Flash,Gemini应用的用户数量也突破10亿。不过,谷歌尚未发布下一代旗舰模型Gemini 3.5 Pro。在今年5月举办的2026年I/O开发者大会上,皮查伊曾表示会在6月推出Gemini 3.5 Pro模型,但该模型至今仍未上线。按照原本规划,Gemini 3.5 Pro模型应该承担谷歌重新冲击AI前沿竞争的任务。毕竟,在OpenAI、Anthropic不断刷新模型能力的背景下,Gemini Pro系列一直是外界衡量谷歌AI实力的重要标尺。但下一款旗舰模型的发布时间迟迟无法确定,也进一步加剧了外界对这家科技巨头能否超越竞争对手、并成功将巨额AI投资转化为市场领先的工具和服务的广泛疑问。
最专业的美股资讯,推荐美股大数据 https://Stockwe.com/
如何识别美股市场异常波动?美国机构主力资金买卖情况,出货和吸筹,使用美股投资网VIP会员,2008年成立于美国硅谷,由前纽约证券交易所分析师Ken创立,联合多位摩根斯坦利分析师,谷歌 Meta工程师利用AI和大数据,配合十多年美股实战经验和业内量化模型,建立了一个股市数据库 https://StockWe.com/ 每天处理千万级股票数据:捕捉期权大单,实时主力资金流向、机构持仓变化、川普突发新闻,精准交易信号第一时间发到您手机APP!












