Google发布Gemini 3.5 Transcribe:语音转文字支持85种语言并自动去除语气词
Google推出新一代音频模型 Google公布了一款新的AI音频模型,公司称它在语音识别和转录方面有改进。Gemini 3.5 Transcribe加入了Gemini Audio家族,与Gemini 3.5 Live和Gemini 3.5 Live Experimental并列。 按照Google的说法,Gemini 3.5 Transcribe比早期模型更擅长语音转文字,精度更高,还能自动检测超过85种语言。它可以把用户无结构的口语整理成格式化文本。 语音指令编辑与语气词清理 用户可以用语音命令进行编辑,模型也会在转录时移除语气词。Google在社交平台上列出的能力包括:顺畅处理自我纠正、去除语气词以输出干净的格式化文本、理解自然意图和说话风格,以及准确捕捉音频。 Google还表示,这个模型可以学习自定义词汇和特殊拼写,擅长捕捉订单号、邮政编码这类字母数字字符串。公司称Gemini 3.5 Transcribe能够基于预录音频把语音归属到最多三位说话人,并提供词级时间戳。这对转录播客之类的场景可能有用。 落地场景与平台接入 Gemini 3.5 Transcribe为Android设备上的Rambler功能提供支持,包括Pixel 11系列手机,也支持macOS上的Gemini应用。在macOS上,它可以与其他Gemini模型配合执行智能体任务。 Google提到,用户很快就能在Chrome网页的任意字段中使用语音转文字。例如,可以口述回复和帖子,也可以用语音提示Gemini。Gemini 3.5 Transcribe还进入了Google Antigravity这个智能体开发平台,并将陆续接入Search Live、Gemini Live、Docs、Keep和Gmail。开发者可以通过API使用该模型。 特别
2-1!4-1!皇马无解,降维打击西甲黑马 剑指两连胜,穆里尼奥押宝
拥抱篮球,享受飞跃篮筐的每一刻!...
[无下一篇]
拥抱篮球,享受飞跃篮筐的每一刻!...