기사 주제 학습 다운로드 Q&A 프로그래밍 사전 게임 최근 업데이트

简体中文(ZH-CN) English(EN) 繁体中文(ZH-TW) 日本語(JA) 한국어(KO) Melayu(MS) Français(FR) Deutsch(DE)

집 > 기술 주변기기 > 일체 포함 > 본문

再胜OpenAI！谷歌发布20亿参数通用模型，100多种语言自动识别翻译

WBOY

풀어 주다： 2023-04-25 12:04:06

앞으로

1359명이 탐색했습니다.

上周，OpenAI发布的ChatGPT API和Whisper API，刚刚引动了一场开发者的狂欢。

3月6日，谷歌就推出了一款对标的模型——USM。不仅可以支持100多种语言，而且参数量也达到了20个亿。

当然了，模型依然没有对外开放，「这很谷歌」！

再胜OpenAI！谷歌发布20亿参数通用模型，100多种语言自动识别翻译

简单来说，USM模型在涵盖1200万小时语音、280亿个句子和300种不同语言的无标注数据集中进行了预训练，并在较小的标注训练集中进行了微调。

谷歌的研究人员表示，虽然用于微调的标注训练集仅有Whisper的1/7，但USM却有着与其相当甚至更好的性能，并且还能够有效地适应新的语言和数据。

再胜OpenAI！谷歌发布20亿参数通用模型，100多种语言自动识别翻译

论文地址：https://arxiv.org/abs/2303.01037

结果显示，USM不仅在多语种自动语音识别和语音-文本翻译任务评测中实现了SOTA，而且还可以实际用在YouTube的字幕生成上。

目前，支持自动检测和翻译的语种包括，主流的英语、汉语，以及阿萨姆语这类的小语种。

最重要的是，还能用于谷歌在去年IO大会展示的未来AR眼镜的实时翻译。

再胜OpenAI！谷歌发布20亿参数通用模型，100多种语言自动识别翻译

Jeff Dean亲自官宣：让AI支持1000种语言

当微软和谷歌就谁家拥有更好的AI聊天机器人争论不休时，要知道，大型语言模型的用途可不仅于此。

去年11月，谷歌最先宣布了新项目「开发一种支持全球1000种最常用语言的人工智能语言模型」。

再胜OpenAI！谷歌发布20亿参数通用模型，100多种语言自动识别翻译

同年，Meta也发布了一个名为「No Language Left Behind」模型，并称可以翻译200多种语言，旨在打造「通用翻译器」。

而最新模型的发布，谷歌将其描述为通向目标的「关键一步」。

在打造语言模型上，可谓群雄逐鹿。

据传言，谷歌计划在今年的年度 I/O 大会上展示20多款由人工智能驱动的产品。

当前，自动语音识别面临许多挑战：

传统的监督学习方法缺乏可扩展性

在传统的方法中，音频数据需要费时又费钱的手动标记，或者从有预先存在的转录的来源中收集，而对于缺乏广泛代表性的语言来说，这很难找到。

扩大语言覆盖面和质量的同时，模型必须以高效的计算方式进行改进

这就要求算法能够使用来自不同来源的大量数据，在不需要完全重新训练的情况下实现模型的更新，并且能够推广到新的语言和使用案例。

微调自监督学习

据论文介绍，USM的训练采用了三种数据库：未配对的音频数据集、未配对的文本数据集、配对的ASR语料库。

未配对的音频数据集

包括YT-NTL-U（超1200万小时YouTube无标签音频数据）和Pub-U（超429,000小时的51种语言的演讲内容）

未配对的文本数据集

Web-NTL（超1140种不同语言的280亿个句子）

配对的ASR语料库

YT-SUP +和 Pub-S语料库（超10,000小时的音频内容和匹配文本）

再胜OpenAI！谷歌发布20亿参数通用模型，100多种语言自动识别翻译

USM使用标准的编码器-解码器结构，其中解码器可以是CTC、RNN-T或LAS。

对于编码器，USM使用了Conformor，或卷积增强Transformer。

训练过程共分为三个阶段。

在初始阶段，使用BEST-RQ（基于BERT的随机投影量化器的语音预训练）进行无监督的预训练。目标是为了优化RQ。

在下一阶段，进一步训练语音表征学习模型。

使用MOST（多目标监督预训练）来整合来自其他文本数据的信息。

该模型引入了一个额外的编码器模块，以文本作为输入，并引入了额外的层来组合语音编码器和文本编码器的输出，并在未标记的语音、标记的语音和文本数据上联合训练模型。

最后一步便是，对ASR（自动语音识别）和AST（自动语音翻译）任务进行微调，经过预训练的USM模型只需少量监督数据就可以取得很好的性能。

再胜OpenAI！谷歌发布20亿参数通用模型，100多种语言自动识别翻译

USM整体训练流程

USM的性能如何，谷歌对其在YouTube字幕、下游ASR任务的推广、以及自动语音翻译上进行了测试。

YouTube多语言字幕上的表现

受监督的YouTube数据包括73种语言，每种语言的数据时长平均不到3000个小时。尽管监督数据有限，但模型在73种语言中实现了平均不到30%的单词错误率（WER），这比美国内部最先进的模型相比还要低。

此外，谷歌与超40万小时标注数据训练出的Whisper模型 (big-v2) 进行了比较。

在Whisper能解码的18种语言中，其解码错误率低于40%，而USM平均错误率仅为32.7%。

再胜OpenAI！谷歌发布20亿参数通用模型，100多种语言自动识别翻译

对下游ASR任务的推广

在公开的数据集上，与Whisper相比，USM在CORAAL（非裔美国人的方言英语）、SpeechStew（英文-美国）和FLEURS（102种语言）上显示出更低的WER，不论是否有域内训练数据。

两种模型在FLEURS上的差异尤为明显。

再胜OpenAI！谷歌发布20亿参数通用模型，100多种语言自动识别翻译

在AST任务上的表现

在CoVoST数据集上对USM进行微调。

将数据集中的语言按资源可用性分为高、中、低三类，在每一类上计算BLEU分数（越高越好），USM在每一类中的表现的优于Whisper。

研究发现，BEST-RQ预训练是将语音表征学习扩展到大数据集的一种有效方法。

当与MOST中的文本注入相结合时，它提高了下游语音任务的质量，在FLEURS和CoVoST 2基准上实现了最好的性能。

通过训练轻量级剩余适配器模块，MOST表示能够快速适应新的域。而这些剩余适配器模块只增加2%的参数。

再胜OpenAI！谷歌发布20亿参数通用模型，100多种语言自动识别翻译

谷歌称，目前，USM支持100多种语言，到未来将扩展到1000多种语言。有了这项技术，或许对于每个人来讲走到世界各地稳妥了。

甚至，未来实时翻译谷歌AR眼镜产品将会吸引众多粉丝。

不过，现在这项技术的应用还是有很长的一段路要走。

毕竟在面向世界的IO大会演讲中，谷歌还把阿拉伯文写反了，引来众多网友围观。

再胜OpenAI！谷歌发布20亿参数通用模型，100多种语言自动识别翻译

위 내용은 再胜OpenAI！谷歌发布20亿参数通用模型，100多种语言自动识别翻译의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

관련 라벨：

谷歌模型

원천：51cto.com

이전 기사：微软总裁布拉德・史密斯：中国将是 ChatGPT 的主要对手，我们的优势不大 다음 기사：科技大公司上万人研究AI，为何比不上OpenAI小团队

본 웹사이트의 성명

본 글의 내용은 네티즌들의 자발적인 기여로 작성되었으며, 저작권은 원저작자에게 있습니다. 본 사이트는 이에 상응하는 법적 책임을 지지 않습니다. 표절이나 침해가 의심되는 콘텐츠를 발견한 경우 admin@php.cn으로 문의하세요.

저자별 최신 기사

전문가들은 Rollblock(RBLK)이 2024년에 과거 인터넷 컴퓨터(ICP)와 Near Protocol(NEAR)을 급증시킬 것이라고 믿습니다.

2024-07-20 01:15:31
Rollblock(RBLK): 여름 최대 수익을 볼 것으로 예상되는 GambleFi 토큰

2024-07-20 01:12:20
2024년 8월 시장 급등 이전에 투자할 숨겨진 보석 알트코인 5개

2024-07-20 01:10:00
Notcoin(NOT) 및 Mpeppe(MPEPE): 100배 이익 잠재력을 지닌 유망한 알트코인

2024-07-20 01:03:57
심장이 뛰는 마을에서 에릭의 피아노 임무 안내

2024-07-20 01:00:30
Windows 10에서 보안 로그인을 활성화 또는 비활성화하는 방법

2024-07-20 00:59:02
React의 오류 경계 마스터하기: 효과적인 오류 처리 가이드

2024-07-20 00:55:30
'영웅전설'에서 독 스킬을 향상시키는 방법

2024-07-20 00:53:19
'Beast Lord: New World' 코끼리의 복수 게임 플레이 가이드

2024-07-20 00:47:18
'Zero Zero' Woodpecker의 전자음악 효과 목록

2024-07-20 00:45:53

최신 이슈

Vue 프로젝트에 모듈이 정의되지 않았습니다. 공식 문서에 명시된 대로 npmini tvue@latest를 실행하여 새로운 Vue 애플리케이션을 만들었습니다. 그런 다음 Vue 및 Vite 웹 사이트의 가이드...

에서 2023-11-17 12:38:53

0

2

394

tp6 쿼리를 최적화하는 방법 tp6 모델이 쿼리를 위해 여러 데이터 테이블과 연결되면 쿼리가 매우 느려집니다. 최적화 방법이 있습니까? 돕다! ! ! ! !

에서 2023-11-17 08:50:36

0

0

84

역할에 따라 각 사용자에 대한 권한 집합을 정의하기 위해 Laravel Spatie 권한 설정 방법을 설정하는 방법은 무엇입니까? 내 시스템을 사용하는 사용자 유형은 4가지입니다. 1. 최고 관리자 2. 팀 최고 관리자, 3. 관리자, 4. 팀원을 관리하다 보니 역할과 권한을 관리하기 위해 ...

에서 2023-11-14 12:58:58

0

1

292

WordPress 6.0(add_editor_style)은 Gutenberg 편집기에서 style.css를 로드하지 않습니다. 저는 맞춤형 WordPress 블록 테마를 만들기 위해 UdemyWordPress 과정을 수강하고 있습니다. function.php에 블록 유형을 성공적으로 등록...

에서 2023-11-12 20:37:50

0

2

261

PHPMailer 정의되지 않은 유형 오류가 발생했습니다(Composer를 사용해도 작동하지 않음) 왜 "PHPMailer 정의되지 않은 유형" 오류가 발생하는지 모르겠습니다. 먼저 zip을 직접 다운로드하고 github에서 코드를 복사해 보았...

에서 2023-11-12 17:35:06

0

1

180

관련 주제

더>

인기 추천

인기 튜토리얼

더>

관련 튜토리얼

인기 추천

최신 강좌

최신 다운로드

더>

웹 효과

웹사이트 소스 코드

웹사이트 자료

프론트엔드 템플릿

회사 소개 부인 성명 Sitemap: PHP 중국어 웹사이트：공공복지 온라인 PHP 교육，PHP 학습자의 빠른 성장을 도와주세요！