壹零社 2023-06-01 12:41 发表于重庆
01
AI大模型“通义听悟”的基本功能
(资料图片)
核心功能: 实时记录、发言人区分、中英粤语识别、中英自由说、实时翻译、全文概要、章节速览、关键词、发言总结、问题回顾、值得关注、待办事项、字幕下载、导出笔记、云盘音视频一键转写、Chrome插件、提取PPT、内容问答等。
通义听悟PC端链接: tingwu.aliyun.com
读者专属口令: 和电脑报听悟
1个口令对应100个包含20小时听悟转写时长的权益包(目前音视频AI转写市场定价约19.8元每小时)。
除音视频转写外,听悟还内置丰富实用的AI大模型功能,等待粉丝们解锁。
新注册用户登录后会获赠10个小时的转写时长,同一个口令只能使用一次,用户可以使用不同的口令叠加转写时长,封顶到100个小时。
场景举例:
功能 | 具体解释 |
实时记录/翻译 (基础功能,目前有网页、移动端和Chrome插件的设计) | 实时记录/翻译:音视频实时转录+翻译,有PC端/移动端/插件等多个版本,随时随地支持各种场景。 场景举例: 课堂:随时实时转录课程内容; 看视频:无论是看Ted、英文纪录片,还是直播,都可以通过听悟插件,挂在视频上即可实时转录+翻译,该功能近期将向所有用户开放下载; 旅游:口袋翻译机,外国旅游无障碍交流;出去玩,开着听悟听导游讲解,结束后一键整理景点介绍 会议:AI开会替身,实时记录,出去一下不会错过任何内容,会后随时查漏补缺 写作:不想打字的时候,通过口述让AI实时记录和整理长段内容 无障碍:听障人士随时随地打开,无障碍交流、上课、学习网络视频 外教课:随时随地打开,听不懂时可以瞟字幕 |
发言人区分/问题回顾 | 发言人区分:自动区分不同人物说话; 问答回顾:访谈类内容抽取所有提问; 场景举例: 新闻:采访音频直接区分人物身份,并可通过问题回顾抽取问题,高效整理采访; 法律:当事人访谈记录转写,自动区分人物,抽取关键提问; 新媒体:视频内容分析 |
全文摘要/章节速览/发言总结 (大模型相关功能) | 全文摘要:长篇视频内容,AI可一秒总结核心内容,可从万字长文缩短至200字概要; 章节速览:AI生成视频时间轴,一眼看完核心信息;并可根据文字内容,直接对应到视频时间点,便于回看原视频内容。 发言总结:AI自动总结每个发言人观点 |
云盘文音视频一键转录 | 和阿里云盘账号打通,云盘内音视频文件,不用重新下载和上传视频,就可以直接转写;听悟用户后续还将获得更大的阿里云盘存储空间,在云盘内在线播放视频时也可自动出字幕。 |
即将上线功能:
Chrome插件: 打开Chrome插件双语悬浮字幕条,外语学习者和听障人士可以随时随地看无字幕视频,AI还可成为“开会替身”,戴着耳机或静音情况下也可读取声源,随时随地代为记录、整理要点。插件目前限量开放中,很快将面向所有用户开放下载。
内容问答: 通过chat聊天的方式直接对视频提问,听悟可根据视频学到的内容作答,近期将上线。
提取PPT: 课程类内容,听悟可直接抽取视频内PPT截图,近期上线。
场景梳理参考:
场景 | 细分描述 | 对应功能 |
学习场景 | 录课,方便整理笔记,复习使用 上课走神,想查漏补缺 期末抱佛脚,想快速提取消化网课内容 国外留学,语言缘故跟不上老师讲课节奏 练习中英文口语表达,方便复盘语音语法和表达逻辑 | 实时记录 实时翻译 关键词 全文摘要 章节回顾 云盘视频转写 |
会议场景 | 专注讨论,难以及时整理会议内容 会议时间长,想高效回顾会议重点 多人会议讨论,想快速厘清每个发言人的讲话内容 | 说话人区分 章节回顾 全文摘要 发言总结 |
培训讲座 | 内容太长,想快速获取摘要内容 口水稿格式杂乱,想快速整理信息 | 全文摘要 内容规整 |
新闻媒体 | 重要发布会,想第一时间出稿 新媒体人,想做金句混剪或者提取金句摘要,直接把视频放进来转写,快速找到自己想要的那句话,还有timeline 做视频时想快速加字幕,AI转写后可修改调整后下载srt文件 | 实时转写 章节回顾 发言总结 文本检索 下载srt文件 |
生活场景 | 外语视频翻译,快速出译文初稿 看英文纪录片,没有中文字幕时想AI即时翻译 听障群体“看见”音视频 外出旅游,可以打开小程序随身翻译 | 实时转写 实时翻译 Chrome插件 |
02
“通义听悟”成为国内首个
开放公测的大模型应用产品
6月1日,阿里云宣布通义大模型进展,聚焦音视频内容的AI新品“通义听悟”正式上线,成为国内首个开放公测的大模型应用产品。通义听悟接入了通义千问大模型的理解与摘要能力,可成为用户工作学习中的得力AI助手,帮助随时随地高效完成对音视频内容的转写、检索、摘要和整理,比如用大模型自动做笔记、整理访谈、提取PPT等。公测期间,用户可领取100小时以上听悟免费转写时长。
“换一种方式,让音视频可以被轻松阅读、整理和分享。”阿里云CTO周靖人介绍,听悟是一款工作学习AI助手,它瞄准具有高知识附加值的音视频内容场景,比如开会、上课、访谈、培训、面试、直播、看视频、听播客等,能通过大模型等最新AI技术快速提炼和沉淀知识。
根据现场演示,听悟融合了十多项AI功能,可以全面提升知识从音视频向图文形态转化的效率。除了“听力好”,能高准确度生成会议记录、区分不同发言人,这个AI助手“悟性也极高”,大模型可以一秒给音视频划分章节并形成摘要、总结全文及每个发言人观点、整理关注重点和待办事项。大模型一键提取PPT、针对多个音视频内容向AI提问、概括特定段落等功能近期也将上线。
通义听悟可自动为音视频生成全文摘要、章节概括、发言总结
针对一些细分场景,听悟还设置了不少“宝藏功能”:打开Chrome插件,外语学习者和听障人士可以借助双语悬浮字幕条随时随地看无字幕视频,日程冲突时,听悟还可成为职场人士的“开会替身”,在静音情况下入会AI可代为记录会议、整理要点;转写结果可下载为字幕文件,方便新媒体从业者视频后期制作;听悟梳理的问答回顾可以让记者、分析师、律师、HR等群体整理访谈更高效。
通义听悟Chrome插件将在近期对所有用户开放下载
另一显著优势是,听悟与阿里云盘打通,一键就能转写云盘上的音视频内容,公测期间注册的听悟用户后续还将获得更大的阿里云盘存储空间,在云盘内在线播放视频时也可自动出字幕。
通义听悟支持一键导入阿里云盘音视频文件
周靖人介绍,听悟集成了阿里最先进的语音和语言技术。其内置阿里新一代工业级语音识别模型,识别准确率在多个权威中文数据集上名列第一;融合自研语音语义多模态说话人算法,能对10人以上说话场景进行角色区分;接入通义千问大模型后,能够对上万字的音视频内容进行摘要总结,事实准确与要点完备性国内领先,支持跨多音视频内容的精准问答理解。
继史无前例的大降价后,阿里云再次送出人人都能用上的AI“大礼包”。此前国内语音厂商AI转写定价达19.8元每小时,而听悟用户可通过每日登陆等多种任务领取免费转写时长。公测期间,阿里云官方微博、微信及各大平台社区还会发放大量20小时转写口令码,用户获得的福利权益可累加,一年内有效,免费时长可高达100小时以上,市场价值上千元。
据了解,听悟除个人版本外,还有企业应用。此前,听悟企业版已在阿里集团内部被广泛使用,帮助减少了大量会议记录和整理的工作,受到好评。同时,听悟的能力也可嵌进各类音视频平台,形成实时字幕、智能摘要等,典型应用如钉钉的“钉闪记”背后便集成了听悟。未来听悟还将在夸克APP、阿里云盘等端口提供服务。
“钉闪记”背后集成通义听悟