游乐游手机版
首页/AI热点日报/热点详情

亚马逊云科技智能2D数字人方案赋能教育行业

类型:热点整理2026-07-19
早在GPT-3 5这类大语言模型火爆之前,教育行业就已经在AI辅助教学领域探索多年。简单来说,人工智能技术为教育行业解决了诸多实际问题:提升教学质量、优化学习效率、改善学习体验与成效。例如,教师可以借助AI更精准地掌控课堂节奏,快速识别每个学生的薄弱环节,推送个性化学习内容,还能自动批改作业、评估学

早在GPT-3.5这类大语言模型火爆之前,教育行业就已经在AI辅助教学领域探索多年。简单来说,人工智能技术为教育行业解决了诸多实际问题:提升教学质量、优化学习效率、改善学习体验与成效。例如,教师可以借助AI更精准地掌控课堂节奏,快速识别每个学生的薄弱环节,推送个性化学习内容,还能自动批改作业、评估学习效果。再加上自动化的教学流程,整个行业运转更加高效。总之,AI在教育领域的渗透,带来的不仅是局部优化,而是一场深层次的变革。

亚马逊云科技一直在持续打磨自身的AI服务,助力教育行业客户实现技术创新与业务突破。像Amazon Transcribe、Amazon Polly、Amazon Textract、Amazon Translate、Amazon Personalize、Amazon Rekognition、Amazon SageMaker等产品,分别从自然语言处理、图像识别、模型训练与部署等角度,为教育场景提供了坚实的技术底座。

接下来,我们将结合Amazon Transcribe、Amazon Polly,再加上OpenAI的大语言模型和D-ID.com公司的2D数字人生成技术,逐步拆解一个支持语音对话的智能2D数字人如何设计,以及具体的实现流程。

方案架构

方案架构图

为了将语音输入、语音输出以及2D数字人视频播放整合在同一界面,我们选用Gradio框架搭建WebUI。最终呈现效果如下图所示:

用户既可以直接打字,也可以通过麦克风语音输入。打字时,内容会通过Langchain附加上下文后调用OpenAI的GPT接口;语音输入则先经由Amazon Transcribe转写成文字。GPT返回的文字内容,再调用Amazon Polly生成语音文件,同时该语音文件会作为D-ID.com API的输入,渲染出一段2D动态视频,并在前端自动展示和播放。

这套方案中,语音输入、语音输出、文字响应生成、数字人视频生成等环节均可自由组合与替换。例如,OpenAI的接口可以替换为自部署的大语言模型,2D数字人视频生成也可换成Heygen等类似服务。

具体实现

语音输入部分

Amazon Transcribe支持两种模式:实时转录(流式传输)和转录存储在Amazon S3中的语音文件(批处理)。它支持数十种语言,覆盖范围广泛。

特别值得一提的是Transcribe的实时转录能力,它在处理流数据的同时,会持续利用之前的上下文来修正识别结果。从下面这张截图可以直观看到其实时转录的输出效果:

实时转录截图

应答内容生成部分

应答内容的生成,我们借助了Langchain这一开源框架,调用OpenAI的conversation接口,并通过memory库保存最近5轮对话的上下文。在实际客户场景中,可以引入更丰富的机制来规范回复内容的有效性和客观性。

例如,使用Langchain的对话模板对大模型角色进行预设,或者接入Amazon Kendra、Amazon OpenSearch等知识库与检索引擎,进一步缩小大模型应答内容的范围。

语音输出部分

Amazon Polly能够将文字转换为逼真的语音。它支持多种语言,包括中文普通话,并提供了多种不同风格的声音模拟。

利用Polly,可以构建支持语音、适配各类场景的应用程序,并选择合适的声音。Polly还支持语音合成标记语言(SSML),这是一种基于XML的W3C标准,可用于控制断句、重音和语调。自定义的Amazon SSML标签还提供了独特选项,比如让某些文字以新闻播音员的风格朗读出来。这种灵活性让生成的语音更加生动、更具吸引力。

在我们的方案中,使用了Polly的实时语音生成接口,Voice ID选择了中文普通话发音的“Zhiyu”,并利用Polly的Lexion功能对特定字符的发音进行了定制化处理,这一功能确实非常实用。

2D数字人视频的生成部分

这里我们采用了来自D-ID.com的第三方SaaS服务。其API可以直接接收文本输入和一张人脸图片,生成对应的动态播报视频,也可以接受语音文件加图片作为输入。

如果输入文本,该API还能指定AWS Polly服务中的不同Voice ID,自动合成语音。不过在我们的方案中,为了体现中文语音输出效果,由于D-ID的API接口暂时无法为中文文本直接指定中文Voice ID,我们采取了一个迂回方案:先用Polly的API生成语音,再将语音和图片一起传给D-ID的接口生成视频。

总结

今年是AIGC爆发的一年,也是教育行业迎来明显拐点的一年。在这个关键节点上,亚马逊云科技愿与客户共同面对新的机遇与挑战,从客户需求出发,帮助他们抓住AI浪潮带来的红利。

目前除了本文展示的2D数字人方案,亚马逊云科技还提供基于3D数字人或其他3D数字形象的直播、互动等方案。同时,我们正持续引入更多技术合作伙伴——例如跃迁引擎——来丰富数字人、数字形象在直播、点播、互动等场景中的解决方案,助力更多教育行业客户加速AI技术的落地应用。

原发标题:近实时智能应答 2D 数字人搭建

来源:https://m.elecfans.com/article/2230276.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。