传音在人工智能产学研协同方面再迎新突破,携手中山大学与穆罕默德·本·扎耶德人工智能大学(MBZUAI),共同推进了一项名为“拍照解题”的研究项目。成果斐然——其相关研究论文已被计算机视觉顶级会议CVPR 2026正式接收。

提及CVPR,业内都深知其含金量。作为IEEE主办的计算机视觉与模式识别领域顶级学术会议,它与ICCV、ECCV并称为“三大顶会”,并在中国计算机学会(CCF)推荐列表中位列A类。本届CVPR 2026投稿量超过3万,进入正式评审的有效论文达16,092篇,最终录用率仅为25.42%。每篇论文均需经过3至5位全球顶级专家的双盲评审,能够从中脱颖而出,质量可见一斑。

近年来,AI大模型在逻辑推理与复杂问题求解方面取得了显著进展,然而在实际应用中,一个长期存在的难题仍未完全攻克:复杂数学题的精准处理。具体表现为:有时答案正确但推理过程存在明显漏洞;有时步骤看似完整,但中间某步推导逻辑不成立。这些问题在学习场景中尤为突出——对学生而言,推理过程的正确性往往比最终答案更为关键,因为掌握知识依赖的是理解过程,而非单纯猜测结果。
针对这一痛点,传音TEX AI中心联合中山大学与MBZUAI团队,提出了一套名为CARE(Contrastive Anchored REflection)的创新技术。简而言之,CARE不再像传统方法那样仅依据“结果对错”给予反馈,而是将关注点前移至推理过程本身。其核心在于引入“高质量错误样本”——即那些答案接近正确但关键步骤出现偏差的解题路径。通过将这些样本与标准解题方法进行对比,并结合反思式重推理机制,模型能够自主识别出具体在哪一步出错,进而自我修正。效果令人瞩目:引入反思机制后,模型对复杂问题的二次推理成功率从原有的10%–19%大幅提升至76.6%。这意味着,面对难题时模型不再轻易“翻车”,稳定性实现了质的飞跃。
更为巧妙的是,CARE还内置了一个“救援机制”。即使模型多次尝试仍未得出正确答案,系统也不会直接放弃,而是从已有的错误路径中筛选出一个“相对最优解”,作为继续学习的起点。如此一来,即便是最复杂的问题,模型也能在试错过程中不断优化自身的推理能力。

实际测试数据充分验证了该方法的有效性。在MathVista(图像数学推理)基准测试中,CARE的准确率达到82.1%,较传统方法的68.9%提升了13.2个百分点;在MMMU-Pro(多学科综合推理)上,准确率从36.4%跃升至46.7%。整体而言,CARE相比传统方法平均提升了4.6个百分点。
技术再出色,若无法落地应用也毫无意义。好消息是,CARE已进入产品化阶段,正逐步集成至传音手机的智能助手中。经过优化的拍照解题功能,不仅能够提供答案,还能呈现更清晰、结构更完整的解题步骤。特别在多步骤推导场景中,逻辑中断或错误累积的问题显著减少。这种“过程可解释”的能力,使AI从单纯的解题工具,转变为能够“辅助理解”的学习伴侣。
拍照解题功能,传音瞄准的是教育应用中的真实痛点。在非洲、南亚等地区,教育资源相对匮乏,学生课后寻求辅导极为困难。传音将拍照解题功能集成到手机中,相当于为每位学生配备了一位随时在线的解题老师——不仅提供答案,还会将解题思路一步步拆解清楚。这种“即拍即得”的方式,能够有效弥补学习支持资源的不足,让前沿科技真正服务于日常生活的每一个角落。
随着AI技术加速渗透进真实场景,评判一家公司技术实力的标准,已不再是论文数量或模型参数,而是能否将能力融入用户日常使用的产品中。传音在这条道路上稳步前行——社交、出行、健康、教育,每个高频场景都在进行AI深度整合。此次CARE技术从论文到产品的快速落地,也为AI在教育场景的进一步探索提供了新的技术路径与实践基础。可以预见,随着产学研协同的持续推进,更多像“拍照解题”这样的实用功能,将使更多人切实感受到AI带来的便利。
