百度深度思考模型文心大模型X1.1来了
在最近的百度WA VE SUMMIT深度学习开发者大会上,百度带来了一系列重磅更新,其中最引人注目的当属文心大模型X1.1的发布。这个新版本在几个关键能力上实现了显著跃升:事实性能力提升了34.8%,指令遵循能力提升了12.5%,智能体能力也增强了9.6%。
更值得关注的是,它在多项基准测试中的表现已经超越了DeepSeek-R1-0528,整体效果与GPT-5和Gemini 2.5 Pro基本持平。这意味着,在基础大模型的竞技场上,我们又多了一位实力强劲的选手。

美团首款AI生活助手「小美」公测上线
本地生活服务巨头美团,也在这个九月正式迈入了AI Agent的赛道。其首款AI生活助手产品“小美”App,于9月12日官宣开启公测。
这款应用搭载了美团自研的LongCat-Flash-Chat模型,核心卖点在于通过简单的自然语言交互,就能丝滑地调用内部接口,完成外卖下单、餐厅推荐、订座导航等一系列操作。它背后的逻辑很有趣:不再是机械地执行命令,而是结合亿级用户的真实交易数据和评价,再揣摩你的个人喜好,来提供更“懂你”的推荐和服务。这或许标志着,AI正从工具演变为真正的生活伙伴。

字节开源图像生成,一个模型搞定多种任务
图像生成领域向来是“术业有专攻”,但字节跳动的UXO团队这次想换个玩法。他们设计并开源了一个名为USO的统一框架,目标很明确:让那些看上去不相关的任务(比如风格迁移和主体保持)能够相互促进,实现“1+1>2”的效果。
这个框架的厉害之处在于,它用一个模型就能统一处理之前需要多个专门模型才能搞定的任务,包括主体保持、身份保持、风格化编辑,甚至是复杂的多风格迁移。无论是参考图风格迁移,还是同时保持主体和风格,USO都表现出了强大的通用性,堪称图像编辑领域的“六边形战士”。

淘宝测试AI导购“帮我挑”,引领AI电商新体验
电商平台如何用AI提升体验?淘宝给出了新的答案。近期,淘宝正在测试一项名为“帮我挑”的AI电商导购功能。顾名思义,它旨在通过AI能力,为用户筛选出更符合其真实需求的商品或内容。
这并非淘宝在AI购物上的首次尝试,早在之前就有“AI万能搜”等功能。但“帮我挑”的上线,释放了一个更明确的信号:阿里的AI电商战略,正从赋能商家后台,大步走向前台,深度介入消费者的购买决策流程。未来的购物,或许真的会从“人找货”变成“货懂人”。

腾讯发布AI CLI工具CodeBuddy Code
对于开发者而言,效率就是生命线。腾讯本月推出的自研AI CLI工具CodeBuddy Code,正是瞄准了这个痛点。它成为了国内首款同时支持插件、IDE和CLI形态的AI编程工具。
它的能力如何?数据显示,它能帮助开发者缩短约40%的编码时间,AI生成的代码占比超过50%。用户只需输入自然语言命令,它就能自动执行代码重构、运行测试等复杂任务。背后集成了DeepSeek大模型,使其既能满足专业开发者的深度需求,也能让编程新手快速上手。简单来说,它就像在你的终端里安装了一个随叫随到的编程伙伴。

支付宝发布AI就业助手「晓叶」
AI的应用场景正在向社会服务领域深入。在外滩大会上,支付宝发布了AI就业助手“晓叶”。这款产品融合了人工智能大模型与数字人技术,旨在革新传统的就业服务模式。
“晓叶”并非简单的信息聚合器,它主打四大核心能力:智能撮合匹配岗位、在线模拟面试、个性化职业规划以及培训课程推荐。其目标是同时提升求职者和招聘方两端的体验与效率,让找工作这件事变得更智能、更人性化。

扣子空间上线AI Excel打造一站式办公
一站式AI办公平台的概念正在成为现实。继9月3日正式推出AI Excel能力后,扣子空间的AI设计版块也开始内测,集成了豆包图像创作模型Seedream4.0。
新模型带来了多图融合、图像修改等能力的升级。至此,扣子空间的产品矩阵已经相当清晰:它覆盖了AI写作、AI PPT、AI设计、AI Excel、AI网页、AI播客等主流办公场景,试图打造一个覆盖工作流全链路的智能办公套件。

谷歌Nano Banana模型走红
谷歌在图像生成领域也有新动作。其Gemini产品首页现已正式上线一个带有香蕉Emoji的“用Imagen生成图像”按钮。用户点击后,可直接输入提示词生成图像,无需再跳转到专门的Google AI Studio。
这背后是谷歌目前最先进的图像生成与编辑模型在提供支持。对于企业用户而言,该模型也已通过Vertex AI平台提供。这种将尖端能力“轻量化”、“入口化”的尝试,无疑降低了用户的使用门槛。

YouTube正式上线多语言配音功能
内容全球化是众多平台的追求。YouTube宣布,在经过长达两年的试点后,其多语言配音功能正式向所有创作者开放。在接下来的几周内,数百万创作者将能够为自己的视频添加多种语言的配音,从而触达更广泛的全球观众。
此外,YouTube还在测试多语言缩略图功能,允许创作者将封面上的文字翻译成观众偏好的语言。这两项功能的结合,旨在从“第一眼”到“完整观看”,全方位打破语言障碍,提升内容的全球吸引力。

Stability AI发布Stable Audio 2.5
最后,让我们把视线转向音频创作领域。Stability AI推出了新一代音频生成模型Stable Audio 2.5,其速度和质量令人印象深刻。新模型能在两秒内生成一段完整的三分钟音乐作品,在Nvidia H100 GPU上实现了高速处理。
它不仅快,而且“懂行”。模型能够精准响应“振奋人心”这类情感指令,也能还原“丰富合成器声”等具体的风格要求,创作出包含引子、发展和尾声的复杂乐曲结构。商业应用也已铺开,Stability AI与广告巨头WPP集团旗下的Amp达成合作,致力于为全球客户打造专属音频标识,推动AI音频在广告、零售等领域的落地。

