游乐游手机版
首页/AI热点日报/热点详情

腾讯AI数据智能体Lumos已彻底颠覆传统数据分析

类型:热点整理2026-07-21
腾讯推出的Lumos数据智能体,将大数据、表格与AI融合,使非技术人员能像操作Excel一样完成复杂数据分析。采用多智能体架构、共享工作记忆机制和分层计算框架,通过工具调用与AICoding结合,提升分析效率与准确性,实现零门槛自助分析。
# 腾讯Lumos数据智能体:用AI+表格让大数据分析像Excel一样简单 大数据分析的门槛正在被重新定义。腾讯推出的Lumos数据智能体,把大数据、表格和AI三者融为一体,目标很明确——让非技术出身的一线业务同学,也能像操作Excel那样完成复杂的数据分析任务。 这篇文章会详细拆解Lumos的技术思路和落地实践,包括多智能体架构如何解决专业分析问题、共享工作记忆机制怎么保证一致性、分层计算框架带来了哪些效率提升,以及AI Coding和工具调用之间的取舍逻辑。 --- ## 0. 内容摘要「万字长文的浓缩」 ### 0.1 产品及技术思路 **产品定位:** 大数据 + 表格 + AI,协作完成更全领域的一线数据分析任务。 **产品思考:** 表格分析这种大家熟悉且久经验证的交互形态,结合AI实现的数据分析工作台,最有可能实现零门槛大数据自助分析。 **产品能力:** 以简单、熟悉的表格操作 + 无边界的数据引入 + AI驱动,实现从分析到报告的全流程能力,并尝试化繁为简。 **技术思路:** 从分析环境、Data Agent和分析情景三个角度出发,思考技术要素。当前模型能力有限的情况下,人可以通过环境操作来验证Agent结果,这是必不可少的能力。 **实用性驱动的技术方案设计:** 优先考虑AI能增强的场景,基于场景设计Agent主体和对公共能力的需求,再根据Agent需求驱动环境产品的建设,全流程都考虑到AI应用需求。 ### 0.2 Lumos落地实践 **为什么Lumos选型做成多智能体?** 数据分析任务中的高价值问题,往往一个简单问题对应着多任务、多步骤才能回答好。为了适应复杂场景,更好地解决专业领域问题,同时避免主体Agent负担过重,设计成多智能体,保证灵活且专业。 **如何解决多智能体存在的一致性问题?** 设计共享工作记忆机制,多个Agent之间可以观察到各自的目标、计划、结果及状态。任务顺序执行,确保下游任务可以有效利用上游的结果。并行执行效率的损失,可以通过解决更关键的查询和计算工具效率来弥补。 **如何实现极致查询&计算工具响应?** 结合引擎能力实现分层计算框架,并细分场景持续优化。提升Agent执行效率的同时,也让用户手动验证Agent结果更加高效,这有助于构建信任并提升体验。 **如何做AI Coding和工具调用之间的选择?** 优先使用工具调用,工具存在局限性时使用AI Coding。同时构建监控机制,分析AI Coding输出的内容,驱动工具迭代。从机制上实现大部分场景由工具提供稳定效果,AI Coding提供足够的灵活性,整体通过率自然提升。 **如何通过MCP共建专家Agent,满足业务复杂分析需求?** 结合Planner能力和MCP、插件服务,让整个系统足够开放,业务知识、工具、算法可以有效融入产品,适配度随之提升。 **如何提高用户提问的有效性?** 通过基于表的问题推荐能力和多轮问题推荐能力,帮助用户快速提问。结合澄清能力,通过多轮澄清让用户有效提问,避免无效回答干扰上下文。 **如何对Agent的分析能力进行有效测评?** 构建持续的产品能力测评和Agent能力测评机制,持续验证通过率、质量、效果并进行调优。通过分析认知驱动,基于数据表、数据域、分析方法、分析方式四大领域八个类型的打标和完善,持续构建有效的内部Benchmark,并探索不同任务的测评方法。 **工程结构优化,保证Data Agent稳定性** 通过合理的应用层划分、公共层引入和模型层设计原则,让Data Agent的开发迭代有序且聚焦。 ### 0.3 下一步计划 重点优化Tomoro Lumos智能体效果,推进业务知识、工具引入及场景验证,深化业务协作,持续提升能力。 --- ## 1. AI小蓝表Tomoro的产品及技术思路 ### 1.1 Tomoro产品定位——AI表格式大数据分析工具 Tomoro的初衷很直接:让一线消费数据的同学,能在这里解决全领域的数据分析问题。覆盖整个数据分析过程,实现真正的数据平权和提效,消除数据生产者与消费者之间的技术鸿沟。 要做到这一点,产品上需要把大数据、表格和AI三者组合起来: **中台BI多年沉淀的分析引擎核心能力(大数据分析能力提炼)** - DataTalk沉淀的百亿大数据秒级查询链路能力 - DataTalk沉淀的出图、业务分析函数等分析领域原子工具能力 - DataTalk沉淀的业务数据模型、用户分析case、真实场景的复杂分析路径 **重塑UI为产运用户更熟悉的表格式形态(升级表格交互)** - 低学习门槛,每一步操作数据所见所得,激发探索灵感 - 预装挂载的数据资产和丰富的数据源连接 - 可扩展函数公式和功能插件,提升通用性 - 亿级数据,秒级响应,适应真实业务分析的数据规模 **探索AI分析师:感知和陪伴用户分析全流程(AI嵌入)** - AI拆解复杂分析任务,规划分析路径,为用户提供分析灵感与引导 - AI对复杂分析问题,进行SQL加Python编码处理 - AI吸收业务个性化知识,更懂业务上下文,给出更好的分析思路发散和洞察总结 ### 1.2 Why Tomoro——目标:实现零门槛大数据自助分析 过去我们设计并实现了很多大数据分析工具产品,希望实现零门槛的自助分析。但在深入业务一线调研和访谈后,发现非技术同学进行大数据分析时,依然面临显著障碍,主要集中在两方面: **BI数据理解困难:** 他们希望数据能“找得到、能理解、看得懂”。但实现这个目标需要一个非常完备且治理清晰的语义层。真实的业务往往随着市场变化不断迭代,很难保证数据的完备性。数据不完备时,就需要掌握BI平台规则、数据仓库等大量概念才能提取和调整底层数据。非技术同学很难理解这些操作,最终只能转成需求,由数据工程老师或专门负责取数的同学解决。 **分析工具使用习惯和门槛问题:** Excel自1982年问世以来,其表格分析形态已经深入人心。过往数据工具建设中,很多用户提出“能不能像Excel一样”的需求——直观的明细操作、透视表、分列功能、公式计算等特性。 要让非技术同学自助分析不求人,需要回到一线需求本身,以“分析任务解决率”为目标,思考突破性的、贴合用户习惯的AI分析产品方案。 ### 1.3 Tomoro产品设计框架 #### 以简单、熟悉的方式导入数据并进行基础分析 基于上面的洞察,我们希望Tomoro以简单、熟悉的方式开启分析。所有数据分析相关的数据源都应该是“无边界”的,总结为三类: **数据库/大数据引擎等传统数据仓库数据分析:** Mysql、StarRocks、Clickhouse、Thive等 **数据分析相关的平台类数据:** DataTalk报表系统、腾讯文档、腾讯问卷等多个与数据分析流程强相关的平台数据 **数据分析过程可能涉及的多模态数据:** 带数据的截图、数据分析报告相关的PDF等 有了数据之后,所有的分析都应该以类Excel形式进行,用户可以直面表格分析数据。同时实现亿级数据秒开,结合AI优化,支持用户快速理解元数据信息。分析操作也必须是用户熟悉的表格操作,比如这些特性: - **「枚举值筛选」** 即席获取数据,像本地操作一样“快” - **「分组聚合」** 分级加速,分析体验不受数据量级影响 - **「函数计算完成列操作」** 无需牢记函数公式,AI生成函数轻松完成 - **「vlookup关联多表」** 多元数据轻松关联 #### 以简单、熟悉的方式进行专业分析&可视化生成 除了基础分析能力,相对高阶的数据分析功能也是必需的: **交叉透视表:** 用习惯的方式进行数据洞察和下钻分析 **数据可视化:** 多种可视化图形能力,风格和样式上可以比肩Tableau **分析结果交付:** 分析报告、仪表盘的配置生成和更新能力 在这些能力的不同场景中,都支持一定程度的AI嵌入,实现使用体验和效率的提升。 #### AI驱动,分析全流程化繁为简 有了基础和高阶分析能力,Tomoro还仅仅是一款数据分析产品。在AI时代,我们希望赋予Tomoro灵魂——以AI驱动,实现分析全流程的化繁为简。 传统分析工具,用户需要基于分析目的自行推导下一步分析步骤,手动完成操作。整个过程需要在页面多个位置反复操作,非常繁琐。 在Tomoro中,AI可以学习用户的历史分析习惯,实时获取前序分析操作,启发和推荐下一步分析,贯穿用户完整的分析流程。用户只需要不断点击下一步推荐,就能轻松完成复杂分析。探索后的分析工作流也能被记录,后续例行分析时,Workflow可以全自动执行。 这块能力需要持续探索和优化,目前我们通过分析指南、列表操作推荐、分析推荐等能力来验证。期待未来结合业务使用,实现更加贴心有效的算法和产品形态。 ### 1.4 Tomoro技术设计框架 #### 技术思路的关键点:环境 + Agent + 分析情景 在产品核心理念的引导下,技术方案有三个关键内容: **Tomoro环境:** 把Tomoro当作一个类似工作台的运行环境来设计,既支持人使用,也支持被Data Agent使用。环境需要简单、高效,具备以下要素: - 可交互:给人交互的GUI加给Agent使用的简单OpenAPI - 能计算:分析引擎加分析工具集,实现按需的计算和分析能力 - 有素材:元数据加数据资产,支持对无边界引入的数据管理 - 要安全:权限管控加环境隔离,保障各场景数据安全 **Lumos数据智能体:** 长期来看,Lumos应该像一个数据伙伴,协同用户解决数据分析中的各类问题,需要具备足够的灵活性和专业性。Lumos需要具有以下能力: - 有思路:通过Planning能力结合用户的问题和场景独立思考和规划 - 用工具:通过Function Call加Coding能力,会使用已有工具,并通过AI Coding创造更多工具 - 会对齐:通过多轮对话加业务知识和环境信息注入等方式对齐,理解复杂的分析需求、业务背景和环境信息 - 能交付:在问答、报告、洞察等不同场景中,都能输出有效的交付物 **用户分析情景:** 需要涵盖用户在数据分析中的全领域内容,比如: - 【思路分解】分析目标、分析思路确认 - 【预处理】过滤、清洗和预处理的整理计算 - 【探索洞察】数据探索和分析洞察 - 【高级分析】机器学习、算法任务 - 【结果呈现】数据可视化、总结效果、报告生成 长期来看,用户在不同分析情景的任务应该主要由Data Agent接受指令,直接交付成果,用户主要应用数据价值。但目前Data Agent受限于模型幻觉和场景能力不足,还不能实现全场景的高效应用,可能引发用户对AI的信任问题。基于这个考虑,人能结合Excel操作心智快速操作环境获取数据,这一步骤非常关键。通过页面操作校验和快速验证AI结果,是构建长期AI应用信任的关键能力,也是AI观察和学习用户操作的关键入口。 #### 实用性驱动的技术方案设计,实现大数据与AI融合 基于以上AI与Tomoro结合的思考,我们按照实用性驱动的逻辑来驱动大数据与AI产品的技术落地: **STEP 1: AI场景分析&设计** 在整体设计开发之前,先思考AI在整个流程中到底有哪些实用场景可以帮助用户提升效率: **分析引导** - 智能菜单推荐(步骤中引导) - 分析指南(整体说明和分析思路建议) - 仪表盘一键生成(可视化方式提供全局建议) **页面操作提效** - 对话生成操作指令,加速页面筛选 - 对话分析实现可视化出图 - 对话报告生成和调整 **分析数据准备** - 文本内容智能提取 - 推荐分析函数等 **STEP 2: 按AI场景需求设计Lumos** 结合AI分析场景的需求来设计数据智能体Lumos,并抽取关键公共能力,对环境提出准确需求: **Agent核心能力【DS Agent建设核心】** - Agent主体原子能力:表格理解、问题推荐、图表生成、数据洞察、表格操作、Planner规划能力、Summary总结能力等 - 数据源加记忆的上下文应用能力:数据源元数据和数据本身的有效读取;长、短记忆整合(高频查询加各类离线数据源、缓存的加载等) - 输出能力:步骤式结构化返回、结果流式输出等 **需要依赖的公共能力【转化为需求,要求环境或外部工具提供】** - 应用层环境态信息:环境采样的示例数据、环境分析表的元数据信息、环境用户交互行为、环境支持的通用指令集合 - 工具和指令服务:【引擎】时间、数据、Excel函数等常规公式函数;【引擎】SQL/Python等高阶查询和计算工具支持;系统各类OpenAPI和MCP延伸服务(查询接口、元数据接口、挖掘机数据挖掘接口、事件信息库等其他第三方开放接口等) **STEP 3: 按Lumos需求设计并实现分析环境** 分析环境本质上是一个数据产品,和过往实现的数据产品没有本质区别。唯一的差异是,本次实现过程中全流程考虑了AI辅助,在能力的组织和建设中都为AI做了针对性定制和优化,保证流程和接口对AI简单、易用。 --- ## 2. Tomoro中智能体Lumos的落地实践 ### 2.1 Lumos用户分析情景中的角色分析 Tomoro的核心场景是结合AI能力,通过人机协同消除一线非技术同学在分析过程中遇到的技术和经验问题。从一线产运的分析视角来看,以非技术的电商业务运营同学进行用户画像和场景角色为例: **用户画像** - 角色:电商业务运营 - 业务理解深度:熟悉用户行为、市场策略、库存周转等业务逻辑 - 技术短板:非技术,SQL语法不熟,无法自主编写JOIN/子查询 - 决策场景:日常监控、需快速定位问题(如促销效果差)、制定运营策略等 **环境系统** - 数据来源:通过DT报表系统引入的动销商品下钻分析看板,对应的底层明细表 - 数据规模:3.5亿行,18个字段 - 加载背景:DataTalk进行报表消费时,发现动销情况异常 **Lumos多智能体系统** - Master Agent:职责为目标对齐、指令理解、环境信息获取、总体结果总结,通过记忆管理应用长短记忆,通过模型进行任务规划 - Executor Agents:基础分析Agent、归因分析Agent、实用分析Agent等专家Agent,负责处理特定领域的分析问题。每个智能体根据自己的任务进行步骤规划和反思 ### 2.2 为什么Lumos是多智能体? 把Lumos设计成多智能体,主要是从专业分析任务复杂度的角度出发做框架选择。数据分析场景的特点是——简单的问题可能对应多个任务。 **举例1:** 如何提高高单价商品的销量?这个问题看起来简单,但分解出来会发现需要从多个角度分析才能解答。这种策略型问题属于分析的高价值问题。 当然,分析场景也有大量简单问题,比如指定查询类型的(这往往是Chat BI/BI报表筛选直接能涵盖的问题)。 **举例2:** 帮我查询订单2025053108532414786的销售数据?这个问题很简单,但也是日常分析的高频问题。这类问题主要分配给基础分析Agent,找到正确的字段即可回答。 为了尽量适配各种分析任务,同时降低Master Agent的负担(避免需要了解各种不同类型任务的特殊规则),我们把Lumos的原子能力组合设计成了多智能体架构。 ### 2.3 如何解决多个Agent之间的行为一致问题? **问题现象:** 多智能体版本Lumos上线后,我们发现多智能体协作存在一致性问题,任务并行后会加剧。 比如“如何提高高单价商品的销量?”这个问题,4个子任务中有3个可以用到相同的中间结果,但智能体系统在不同子任务执行时会表现出不一致行为: - 重复计算,明明可以用中间结果却不用,导致效率低 - 反复总结相同内容,显得啰嗦且愚蠢 - 以上两点导致上下文过多,整体效果变差 **解决方案:** 建立共享工作记忆机制——设计一套独立的工作记忆机制,让Agent之间有共享信息区域,互相了解对方的目标、计划、产出物、执行状态等,确保信息对齐。 将整个任务设置为顺序执行,保证下游任务可以充分理解和应用上游的结果。 这个方案的缺点是失去了多智能体系统并行效率的加成,整个执行速度变慢。但并行方案对当前模型来说复杂度太高,需要在分解任务的同时标识出依赖关系,形成执行的DAG图,目前还需要更多深度研究。 那么如何解决串行导致的Agent执行慢、用户体验不足的问题?经过数据分析发现,模型性能问题并不是关键——模型输出过程都是流式输出,对用户体感影响不大。真正影响最大的是查询和计算过程,大数据计算和传输的时间消耗非常高,而且这个过程对页面是阻塞的,导致体感很差。所以,实现极致的查询和计算工具响应,才是提升用户体验的关键。 ### 2.4 如何实现极致查询&计算工具响应,提升用户体验 Lumos支持无边界的数据导入,意味着查询的数据是多源、异构的,数据规模可能从几十条到几十亿条。为了解决查询和计算速度问题,我们与Mixquery引擎同学协作推动了分级查询计算框架的设计。 #### 分级计算框架思路 **目标:** 让亿级数据查询像本地一样快。 核心架构逻辑:通过存储、计算、多级缓存的设计和策略,在不同数据源、不同规模数据上实现计算加速。为了对Tomoro应用层和Lumos Agent屏蔽复杂度,实现了统一、简单的查询DSL表达和分析语义模型,让前端页面和Agent可以简单理解数据关系并查询数据。 **主要实现手段** 场景预计算:主要优化前端交互类功能,比如下拉选项预处理、表格秒开、字段类型和规模统计等 内存数据库:物化过程数据,将经过过滤筛选后的中间结果通过服务层的内存DB实现物化加速,帮助下游计算任务高效执行 托管式高性能引擎:支持把Spark、Thive等在首次查询无法加速的数据源查询迁移到托管式的高性能OLAP引擎,实现计算效率提升 Python计算加速:针对大模型生成的Python代码,通过Mixquery引擎实现自动改写,根据数据规模自动切换Pandas单核计算、Modin多核计算、Ray并行计算框架。引擎层面帮助屏蔽不同来源数据的查询语法差异,让模型只须理解规范统一的输入文件格式 **分级计算收益** Agent执行速度提升,用户页面操作检查Agent结果变得简单,通过这两点实现了整体用户体验和AI信任度的提升 #### 细分场景的持续深度优化 整个分级计算框架非常复杂,从理念到落地还需要细分场景的持续深度优化。引擎组同学通过以下思路进行更多细致优化。 ### 2.5 如何做AI Coding和工具调用之间的选择? Lumos同时具备AI Coding和调用MCP工具的能力,这两个能力在大量场景中有重叠。AI Coding可以理解为终极工具,一切能力都可以通过代码实现。因此,AI Coding和工具调用之间的选择就成了一个关键问题。以下从绘图这个基础分析能力来探讨实践经验。 **仅用AI Coding实现绘图:** 由于AI Coding是终极工具,最初版本的绘图就是仅仅使用AI Coding实现的。 优势:高潜力——充分利用模型能力,成长性好(基础模型越强效果越好);很灵活——可以持续对话修改代码,实现魔法图表(任何图表组合方式都可以通过代码实现) 不足:体验不佳——可视化规则很复杂,存在效果一致性问题;优化困难——多种方式尝试优化效果均不佳(Prompt规则注入过多会影响模型发挥,RAG绘图知识库维护成本高,人工干预回显到页面比较困难) **仅用工具实现绘图:** 在AI Coding尝试效果不佳后,整体切换为通过MCP工具实现绘图,期望通过这种方式提升绘图体验和质量。 优势:简单——模型只要确认意图和关键要素,成功率高;易调整——图的可视化能力和交互能力都很好,能转换成页面操作;维护成本低——新产品需求特性前端都会支持,保证体验一致 不足:限制多——支持的图表类型有限,复杂个性化需求无法满足;不灵活——需要模型理解特定规则才能调整图形 **最终方案:优先使用工具,工具局限性通过AI Coding解决** 组合应用既能保证效果,又通过AI Coding保证灵活性。设计反馈机制,持续监测AI Coding的图表类型,驱动工具持续迭代,让大部分高频图表能被MCP工具有效覆盖。 ### 2.6 如何通过MCP共建专家Agent,满足业务复杂分析需求 针对指标异动归因、实验效果分析等专业性较强、业务定制规则较多的复杂分析场景,主要通过业务共建的专家Agent实现。将业务特定Workflow和业务知识融合进对应的专家Agent,避免Master Agent承担过多的业务知识和规则负担(只须完成意图识别和定向路由即可)。 #### 指标异动归因场景举例说明复杂Agent实现 指标异动归因场景的分析问题具有明显的延续性。比如,用户发现实际下单金额在持续下降时,会问“实际下单金额相比上个月的变化原因是什么?”当这种问题被拆解分析后,输出报告显示北京市这个维度项影响最大,用户很可能会接着问“针对北京市的数据进一步分析不同折扣类型的影响?” 针对这种情况,结合Lumos的Planner能力和原DT中的指标异动归因工具的联动,可以实现生成式归因能力。 场景验证过程中的关键点:各个业务针对异动归因选用的算法、公式拆解方法、关联事件规则存在一定差异,需要结合算法市场,支持业务方自定义MCP,有效实现业务适配。 #### 更全面地提高适配度,需要让系统足够开放 除了指标异动归因场景,还存在实验结果生成分析报告、业务舆情评论分析、IP运营分析等许多复杂分析场景。为了让Tomoro具有足够的业务适配度,系统设计得非常开放,支持业务自定义各种高级工具,实现业务定制分析。 针对Lumos智能体场景,支持Workflow共建,通过MCP对接灵活的介入各种业务算法、知识等,实现丰富的智能分析体验。针对数据GUI场景,也支持通过插件形式引入业务功能。未来还会进一步支持页面插件和智能体操作联动分析。 ### 2.7 如何提高用户提问有效性:问题推荐和澄清能力 在Lumos建设过程中,问题推荐和澄清能力是必不可少的模块,对提高用户问题有效性帮助很大。 **问题推荐** 基于表的推荐:主要是表高频query,有效帮助用户提升使用效率。表信息结合大模型生成丰富的问题集合,可以给用户提供分析创意。 多轮问题推荐:结合上下文信息和表信息,组合生成下一步推荐,有助于提高分析问题质量和流畅度。 **澄清能力:** 避免用户提出过于宽泛的问题(比如“最近数据怎么样”),导致Lumos生成过于复杂且对用户无效的回答污染上下文。 ### 2.8 如何对Agent的分析能力进行有效测评? Lumos实践中发现,如何有效测评是最关键的问题之一。只有持续进行有效测评,才能引导Data Agent持续有效迭代,避免研发迷失在LLM爆发引起的海量实现方案和不同实施框架中。 #### 基础测评能力构建 Tomoro通过产品能力测评和Agent能力测评双体系,持续优化分析效果并保障服务稳定性。 #### 持续完善和扩充Benchmark 由于测评任务多,存在多步骤任务的错误传播、结果验证的主观性、复杂任务分解难度等问题,数据分析领域的测评集合标注成本非常高。但这项任务的价值同样高,是促进Agent能力提升和模型选择的关键。 持续完善和扩充Benchmark是一件难而正确的事,所以要坚持。如何有效坚持下去?我们通过重新理解数据分析,从“分析认知”驱动测评集合完善和测评方法探索。 将数据分析按以下方式分解为四大类八个小部分,持续按八个领域涵盖情况打标签整理Benchmark数据集合,保证对数据领域的问题全面覆盖。 ### 2.9 工程上也需要给Data Agent穿上盔甲 在Agent基础能力之外,工程结构上给Data Agent提供足够的防御和支持也很重要。主要通过合理的分层和引入公共基建能力,帮助实现Agent层面的灵活、可靠和有序迭代。 --- ## 下一步计划 Tomoro Lumos数据智能体的效果还有不少提升空间。接下来会重点投入在业务知识、工具引入和业务场景应用验证上,并深入与更多业务协作,一起验证专业分析Agent在实践中持续提升Lumos智能体的效果。
来源:https://www.53ai.com/news/LargeLanguageModel/2025081834718.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。