LLM能否替代数据科学家?DeepAnalyze告别低效数据分析
来自中国人民大学与清华大学的研究团队推出DeepAnalyze——你的专属"数据科学家"。只需一个简单指令,它就能帮你自动化分析各类数据集,并独立完成各类数据科学任务。
你是否还在为繁杂的数据文件和海量信息而苦恼?是否希望能够自动从数据中挖掘出真正有价值的商业洞察?
最近,由人大与清华联合研发的DeepAnalyze——这款专为数据科学打造的智能助手,让你只需简单描述需求,它就能自主分析数据、完成建模、生成可视化报告等多项复杂任务:
支持自动化数据准备、数据分析、数据建模、数据可视化、数据洞察数据研究:可在非结构化数据、半结构化数据、结构化数据中进行开放式深度研究,生成研究报告

DeepAnalyze是全球首个面向数据科学的自主智能体,无需预设工作流程,仅凭单一语言模型即可像专业数据科学家那样,自主完成多种复杂的数据任务。
DeepAnalyze的论文、代码、模型、数据均已开源,已在GitHub收获1.1K+星标,欢迎大家亲身体验!
DeepAnalyze——你的专属"数据科学家"
DeepAnalyze能够在真实环境中自主编排和优化各类操作流程,从容应对复杂的数据科学挑战。

DeepAnalyze在真实环境中学习复杂任务
数据无处不在,而数据科学一直被视作人类智能的重要体现。从Kaggle竞赛到日常的数据分析实践,众多评测都在考察数据科学家在数据准备、分析、建模、可视化与洞察等方面的综合能力。
当前的数据智能体通常依赖人工设计的工作流程,来驱动大模型完成特定的数据分析与可视化任务。尽管在各类单点任务上已取得了令人瞩目的成果,但由于LLM的自主性仍然有限,它们距离理想的"全能自主数据科学家"依然存在明显差距。
随着大型语言模型智能水平的持续提升,一个关键问题也愈发突出:如何让LLM真正具备自主完成复杂数据科学任务的能力?

DeepAnalyze通过在真实环境中的训练,学会自主编排、自适应优化操作步骤,最终实现复杂数据科学任务的完整解决。
为达成这一目标,DeepAnalyze提出课程学习式自主训练范式(Curriculum-based Agentic Training ofDeepAnalyze)和面向数据的轨迹合成框架(Data-grounded Trajectory Synthesis)。
课程学习式Agentic训练
数据科学任务本身具有高度复杂性,这使得基础LLM在早期训练阶段往往难以顺利完成任务。任务复杂性导致模型几乎得不到正向奖励信号(即"奖励稀疏"问题),强化学习过程容易停滞,甚至出现训练崩溃的情况。
为了解决这一难题,DeepAnalyze提出了"课程学习式 Agentic 训练"。其模拟人类数据科学家的学习路径,让LLM在真实环境中从简单到复杂、从单一任务到综合任务逐步进阶。通过这种渐进式训练,模型的能力得以稳步提升,避免在复杂任务中因为"奖励信号为零"而导致学习失败。
训练过程包括两大阶段:
单能力微调:训练LLM在代码生成、结构化数据理解、逻辑推理等方面的基础能力;多能力Agentic训练:在真实任务环境中,让LLM学会运用多种能力,像数据科学家一样自主完成复杂任务。面向数据的轨迹合成
在数据科学领域,缺乏完整的长链问题求解轨迹,这让LLM在探索解题空间时缺乏有效指引,只能进行低效、盲目的"试错式"探索,难以获得有意义的中间监督信号。
为了解决这一难题,DeepAnalyze提出了"面向数据的轨迹合成"方法。其能够自动合成50万条数据科学推理与环境交互数据,为模型在庞大的搜索空间中提供正确路径的示范和引导。
数据合成包含两个关键部分:
推理轨迹合成:基于现有的TableQA、结构化知识理解、数据科学代码生成任务,构建带有完整推理路径的训练数据;交互轨迹合成:构建多智能体系统,从结构化数据源(如Spider和BIRD)中自动合成数据科学交互轨迹,提供真实环境的交互轨迹。DeepAnalyze支持面向数据的深度研究
DeepAnalyze支持面向数据的深度探索,能够自动生成具备专业分析师水准的研究报告。在数据研究报告生成任务中,无论是内容深度还是报告结构,DeepAnalyze的表现都显著优于现有的闭源LLM。

分析报告:

作者介绍

张绍磊,中国人民大学信息学院助理教授,隶属于中国人民大学讲席教授范举教授团队。
他博士毕业于中国科学院计算技术研究所,导师为冯洋研究员。他的研究方向涵盖大语言模型、多模态大模型、AI for Data Science。
相关研究成果在NeurIPS、ACL、ICLR等国际人工智能与自然语言处理会议发表论文30余篇,开源的多语言大模型、多模态大模型、数据科学大模型在GitHub社区累计获得5000+星标。
他长期担任CCF-A类国际会议ACL ARR的领域主席和责任编辑。个人主页:zhangshaolei1998@github.io。

范举,中国人民大学教授、博士生导师,国家级青年人才,中国计算机学会数据库专业委员会、大数据专业委员会委员。
研究方向包括:数据治理技术与系统、智能数据库系统等。
相关研究成果在计算机领域国际顶级期刊/会议发表论文60余篇。作为负责人先后主持国家自然科学基金优秀青年基金项目、重点项目、面上项目,以及多项产学研合作项目。
先后获得ICDE 2025 Best Paper Runner-Up、ACM SIGMOD Research Highlight Award、ACM China Rising Award、宝钢优秀教师等奖项。
团队介绍:
RUC-DataLab是中国人民大学信息学院、数据工程与知识工程教育部重点实验室设立的科研团队,负责人是范举教授,团队专注于数据系统+人工智能(Data+AI)交叉领域,致力于将数据技术与人工智能技术深度融合,从而打造更加智能、高效的新型数据系统。
实验室的研究方向包括:(1)数据库系统智能化(AI4DB):利用人工智能技术提升数据库系统的查询性能、自治能力等;(2)数据库技术赋能AI系统(DB4AI):利用数据管理技术支撑大模型训练的高效处理、大模型推理的低延迟、高吞吐优化;(3)数智融合的新型数据科学系统(AI4DS):利用推理大模型、多模态语义理解等技术,提升数据科学系统的智能化水平与执行性能,有效释放数据价值。
论文:https://arxiv.org/pdf/2510.16872
代码:https://github.com/ruc-datalab/DeepAnalyze
模型:https://huggingface.co/RUC-DataLab/DeepAnalyze-8B
数据:https://huggingface.co/datasets/RUC-DataLab/DataScience-Instruct-500K
更多示例:https://ruc-deepanalyze.github.io/
相关攻略
我们偏爱并信任的AI模型,恰恰是那些通过无条件肯定我们,从而损害我们亲社会行为的模型。 斯坦福、卡内基梅隆大学的一项研究证实,AI可能正在用一种极其隐蔽的方式,让我们变得更固执,更不愿意修复重要的人
来自人大与清华的研究团队推出DeepAnalyze —— 你的专属「数据科学家」。只需一个指令,它便能自动化分析你的数据、自主完成各类数据科学任务。 你是否还在为复杂的文件和海量数据而苦恼?是否希望
异地多活架构是企业保障业务连续性、提升用户体验、支撑全球化布局的关键技术手段。其实施需结合业务场景选择性地采用不同架构模式,通过 “保障核心业务与数据、多元化数据同步、聚焦绝大部分用户” 的设计技巧
UniLIP 提出创新的 CLIP 微调框架,通过两阶段重建训练与自蒸馏损失,在不损失模型原有理解性能的同时,实现了卓越的图像重建能力。UniLIP 可直接替换 MLLM(如 InternVL)中的
OpenAI Atlas、Perplexity Comet等AI浏览器的推出,虽提升了网页自动化效率,却也使智能爬虫威胁加剧。南洋理工大学团队研发的WebCloak,创新性地混淆网页结构与语义,打破
热门专题
最新APP
热门推荐
随着视频内容与Vlog创作的普及,一台轻便、画质出色、功能针对性强的好相机,已成为众多创作者的刚需。无论是记录生活、旅行随拍,还是专业短视频、直播带货,选对设备往往能事半功倍。我们整理了一份2025
近日,苹果在正式直接上架了新款Vision Pro。相比于上一代在发布时大量的宣传,新款Vision Pro显得十分低调。值得一提的是,由于iPhone17新机的上市,导致iPhone16价格持续走
11月3日,有博主曝光了三星新款旗舰手机S26 Ultra的详细配置信息。爆料显示,S26 Ultra的机身厚度为7 9毫米,镜头凸起厚度为4 5毫米。比小米17 Pro Max 8 0毫米的机身厚
币安Binance是全球领先的加密货币交易平台之一,支持现货、合约、理财、Web3等多种功能。本文将为你介绍币安交易所官网访问入口及官方App下载安装流程,帮助你快速上手币安平台。
魔兽世界军团再临remix版本上线了,在军团再临中玩家需要从头开始,重新做一遍任务,比如耻辱之行任务,那么魔兽世界军团再临remix耻辱之行任务怎么做?下面就给大家带来魔兽世界军团





