阿里云EMR Serverless StarRocks 内表湖表同时支持向量全文AI
类型:热点整理2026-07-23
阿里云EMRServerlessStarRocksStella2 2版本支持存算分离内表与Paimon湖表,统一SQL入口融合结构化分析、全文检索、向量检索及AI函数,实现多模态数据高效处理与检索闭环,赋能智能驾驶、具身智能等场景,有效助力多模态应用落地。
摘要:Stella 2.2 作为面向 AI 时代的数据基础设施,实现了“多模态数据采集与处理—向量化与语义理解—多路检索与融合—分析消费”的完整闭环。无论数据存储于 Paimon 湖表,还是 StarRocks 存算分离内表,用户均可通过统一 SQL 入口,组合结构化分析、全文检索、向量检索与 AI Function,广泛服务于智能驾驶、具身智能、内容与商品理解、企业知识库及 RAG 等场景。
一、AI 时代,企业需要的不是更多引擎,而是处理与分析闭环
大模型的应用正在将企业数据从传统的“结构化宽表”舒适区,推向结构化、半结构化与非结构化数据混合的复杂战场。以智能驾驶为例,一条数据中既包含车辆、天气、时间、传感器等结构化字段,往往还关联着图片、语音、视频和文本描述;在具身智能领域,机器人状态、任务指令、视觉轨迹、动作序列和训练标注,都需要被统一管理和高效处理。
传统做法是什么?计算引擎、搜索引擎、向量数据库、模型服务各管一摊,数据被复制到多套系统,Schema 和索引需重复维护,最后还必须在应用层手动拼接结果。随着数据规模与模态的持续增长,链路成本、数据一致性和在线稳定性,迟早会成为难以绕过的瓶颈。
Stella 2.2 的目标非常明确:利用一份数据、一套 SQL 入口,完成两项核心任务:
* **多模态处理**:通过 AI Function 对文本、图片、音频、视频进行理解、抽提、分类、摘要和向量化。
* **多模态检索**:在存算分离内表与 Paimon 湖表上,组合结构化条件、全文检索与向量检索,直接服务分析、样本圈选、RAG 与 Agent。
二、Stella 演进:从正式发布、性能领先到多模态闭环
| 版本 | 产品里程碑 |
| Stella 1.0 | Stella 正式发布,面向云上湖仓分析提供更优性能与稳定性,并以全托管 Serverless 形态降低运维与弹性扩缩成本。 |
| Stella 2.0 | TPC-H 打榜第一,OLAP 性能达到行业领先水平;同时补齐 ETL 核心能力,进入 ETL Production Ready 阶段。 |
| Stella 2.2 | 形成多模态处理与分析闭环:AI Function 负责数据理解与向量化,存算分离内表和 Paimon 湖表共同承载多模态检索与分析。 |
Stella 2.2 并非简单地为系统添加搜索功能,而是将 AI 数据加工与数据检索整合到同一个分析系统中。处理后的结果可写入内表,也能通过 Native Writer 写入 Paimon;紧接着,就能利用结构化、全文和向量能力直接完成检索与分析。
三、关键特性一:多模态处理——AI Function
Stella 2.2 将模型能力封装为 SQL Function,用户可在查询、筛选、聚合和写入 SQL 中直接调用,完全无需额外编排一套 Python 服务。
3.1 覆盖文本理解、生成、向量化与多模态输入
* **理解与治理**:`ai_sentiment`、`ai_classify`、`ai_extract`、`ai_filter`、`ai_redact`。
* **生成与转换**:`ai_complete`、`ai_translate`、`ai_summarize`、`ai_fix_grammar`。
* **语义计算**:`ai_similarity`、`ai_embed`。
* **多模态处理**:`ai_complete` 支持文本、图片、视频、音频输入,`ai_embed_multimodal` 可将多模态内容映射到统一的向量空间。
* **跨行汇总**:`ai_agg`、`ai_agg_summary` 支持按业务分组完成自然语言归纳。
这些 AI Function 既能作用于存算分离内表,也能直接处理 Paimon 表中的 VARCHAR、VARBINARY/BLOB descriptor 或对象 URL。执行层还提供了模型能力路由、批处理、并发与 QPS 控制、Token 用量统计和错误处理,相当于为生产环境中的模型调用配置了一个统一的治理入口。
3.2 数据流示例:智驾场景自动理解与标注
```
Paimon/内表中的路采数据
├─ 结构化字段:车型、天气、时间、传感器值
└─ 多模态对象:图片、视频、音频、文本描述
↓
AI Function
├─ ai_complete / ai_extract:场景理解与结构化抽取
├─ ai_classify / ai_filter:危险场景分类与语义筛选
└─ ai_embed_multimodal:生成统一向量
↓
结构化标签 + 文本描述 + Embedding
↓
写入存算分离内表,或通过 Native Writer 写入 Paimon
↓
进入样本圈选、训练数据治理、RAG/Agent 与 BI 分析
```
一条 SQL 即可将“理解—抽取—向量化—落表”整个链条串联起来,处理结果与原始业务字段保持在同一个表语义中,简洁高效。
四、关键特性二:多模态检索——内表与 Paimon 两条数据链路
Stella 2.2 同时覆盖了存算分离内表和 Paimon 湖表。它们面向不同的数据组织方式,但共享统一的 SQL 入口,混合检索能力被直接编排进业务数据流,结果无需拉到应用层再拼一次。
4.1 存算分离内表:在线分析与多模态检索一体化
存算分离内表支持向量索引在共享存储上的构建、持久化、读取和回收,支持 HNSW/IVF 系列索引,以及余弦相似度、内积、L2 距离。同时,它可结合内表全文/倒排索引和普通 SQL 谓词,完成结构化、关键词和语义相似度的联合检索。
向量索引文件随 Lake Tablet 元数据统一管理,支持异步构建、精确 Vacuum 跟踪,并且在索引文件缺失时能回退到暴力距离计算,兼顾了性能与可用性。查询侧支持参数化向量输入与 Profile 指标,便于接入在线应用并持续调优。
**数据流示例:具身智能轨迹检索**

```
机器人轨迹、任务指令、视觉特征与动作标签
↓ 写入存算分离内表
结构化列 + 文本列/倒排索引 + 向量列/HNSW(IVF)
↓ 单条 SQL 统一编排
任务/时间/设备过滤 + 关键词召回 + ANN 相似轨迹召回
↓
Top-K 候选轨迹与原始业务字段
↓
训练样本选择、失败轨迹复盘、相似任务推荐与在线分析
```
4.2 Paimon 湖表:面向多模态数据湖的原生检索与读写闭环
Paimon Global Index 将湖表上的多路索引统一到了分布式执行框架中:
* **向量检索**:支持 ANN Top-N,覆盖余弦相似度、内积和 L2 距离。
* **全文检索**:支持 Tantivy 全文索引与 `score()` Top-N。
* **结构化过滤**:BTree、Bitmap 索引可作为前置过滤条件。
* **缓存与可观测**:Global Index 接入 DataCache,提供元数据缓存、行标量缓存与 Profile 指标。
* **多模态数据承载**:可读取 Paimon BLOB/BLOB descriptor,将图片、音频、视频、文档及其结构化元数据、文本描述和向量组织在同一个湖表中。
* **Native 读写**:Paimon-cpp Native Reader 作为读取兜底路径,Native Writer 支持数据写入、固定 Bucket 路由与提交错误传播,形成了处理结果写回湖表的闭环。
**数据流示例:智驾多模态样本圈选**

```
OSS + Paimon
├─ BLOB/descriptor:图片、视频、音频、文档
├─ 结构化字段:车辆、天气、时间、标注
├─ 文本字段:场景描述、工单与模型生成摘要
└─ 向量字段:图片/视频/文本 Embedding
↓
Global Index + Native Reader
├─ BTree/Bitmap:结构化候选过滤
├─ Tantivy/BM25:关键词与全文召回
└─ ANN:跨模态语义相似召回
↓ SQL 中组合多路条件与 Top-N
训练样本集 / 数据质量分析 / RAG / Agent
↓
AI Function 继续加工 → Native Writer 写回 Paimon
```
这条链路的核心思路是“多模态数据在湖,处理与检索在 Stella”。既保留了 Paimon 的开放湖格式与低成本存储,又避免了将多模态检索拆分为多套独立系统。
五、典型场景
智能驾驶:多模态训练数据圈选
按车型、天气、时段等结构化条件筛选,再组合场景描述全文召回和图片/视频向量相似度,快速定位长尾场景。AI Function 可继续完成场景分类、标签抽取与描述生成。
具身智能:轨迹理解与相似任务检索
将任务指令、环境视觉、动作序列和运行指标统一组织,检索相似轨迹并结合结构化指标定位失败原因,为训练集构建、评测和在线决策提供数据基础。
内容、电商与广告:跨模态素材打标和检索
支持文搜图、图搜图、图搜文、视频搜文等跨模态检索,并组合类目、时间、品牌、审核状态等条件,服务商品理解、素材推荐、版权审核与内容运营。
企业知识库与 RAG
对文档、图片、音视频和结构化业务数据进行抽取、摘要与向量化,通过全文、向量和权限/业务条件联合检索,为 RAG 与 Agent 提供更完整的上下文。
六、产品功能发布清单
6.1 湖表多模态检索
* Paimon Global Index 支持 ANN 向量 Top-N、Tantivy FTS `score()` Top-N,以及 BTree/Bitmap 前置过滤。
* 支持带得分的 Global Index 查询,ANN 候选数量与搜索参数可配置,并修正了不同距离度量的排序方向。
* Global Index 接入 DataCache,新增 Catalog 元数据缓存、行标量缓存、索引 Profile 指标。
* 支持读取 Paimon BLOB 与 BLOB descriptor,Paimon-cpp Native Reader 作为 Split 读取兜底路径。
* Paimon Native Writer 支持写入与固定 Bucket Shuffle,新增 `paimon_bucket()`,完善了 TIMESTAMP/TIMESTAMP_LTZ 精度写入和提交失败传播。
* 支持 Paimon `TRUNCATE TABLE`,并优化了非 Metastore 分区表的分区枚举开销。
6.2 存算分离内表多模态检索
* 支持在存算分离模式下构建、写入和读取向量索引。
* 向量索引文件纳入 Lake Tablet 元数据并支持精确 Vacuum 跟踪。
* 支持异步向量索引构建,并在索引文件缺失时回退到暴力距离计算。
* 支持余弦相似度、内积、L2 距离及参数化向量查询。
* 可将向量检索与内表全文/倒排索引、结构化 SQL 谓词组合,形成统一的多路检索流程。
* 新增向量检索 Profile 指标,便于定位召回与执行性能。
6.3 AI Function
* 文本理解与治理:`ai_sentiment`、`ai_classify`、`ai_extract`、`ai_filter`、`ai_redact`。
* 文本生成与转换:`ai_complete`、`ai_translate`、`ai_summarize`、`ai_fix_grammar`。
* 语义与向量:`ai_similarity`、`ai_embed`、`ai_embed_multimodal`。
* 分组汇总:`ai_agg`、`ai_agg_summary`。
* `ai_complete` 支持文本、图片、视频、音频与多内容组合,`ai_embed_multimodal` 支持 URL、图片二进制及多内容输入。
* 支持 OpenAI-compatible 与 DashScope Native 能力路由,并提供微批、限流、Token 统计与错误治理。
6.4 功能、性能与稳定性优化
* Paimon Global Index:修复了 OR 结果聚合、索引分片范围、ANN 参数顺序和度量排序方向问题。
* Paimon I/O:异步读取线程安全优化,元数据与数据缓存优化,减少了重复远端访问。
* Paimon 类型兼容:完善了 INT96、TIMESTAMP、TIMESTAMP_LTZ 与无时区时间戳处理。
* Paimon 写入稳定性:固定 Bucket 路由、提交失败透传与 Native Writer 上下文统一。
* Fluss:优化了谓词下推、分区裁剪和分区信息复用,并支持无 Lake Snapshot 的 Fluss-only 表读取。
* 查询稳定性:修复了 Join 重排列裁剪、聚合下推后空 Analytic、Lambda 参数 ID 冲突与 INSERT OVERWRITE 重规划问题。
* 系统稳定性:增加了 MySQL 结果发送写超时、AutoVacuum 事务清理防抖和按 Warehouse 的慢查询指标。
七、总结
Stella 1.0 让 Serverless StarRocks 正式进入生产环境;Stella 2.0 凭借 TPC-H 第一和 ETL Production Ready 证明了其卓越的性能与工程能力;Stella 2.2 则更进一步,将数据处理、模型调用、多模态检索和分析消费连接成了一个完整的闭环。
对用户而言,核心价值并非多了一套专用的检索系统,而是在现有的湖仓数据上,直接获得了 AI Function 与多模态检索能力。Paimon 湖表适合开放、低成本的多模态数据湖,存算分离内表适合在线分析与检索,而这两条路径,均由 Stella 的统一 SQL、Serverless 计算和可观测体系来承载。