腾讯云智能数据湖计算 AI DLC 发布会回顾

导读 当 AI Agent 从“能对话”进入“能执行任务”的生产阶段,企业数据平台面对的已不只是新增一种应用形态,而是数据形态、计算资源、训练范式和开发方式的同步变化。7 月 25 日,DataFun Agentic AI Summit 超级智能体系统架构峰会·深圳站 腾讯云大数据专场,围绕“AI Native数据湖:让企业 Agent 拥有统一的智能数据底座”展开。两个多小时的议程中,腾讯云正式发布智能数据湖计算 AI DLC,并由产品与研发团队拆解 TCRay、Xpark、Meson 三大核心引擎,博世中国和腾讯 WorkBuddy 团队则分别分享了混合算力调度、智驾训练数据生产和 AI Native 数据实践。

本次专场给出的主线十分清晰:Agent 时代的数据底座不能再把数据处理、模型训练、在线推理和 Agent 运行拆成相互割裂的系统,而要让数据、算力、模型、轨迹与反馈在同一基础设施上持续流动。腾讯云在现场将 AI DLC 定位为业内首个生产级 Serverless Spark + Ray 全托管平台


主要内容包括以下几个部分:

1. 数据不再只是记录,数据底座开始为 Agent 提供可信上下文

2. AI DLC 发布:四项升级把数据、算力和 Agent 闭环放到同一底座

3. 三大核心引擎:分别补齐 AI 计算、多模态处理和结构化性能

4. 博世两项实践:统一算力底座与模型驱动的数据生产飞轮

5. WorkBuddy 实践:把数据处理、后训练和权限治理串成闭环

6. 从产品发布到生产实践,数据平台服务的对象变成了“持续进化链路”

出品社区|DataFun


01

数据不再只是记录,数据底座开始为 Agent 提供可信上下文

图:腾讯云大数据基础产品总经理 程彬

腾讯云大数据基础产品总经理程彬以智能汽车AI 原生导购应用为例,说明数据角色正在发生变化。传统汽车的功能在交付时基本固化,智能汽车则通过持续采集、云端连接和 OTA 升级不断迭代;传统导购 APP 主要记录浏览、加购和订单,AI 原生导购还需要理解用户意图,结合对话、图片、商品、库存和历史偏好主动完成任务。

在这一变化中,数据不再只是供人查询和复盘的运营记录,而成为 Agent 获取上下文、形成判断和持续学习的“认知燃料”。现场提出的数据底座新任务,是保证每一轮智能决策都能获得可追溯、可解释、可即时调用的上下文,并让模型训练、运行反馈和持续优化形成闭环。

对应到架构上,底层需要形成统一的 Context 平面,集中管理业务数据、知识、特征、模型、服务以及 Agent 轨迹和记忆;中间层需要同时承载检索、SQL、模型训练、推理、代码执行、上下文构建和评测反思等多种计算;上层则承载能够持续优化并自主完成复杂工作的 Agent 应用。数据湖的目标也由“存好、算好结构化数据”,转向持续为智能系统提供可信上下文

图 1:AI 时代的数据底座要保证每一轮智能决策获得可追溯、可解释、可即时调用的上下文(现场演讲PPT)

02

AI DLC 发布:四项升级把数据、算力和 Agent 闭环放到同一底座

图:腾讯云大数据 DLC 产品负责人 孟硕

腾讯云大数据 DLC 产品负责人孟硕在发布环节提出,AI/Agent 时代的变化同时发生在四个维度:数据从结构化走向多模态,资源从 CPU 走向 CPU + GPU 异构分布式,企业训练重点从预训练转向基于私有数据的后训练,数据工程也从追求“一次写对”的确定性流程,转向依靠轨迹、反馈和评估不断迭代的系统。

基于这些变化,AI DLC 按照支持异构、AI 原生开发、数据算力同底座、面向 Agent 进化四条设计思路完成升级。产品层面对应为四项能力:以 Ray × Spark 升级计算范式;以 Xpark、Ray Libraries 和 Meson 补齐多模态处理、训练推理与结构化高性能计算;以 TCLake 建立 Data + AI 统一元数据和全流程血缘;以 Open Engine、MCP、Skills、SDK 和 Open API让平台既能承载 Agent,也能被外部 Agent 调用。

在这套架构中,Spark 负责大规模数据加工、特征工程和结构化分析,Ray 承载多模态处理、模型后训练、在线推理和 Agent 运行时;二者共享统一的资源池、数据与元数据底座数据对象和 AI 对象也被放入同一治理链路:从表、文件和 Topic,到特征、模型、Checkpoint、服务端点以及 Agent 轨迹和记忆,都可以被统一纳管和追溯。

图 2:从数据湖计算 DLC 到智能数据湖计算 AI DLC 的四项升级(现场演讲 PPT)

03

三大核心引擎:分别补齐 AI 计算、多模态处理和结构化性能

图:腾讯云大数据 AI 计算平台研发负责人 祝森林

腾讯云大数据 AI 计算平台研发负责人祝森林介绍,TCRay 把开源 Ray 的分布式运行时转化为可供多团队长期使用的生产级平台。它在 AI DLC 中连接数据湖与智能应用,覆盖多模态处理、模型训练、强化学习、在线推理和 GenAI 应用。现场披露的建设进展显示,TCRay 已完成 3000 节点、10 万 Actors 的规模化测试;GCS 稳态内存下降 40%,Idle Worker 内存下降 90%。在一项 12 小时、包含 1339 万Events 的历史作业场景中,History Server 加载耗时由分钟级降至秒级,加载耗时下降 98%,峰值内存下降 99%。平台侧还补充了多租户、资源队列、弹性伸缩、流量控制、高可用和统一运维可观测能力。

图 3:TCRay 的规模化、历史可观测和生产平台能力建设进展(现场演讲 PPT)

图:腾讯云大数据 Xpark 研发负责人 蔡晓帆

腾讯云大数据 Xpark 研发负责人蔡晓帆 则聚焦多模态数据处理这一AI 落地的前置瓶颈。
Xpark:面向多模态数据处理的自研引擎,基于 TCRay 提供 Xpark Dataset、DataFrame 和 AI Function,内置 50 余种图片、文本、音频、视频及 LLM 算子,并支持 UDF 迁移已有业务逻辑。现场测试中,在 CLIP 图文匹配场景下,Xpark 推理吞吐相较开源 Data-Juicer 提升 3 倍,GPU 利用率长期接近 100%;Exact Substring Dedup 相较开源 Text-dedup 单机算子快 47.8 倍。通过模型级联和判别式算子,部分场景可减少 70% 的大模型请求,注意这里指调用次数,而不是直接等同于总成本下降 70%。

图 4:Xpark 通过内置多模态算子降低开发门槛,并用模型级联减少大模型请求(现场演讲 PPT)

图:腾讯云大数据专家工程师 黄海升

腾讯云大数据专家工程师 黄海升带来的 Meson 引擎则专注结构化数据高性能计算。

Meson:面向结构化数据的高性能向量化引擎,核心能力包括向量化算子、Pipeline 执行模型、高性能 IO 和自适应优化。腾讯云现场披露的 1TB TPC-DS 测试显示,Meson 相较社区 Spark 整体性能提升 3.6 倍,部分计算密集型查询提升 5 倍;CPU 使用率由 80% 降至 40%,集群 IO 吞吐由 12Gbps 提升至 20Gbps,瓶颈由 CPU 转向 IO。产品同时保持对 Spark API、SQL、UDF 和生态组件的兼容,便于存量作业迁移。

图 5:Meson 在 1TB TPC-DS 测试中的性能、CPU 使用率与 IO 吞吐对比(现场演讲 PPT)

04

博世两项实践:统一算力底座与模型驱动的数据生产飞轮

博世中国数据平台技术专家 王磊

博世中国数据平台技术专家王磊围绕 Ray on TKE 混合计算调度实践,介绍了在线推理、数据处理和模型训练对统一算力底座的共同需求。传统资源按组或业务线切分,容易出现资源孤岛、峰谷错配和多人共享冲突;统一平台则通过 TKE 资源池、KubeRay 与 API 接入,将 Ray Job、Ray Serve、Spark 和自定义 Pod 纳入统一调度。现场 PPT 将两个关键收益概括为“开发即产线”和“排队与抢占”:开发环境、训练环境和推理环境保持一致,任务可按优先级使用异构资源,避免各团队分别建设和维护集群。

在具体链路中,Ray Serve 通过流水线并行和单卡多实例提升 GPU 利用率,Ray Data 将海量预处理拆分为可独立重试的分片,避免中间失败导致整条长链路重跑;训练侧则统一调度不同类型的 GPU/DCU 集群,使从开发环境申请、训练任务发起、推理部署到业务交付形成完整闭环。

图 6:博世 Ray 混合计算实践将资源申请、训练、推理和业务交付连接为统一闭环(现场演讲 PPT)

博世中国智驾数据产品专家陈立贤

博世中国智驾数据产品专家陈立贤进一步分享了以 Lance 作为数据中心、Ray 作为任务中心的智驾训练数据实践。Lance 统一管理图像、视频、点云等 Dense 数据与标签、元数据、模型输出等 Sparse 数据,使它们共享同一数据集身份、版本与血缘;Ray 则统一管理任务提交、资源、状态和结果聚合,让本地验证完成的任务可以使用同一任务模型扩展到集群。

这套架构把数据生产组织为模型问题驱动的闭环:模型问题转化为数据需求,随后完成数据挖掘、自动标注、人工修复、可训练数据集版本化交付,再进入训练与在线评测。与过去“湖仓交付后仍需多次统计、对齐和搬运”不同,新的交付对象本身就是可直接被训练和评测消费的数据集

05

WorkBuddy 实践:把数据处理、后训练和权限治理串成闭环

腾讯CodeBuddy/WorkBuddy Infra 负责人 张凯

腾讯 CodeBuddy/WorkBuddy Infra 负责人张凯以 WorkBuddy 数据实践为例,介绍了业务增长后集中出现的三类问题:数据处理任务和体量快速增加,对话、长文档等超大字段给常规读取和解析带来压力,同时算法、模型训练、BI、风控、运营和数据科学等多个团队需要在严格权限边界内使用同一批数据。

接入 AI DLC 后,业务数据、对话文档和行为日志先进入对象存储与 TCLake,再由 Serverless Spark × Ray 和 Xpark 完成数据准备、多模态处理、后训练与推理。存储与算力可以独立扩展,Spark 与 Ray 共享数据底座,MCP 和Open API 则让底座能够被 Agent 编排调用。针对超大字段,方案通过列式读取、冷热分离和 Xpark 多模态算子减少无效扫描,并在峰值任务中按需扩容。

现场 PPT 给出的 WorkBuddy 同数据集实测口径显示,数据处理耗时从5 小时降至 1 小时,吞吐提升 5 倍,按同等负载换算 CPU 使用率下降 80%;通过 API 串联 Agent 轨迹入湖、Xpark 特征提取、Ray Train 后训练和评估回流后,数据到训练的交付周期缩短 70%人工搬运减少 90%。这些数据在 PPT 中注明以内部报告口径为准。

除性能外,TCLake 还把数据加工、特征工程、模型训练、模型服务以及 Agent 轨迹和记忆纳入同一血缘体系;权限中心支持库、表、行、列级授权,并对操作过程全程留痕。对于需要持续后训练的 Agent 应用,这意味着数据处理效率、训练闭环和跨团队治理可以在同一平台内协同完成。

图 7:WorkBuddy 通过 API 串联轨迹入湖、数据处理、Ray Train 后训练与评估回流(现场演讲 PPT)

06

从产品发布到生产实践,数据平台服务的对象变成了“持续进化链路”

从当天六场分享可以看到,AI Native 数据湖并不是在传统数据平台旁边再增加一组 AI 功能,而是重新组织数据处理、模型训练、在线推理和 Agent 运行之间的关系。Spark 与 Ray 负责不同类型的工作负载,TCLake 统一管理数据和 AI 元数据,TCRay、Xpark、Meson 分别解决生产级 AI 计算、多模态处理与结构化性能问题,轨迹、记忆和评估结果则回流到数据与训练链路中。

这也是本次专场最重要的技术变化:平台不再只优化某一次 ETL、查询或训练任务,而是优化从数据进入、加工、训练、部署、反馈到再次训练的整体周转效率。腾讯云在现场提出,TCRay 后续将围绕“多、快、好、省”继续演进;AI DLC 在 2026 年下半年也将持续推进产品迭代、客户共建验证、数据核心资产价值探索和开放生态建设。

当 Agent 真正进入企业生产环境,数据底座的竞争不再只是谁能存更多数据、跑更快 SQL,而是谁能让多模态数据、异构算力、模型和 Agent 反馈在一套受治理的基础设施上持续循环。AI DLC 的发布以及博世、WorkBuddy 的现场实践,给出了腾讯云在这一方向上的阶段性答案。

展开阅读全文

更新时间:2026-08-05

标签:科技   腾讯   发布会   智能   数据   模型   底座   数据处理   闭环   现场   在线   平台   上下文

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034903号

Top