ARK · AGENTBUSINESS SHARING
01 / 20
From Practice to Platform · 40 min

从数据 Agent
到企业 Agent 平台

先把共用运行底座做深,再让各 BU 用自己的 Skills 和 MCP 长出业务 Agent。能力统一建设,场景分布式生长。

七成
公共底座的叙事判断,不是精确进度
6
幕 · 一条主线
1
套 ARK Engine 共用底座
验收
权限、回归与人审通过才上线

公司管理层 · 各业务部门负责人 · 业务落地 × 平台治理

内部分享 · 架构材料为 2026-06-23 快照 · 不把架构图当成当前生产进度
开场 · 3 min
The Destination · 先讲终局,再讲落地

高净值客户服务的多 Agent 终局,长什么样

高净值客户多 Agent 服务目标态 客户与理财师通过微信和 App 用自然语言进入诺Chat 入口,多 Agent 协作引擎把复杂问题分解为子任务,调度五个岗位 Agent:客户洞察、产品分析、市场情绪、投顾建议与投后服务;底部的模型层可插拔并统一路由与成本计量,数据层打通 CRM、交易、产品与行为数据并向上支撑全部 Agent。 客户 微信 · App 理财师 微信 · App 01 · ENTRY 诺Chat 入口 NLP · 多轮自然语言 02 · ORCHESTRATOR 多 Agent 协作引擎 复杂问题 → 子任务分解 调度 · 汇总 · 上下文共享 03 · FIVE ROLE AGENTS · 五个岗位 客户洞察 Agent 资产 · 交易 · 行为汇总,实时识别资金异动 投前 产品分析 Agent 各产品线费率与收益对比分析 投中 市场情绪 Agent 新闻与舆情解读,判断市场情绪 投中 投顾建议 Agent RISK + 规则库 + RAG · 出证据与方案,决策留给理财师 投中 投后服务 Agent 产品到期提醒 · 持有跟踪 · 服务续接 投后 支撑 04 · MODEL LAYER 模型可插拔 统一路由 · 按场景选型 · Token 成本计量 05 · DATA LAYER 数据必须打通 CRM 交易系统 产品数据库 行为数据
主链路:触点 → 入口 → 协作引擎 → 岗位 Agent模型层与数据层向上支撑目标态示意 · 非当前生产进度
难点 ① · Agent 间协调任务分解之后,谁在什么时机调用谁、结果如何汇总交接,不能靠 Prompt 碰运气。→ 后文:ARK Engine 统一建设运行与编排
难点 ② · 任务分配每个岗位的能力要标准化、可复用、可审计,而不是写死在某次对话里。→ 后文:Skill + MCP 货架 · 66 个 Skill 有契约全文
难点 ③ · LLM 幻觉对客场景里,没有凭据的数字一个都不能出现。→ 后文:七维证据核对 · 无成功取数不得报数

这一页只交代一件事:画这张图不难,难的是让它可信地跑在生产里。上面三个难点的解法,就是接下来 40 分钟的内容。

目标态示意 · 高净值客户智能服务 · Agent 出证据和建议,方案由理财师决策
第一幕 · 5 min
111 秒 · Skills 看板 + 三问下钻 + 完整任务交接

先看一个真实数据 Agent怎么工作

看完就知道怎么运作

三问下钻

本月哪个产品分类募集最多?和上个月相比结构有没有明显变化?
定存保近12周,是脉冲还是趋势?
7月峰值由哪一天、哪笔订单驱动?
记住一件事:它不是在写 SQL,而是在完成一次完整的业务判断:锚定目标、找到缺口、定位根因、形成行动。

变的是前端界面,不是另一套 Agent。左边是已上线的第一版小诺,右边是接下来要给业务用的进化版。

同一套问数能力 · 第一版已在现网 · 进化版是下一版界面
第二幕 · 6 min
Act 02 · DataATM Plugin

DataATM Plugin:Skill 管业务,MCP 管执行

Plugin 把业务方法与受控数据工具装进 Agent:先选对 Skill,再由 Skill 组合 MCP 工具完成取数、分析与交付。

DataATM Plugin 运作架构 用户问题进入带有敏感数据识别与脱敏护栏的 Agent 运行时,加载 DataATM Plugin 中的领域知识与执行策略,并通过 DataATM MCP 的公开工具访问 DataATM;DataATM 负责权限管控、查询执行和历史审计,校验后返回结论与产物。 DATAATM PLUGIN DATAATM MCP INTENT LOAD CALL DATA ① 口径 / 路径反思 ② 工具 / 参数 / VIEW 反思 ③ CHECK · ANSWER 01 · INPUT 业务问题 诺Chat / 工作台 自然语言 + 上下文 02 · AGENT RUNTIME 发现与路由 理解意图 · 选择 Skill 规划步骤 · 编排调用 PLATFORM SECURITY GUARDRAIL 敏感数据识别 · 输出脱敏 03 · SKILL ARCHITECTURE 领域知识与执行策略 Foundation · 查询基座 Domain · 业务口径BU / 客户 / 员工 / 产品 Orchestrator跨表归因 OutputHTML 报告 每个 Skill = 触发条件 + 口径 + View + 路径 04 · 17 PUBLIC TOOLS 受控执行层 发现解释list / explain 查询分析query / split / rank / compare 结果交付download 数据准备draft → confirm 数据回写add / update / delete records 协议 / 反馈sheet protocol / feedback OAuth 身份 · 权限继承 · 审计 · 写入非只读 05 · DATA GOVERNANCE DataATM 数据执行与治理底座 权限管控 查询执行 历史审计
主调用链三层反思闭环Agent 平台内建敏感数据脱敏;DataATM 负责权限、执行与历史审计
① 运行时 ↔ Skill:口径 / 路径反思检查是否选对业务范围、指标口径、View 和分析路径。
② Skill ↔ MCP:工具 / 参数 / View 反思根据 schema、空结果、字段错误、权限错误调整工具、参数或 View,再次执行。
③ 任务外循环:检查 → 回答 → 下一轮追问校验结果后返回用户,必要时利用新上下文继续下钻。
第三幕 · 4 min
72 秒 · 图解口播 · 真实 Langfuse 页面

一次对话,要能看清完整的运行过程

先看运行,再讲闭环

会话 → 链路 → 趋势

01 Session — 多轮请求串在同一会话
02 Trace — 下钻模型、Skill、工具与 Token
03 根因 — 上下文、工具返回、重试分开看
04 Dashboard — 七日 Token 与质量趋势对上 Trace

图解口播版 v2 · 真实页面 + 分镜旁白 · 不自动播放
第三幕 · 质量闭环
Act 03 · Controlled Evolution

当前闭环:自动评估,人工改进

质量 Agent 按固定时间窗读取运行证据、执行规则并写回评分;问题确认、代码修改、回归、审批和发版仍由人完成。

质量 Agent 自动评估与人工改进的工作流程 线上 Data Agent 将运行证据写入 Langfuse;独立质量 Agent 按时间窗执行七维评分,写回 Score、人审候选、数据集与问题清单;工程师人工确认并修改 Skill、Plugin、MCP 或业务口径,再经过测试、回归、审批和发版进入下一轮生产观测。 WRITE READ QUEUE 人工提交 人工发版后进入下一轮生产观测 ONLINE · 实时 Data Agent 加载业务 Skill · 调 MCP 完成用户任务 EVIDENCE STORE Langfuse Trace / Observation 输入 · Skill · 工具 · 结果 Token · 时延 · Score 只留证,不改代码、不发布 OFFLINE · 独立评估任务 DataATM 质量 Agent 不是一个评分 Skill;是调用规则与工具完成闭环的 Agent ① 调度器 固定时间窗分页取证幂等续跑 ② 质量规则 7 维确定性评分业务质量契约人审触发条件 ③ 工具 读 Trace核对结果写回 / 入队 自动产出:Score · Human Review · Dataset · 问题清单 HUMAN TRUTH 业务审核人 · Annotation Queue 只审证据不足、业务真值、用户纠正、新场景或契约冲突;确认 HITL Pass VERSIONED DATASETS Regression · Silver · Gold 失败防复发 · 人审经验 · 专家发布基准 Gold 永不自动晋级 MANUAL ENGINEERING 工程师人工确认并修复 按责任层修改 Skill / Plugin / MCP / 业务口径 MANUAL RELEASE 测试 → 回归 → 审批 → 发版

自动化边界:质量 Agent 只做取证、七维评分、入队和写回;它不改代码、不升级 Skill、不自动发版。

1,367TRACE3,144SCORE11人审候选151REGRESSION
责任边界:质量 Agent 找问题并举证;工程师人工修复,Owner 审批后再发版。
第三幕 · 质量规则
7 Deterministic Checks · Evidence First

不是“感觉答得好”,而是逐项核对证据

每条 Trace 都按同一规则产出 Pass / Fail / Unknown,并保留判定依据;Unknown 与业务真值问题进入人审,不让模型替自己打分。

质量维度检查什么主要证据与典型失败
01路由准确
场景是否加载了正确的 Skill / View / 分析路径
看 usedSkills 与调用链;应走客户主数据却误走产品分析,或未加载必要 Skill,判失败
02参数对齐
时间、组织、指标、粒度是否与用户问题一致
对照原问题、工具参数和 schema;问“上月香港”却查本月全公司,判失败
03筛选完整
声明的业务条件是否真正进入 applied filters
核对 View 内层与 Data Prep 外层筛选;漏客户范围、状态或权限条件,判失败
04结果完整
工具是否成功返回、数据是否足以回答问题
空结果、权限拒绝、字段缺失或只返回部分分组时,不得输出完整业务结论
05回答忠实
每个数字和结论是否能回指工具结果,失败是否披露
无成功取数却报 AUM、把推测写成事实、忽略冲突统计,均判失败
06重试效率
重试是否因错误反馈而调整,还是重复空转
看 Observation 序列;相同参数重复调用、无效换工具或达到上限仍不降级,判失败
07时延健康
端到端与关键步骤是否满足该场景配置的时延门槛
按 Trace / Observation 定位模型、Skill 或工具瓶颈;不使用虚构的统一阈值
确定性规则负责:能从 Trace、参数、筛选和结果直接验证的事实;每个 Fail 都带证据位置与可能责任组件,形成问题清单。
人工负责:业务口径真值、证据冲突、用户纠正、新场景,以及 Silver / Gold 的最终确认。
第三幕 · 真实案例
Trace b7e84… · 讲清飞轮就够了

一次真实失败,如何变成下一版能力

案例问题:「总结我名下客户的 AUM 和持仓产品风格。」路由是对的,但取数被拒绝后,回答仍给出了确定性数字。

01 Data Agent调用 DataATM 时被权限策略拒绝
02 留证Trace 记下拒绝、调用链与最终回答
03 质量 Agent独立判定:无取数却输出确定数字
04 入 Regression同一问题,修复后再测
错在哪里

编造了确定性结论

所有查询被权限策略拒绝,最终回答却仍给出 AUM、客户分层和投资建议。

质量 Agent 输出

不是一句「效果不好」

路由通过,不必误改路由。结果完整性失败、回答忠实度失败。权限交给数据权限负责人。

门禁

无成功取数不得报数

Regression 防复发;Silver 是人审经验;Gold 才是发布标准,质量 Agent 永不自动晋级。

第四幕 · 8 min
架构图是地图,平台是站点

最关键的不是多做 Agent,而是共用一个底座

诺亚控股 AI 整体架构拓扑图 v2.0
公司统一建设运行、工具、模型和治理 · BU 只加业务 Skills、MCP 和入口
第四幕 · ARK Engine
约 90 秒 · 登录后的操作台 · 2026-08-22

一个 Agent,怎样真正走上线

先看操作台,再看结构

创建 → 装配 → 上线

创建与配置:角色、场景和模型一次定好
MCP / Skill / 知识库装配进同一个 Agent
接入真实业务入口,上线后仍可管、可查
记住一件事:不是只把模型配好,而是把数据、方法和业务入口一次接通。
默认不自动播放 · 下一页再看运行时结构
第四幕 · ARK Engine
Build · Run · Operate

从创建 Agent,到发布、运行与排障

产品层管建设、接入和运营。统一入口之下,是两类运行时与会话池。

ARK Engine 运行时结构 诺 Chat、企业微信和业务应用通过统一 HTTP API 调用 noah-agent-gateway;Gateway 负责 Run、Session、Event 协议以及模型配置、Auto 路由、Fallback 和用量归集;Noah-agent-sdk 下有 AgentRuntime 与 AgentCore Runtime 两类实例及相应弹性会话池。 诺 Chat 企业微信数字人 BU 业务应用 UNIFIED GATEWAY noah-agent-gateway Run / Session / Event · 统一请求协议 模型配置 · Auto 路由 · Fallback · 用量归集 NOAH-AGENT-SDK · RUNTIME LAYER 统一HTTP API调用入口 RUNTIME INSTANCE A AgentRuntime 执行环境与生命周期 · 调度模型 / 工具 / Skills 弹性会话池 · 亲和路由 · 缩容到 0 · 休眠唤醒 RUNTIME INSTANCE B AgentCore Runtime 安全托管运行时 · Active / Idle / Terminated 状态隔离 弹性会话池 · 每会话隔离 · Idle 不计费 · 长期空闲缩容
01 建设与发布提示词结构化填写 · 发布到诺 Chat · 打包 Plug-in · 合规提示词维护
02 运行配置模型 Auto 路由 · 能力按需勾选 · 打通企微数字人 · Run / Session / Event
03 运营与排障企微群告警 · 问题总览与追踪 · 全链路日志 · 运行状态管理
结构看图 · 能力看三列小字 · 现场以操作台为准
第四幕 · Skill Hub
约 90 秒 · 货架回读 · 2026-08-21

66 个 Skill 在货架上,点开能看到契约全文

先看货架,再看门禁

规划 → 检测 → 上架

66 个已发布,点开就是契约全文
stock-analyst 385 次调用,热门会上浮
分发到 CRM Claude / ARK Engine
记住一件事:人走了,方法论还在货架上。
演示计数勿当实时生产 · 现场以工作台回读为准
第四幕 · 技能资产
Act 04 · Skill Hub

个人经验要变成公司的可信资产

Skill Hub 不是技能下载站。每个 Skill 有编号、版本、Owner、质检报告、调用计量和分发渠道。人走了,方法论还在货架上。

01规划

何时该用,完美输出长什么样

02评审

价值真伪、判重归口、防重复建设

03提交

SKILL.md + 基准输出 + Owner

04检测

静态查形,动态隔离真跑

05上线

分发 Engine / 诺Chat / CRM

06运营

热门上浮,零调用预警下架

静态门禁

先查「形」

命名、后缀、SKILL.md、frontmatter。格式不过,进不了动态检测。

动态门禁

再查「神」

Mock 环境真跑:敏感数据进出、Token、降级、与基准输出对比。合规一票否决。

TRACE 标尺

信任 · 可靠 · 适用 · 规范 · 有效

五维可比;动态质量分加权 ≥70 才通过。Hub 管上下架,OPS 管调用量。

2026-08-21:66 个已发布 · 28 个零调用 · 官网演示数据勿读,以工作台为准
第四幕 · Skill 优化
Langfuse 留证 · Hub 发版

Skill 优化:Langfuse 看见,Hub 发版

Langfuse 不改 Skill。它只告诉你错在哪一层。改完的契约进 Hub 发新版,Regression 回归后,Engine 才加载。

01

Langfuse 看见

Trace 记下用了哪个 Skill、工具参数、拒绝原因和最终回答。

02

归因到层

先分清:业务 Agent、知识库 Agent、Skill 契约、权限还是模型。不要误改路由。

03

改 SKILL.md

只改该改的:触发条件、能力边界、无取数不得报数、降级话术、标准答案。

04

Hub 两道检测

静态过形、动态过神,TRACE ≥70。不过检的版本不能上架。

05

Regression 回归

用原 Trace 的同一问题重跑。防复发,不把当日动态金额写死成答案。

06

Engine 加载

新版本分发到 Engine / 诺Chat;软链热更新,Owner 批准后才对业务生效。

回到刚才那次失败:不该改路由,该把「无成功取数不得报数」写进 Skill 契约。Langfuse 证明它发生过,Hub 让下一版带上这条门禁。
第四幕 · AI OPS
约 90 秒 · 登录后的驾驶舱 · 2026-07 / 2026-08-22

费用、模型和 MCP,都在同一套驾驶舱

先看驾驶舱,再看治理

费用 → 安全 → 质量

2026-07 费用 $69,861,526 亿 Token
368 个 MCP 工具里,8 个被运行时阻断
费用落到 BU × 模型 × 产品 × 用户
记住一件事:不可计量就无法管理。
7 月费用为平台快照 · MCP 为 2026-08-22 回读 · 不替代实时账单
第四幕 · 运营中枢
Act 04 · ARK AI OPS

AI 要从项目堆,变成可运营的资产

不是又一个看板。它不做模型、不做应用、不替代网关——而是横跨整栈,让所有 AI 能力可计量、可治理、可优化、可汇报。

费用失察

这个月到底花了多少

多云、网关、席位、实收四条管道统一折算 USD。2026-07:$69,861,526 亿 Token。

安全失控

不该放行的必须拦住

368 个 MCP 工具里 8 个被运行时阻断。审核不是文档,是系统能证明拦过。

质量失准

上线了,不等于用得好

31 个 Agent 已登记;28 个 Skill 连续 30 天零调用。既有热门榜,也有淘汰预警。

投入失据

哪个 BU 值得加预算

费用落到 BU × 模型 × 产品 × 用户。没有统一口径,就没有投入决策。

一句话:不可计量就无法管理。治理必须落到运行时阻断和限额追踪;周报每周一 08:30 进企微,AI 运营才算进入公司节奏。
数字为 2026-07 平台快照 · 现场以驾驶舱回读为准 · 不替代实时账单
第四幕 · 知识库 MCP
49 秒 · 四库上传与 MCP 消费闭环

文档要进库,必须先过审核

先看入库,再看 12 步

上传 → 待审 → 检索

01 选库 — 业务规则 / 需求产品 / 操作流程 / 研发规范
02 打标 — 七个标准标签决定谁能搜到
03 待审 — 未通过不进 Dify
04 复用 — Skill 经 MCP 取上下文包

默认不自动播放 · 下一页是 CRM 模拟案例的 12 步全景
第四幕 · 知识库 MCP
CRM 模拟案例 · Harness 1–6 + Loop 7–12

一次需求,怎样变成可复用的知识

CRM 客户流失预警:Harness 1–6 检索产出,Loop 7–12 审核入库再复用

图是 CRM 模拟案例全景。现场进入 AiCoding 知识库 MCP,讲 12 个 Skill 与四库。

第四幕 · 知识库 MCP · CRM 模拟案例
第四幕 · 平台边界
一张图讲清谁负责什么

统一底座,不等于统一做完所有业务

平台团队提供公共能力,BU 负责业务差异。每一层都有清楚的建设责任和复用边界。

01

入口 · 各自呈现

诺Chat、驾驶舱、BU 工作台或业务页面都可以复用同一底座。

BU / 平台
02

ARK Engine · 公司共建

运行、编排、续跑、沙箱、审计与多 Agent 协作只建设一套。

公共底座
03

Skills + MCP · BU 扩展

BU 沉淀业务规则和动作接口,不重复建设运行平台。

业务差异
04

知识库 Agent · 跨场景复用

知识独立维护,可被不同入口和业务 Agent 作为公共专家调用。

公共 Agent
05

ToolHive + Higress · 统一治理

一个管工具,一个管模型,把权限、额度、成本和审计收回公司层面。

公司网关
第五幕 · 8 min
Act 05 · Same Base, Different Risk

同一底座,让不同 BU 长出自己的 Agent

公共底座完整复用,BU 只增加领域 Skills、业务 MCP 和风险门禁。知识库 Agent 作为公共专家随处可用。

ARK Engine
ToolHive · Higress
知识库 Agent · Trace / Eval
客户经营

找人、匹配、触达

新增对外发送审核与客户范围约束。

服务运营

查单、处理、升级

新增写操作审批、幂等与异常升级。

内容 Agent

选题、生成、适配

新增品牌规则、版权与对客输出审核。

研发 Agent

改码、测试、交付

新增仓库权限、Review 和发布门禁。

第五幕 · 治理
让业务安全地快

平台不是为了管慢,而是让业务安全地快

三个最常见的失控点:Token 黑箱、经验不回流、小工具直接上线。

Token 消耗失控只看月底总账,找不到哪个场景、模型或步骤在烧钱处理:按 BU / 用户 / Skill 计量,再用 Trace 下钻到 Prompt、历史、检索、工具循环与输出。
业务经验流失纠错和隐性规则留在聊天、个人文档或某个开发者脑中处理:批注 → 提案 → Owner 审核 → 黄金题集 → 版本发布,不自动把对话写成真理。
Vibe 工具蔓延一个需求一个应用,重复登录、密钥、数据连接和运维处理:建立台账;无 Owner 或重复工具退役;共性能力收回平台;新增需求先搜索复用。
写完直接上线把「能运行」误当成「能生产」,没有测试、回滚、审计和运营处理:L0 个人试验 → L1 团队试用 → L2 生产应用;级别越高,门禁越完整。
Call to Action

认可统一平台,
把高价值场景交进来

不鼓励每个部门重新建设一套 Agent 平台。平台统一建设 ARK Engine、ToolHive、Higress 和公共 Agent;BU 负责业务 Skills、MCP、真实场景和验收标准。

下一步

提交一个值得孵化的场景

它应当高频、有价值、可验收,并且有明确业务 Owner。我们从真实场景开始,共同把它孵化成正式 Agent。

统一建设底座,让业务能力分布式生长。Agent 可以不同,运行、工具、模型和治理不再重复建设。

方向键 / 空格翻页 · 内部分享材料