Video Editing Tool Free
提供从赛道选择到交付的完整变现执行框架,助力个人创作者快速启动。
只要用户提交表格/CSV/Excel/数据块,或提到"分析数据""找关系""盘数据""串表""对数据""看表""两表对比""数据有没有问题",都应调用此技能。即使用户没说"分析",只要给了表格数据并问"有没有猫腻""帮我看看""这数据对不对",也触发。不适用于:写代码处理CSV、解释数据库概念、画图表可视化、纯日志排查、代码审查、非结构化文本分析。
openclaw skills install @renshengruozhiruchujian-sudo/data-analysis-skills命令、参数、文件名以原文为准
像聪明实习生面对数据——聪明但缺上下文。四件事串起来:摸清对象和属性(Data)→ 用规则和计算找关系(Logic)→ 指向可执行操作(Action)→ 标出不能随便看的字段(Security)。每步推理展示出来(CoT)。
实事求是,不捏造。 源表是唯一事实来源——表里有什么就是什么,1就是1。不用训练数据/行业知识填充源表没有的内容("根据经验这个指标通常是X"——表里没写就是没写)。不美化、不补全、不"纠正"看起来不合理的值。表里没有的数值就是不存在,说"数据中没有这个字段"比编一个答案强一万倍。(注:业务常识可用于验证结论合理性——如"利润率200%明显不对"——但不能作为数据来源。)
能推断就推断,推断不出直接问用户,别硬猜。把用户当你师父。能从数据里找到答案的别问用户——先扫数据再决定问什么,问之前先探索。
LLM 读表天然不可靠——看错行、数错格、列混淆是最高频错误,长表/宽表尤其严重。
角色不是背出来的,根据数据内容和上下文动态派生。
用户扔数据过来
↓
① 扫数据:几行几列?什么字段?数值/分类/时间?
↓
② 推断数据情境(销售/财务/采购/人事/教育/医疗/家庭…)
↓
③ 派生 2-3 个相关视角(谁最关心?在意什么?)
↓
④ 复杂度路由(敏感字段条件优先于行数条件):
**前置拦截:** 数据行=0(仅表头/空表)→ 视同无数据,🔴停止,告知"表结构已识别但无数据行,请确认是否漏贴"。
数据行≤2 或仅1列且无上下文 → 不做统计分析。宽表(≥10列)仍做字段识别+Security标注,话术改为"这条记录来自哪张表?你想核实哪些字段?";窄表(≤3列)问"这个值代表什么、你想检查什么"。
├─ 简单(单表≤10行、全🟢、用户问题明确)→ 快速路径:
│ 跳过:视角派生、源数据可读性检查(直接贴文本无文件层问题)、IBM 6维(≤10行目测)、
│ Phase 3、CoT五步格式、强制交叉验证(简单计数/排序不强求两种方法)、主题级自检。
│ Security一句带过。对抗自审=自己重算一遍关键数字。输出=几句话+证据行号。
├─ 标准(单表>10行 或 双表 或 含🟡字段)→ 正常走 Phase 0-4
├─ 深度(≥3表 或 含🔴字段 或 涉合规/人事)→ 完整 Phase 0-4 + 强化 Security
└─ 以上都不满足 → 走标准路径
↓
输出篇幅:简单→几句话+行号;标准/fallback→完整报告;深度→报告+结论溯源附录
↓
⑤ 按当前上下文分路径:
├─ 交互式(用户能回应)→ 问用户视角是否对,用户定
└─ 自动化/子任务(用户不会回应)→ 按派生视角做通用分析,每个发现标注谁关心自动化路径规则: 凡是写"问用户""暂停确认"的地方,自动化路径改为:标注"待确认:{问题}",按最合理假设继续,结论降一级置信度。不阻塞。但🔴硬停止除外——文件损坏/加密/无数据时,任何路径都必须停止,不存在"按假设继续"。
简单路径意图升级: 用户问"有没有问题/猫腻/对不对"等诊断型问题时,即使≤10行也保留趋势/比率/派生列验证,不降级为纯计数。
部分损坏: 部分列可读、部分列乱码→对可读列做有限分析,标注"数据不完整,结论仅供参考";乱码列不猜不补。单元格内部分字符损坏(如�)→标该单元格"含损坏字符",其余内容可用,不整行排除。
系统性格式混乱 vs 个别歧义: 日期/格式问题若仅个别行→🟡标注继续;若整列系统性混用(>30%行格式不一致)→🔴阻断,问用户确认统一规则后再分析,不"按假设继续"。
样本→全量: 用户贴了样本但声称有全量数据时,Phase 1 质量判断基于样本,所有结论标"基于N行样本,全量可能不同";离群值在样本中可能是个例也可能是系统性问题,需全量验证才能定性。
视角派生示例和话术模板见 [REFERENCE.md § 视角派生](REFERENCE.md#视角派生)。
主题不是列名,是"用户在真实世界里关心的东西"。
拿到数据后,先确认能不能正确读出来。读不出来或读错了,后面全白搭。
(用户直接贴入文本/Markdown表格时,文件层跳过,直接看提取层。)
文件层(读不出来): 损坏/打不开→请重新导出;加密→要密码;编码乱码→试UTF-8/GBK;格式不匹配→按实际内容解析;图片/截图→🔴停止不猜。
提取层(读出但结构错): 公式非值→读缓存或告知重算;合并单元格→向前填充标注;隐藏sheet/列→问是否纳入;多级表头→识别层级分离;嵌入对象→跳过标注;PDF/Word表格→按视觉对齐还原标注误差。
🔴 读不出来 → 不硬分析。 告知用户具体问题 + 修复方式,等修复后重新提交。
判断格式:单表/多子表/多级表头(2行+无上限,可双向)/跨格合并/多张表/左右对照表/其他。非单表→先搞清每块代表什么、块间关系、合并还是分别。多子表往往是同一主题不同侧面,先找关联键。完整格式表+处理要点见 [REFERENCE.md § 输入格式](REFERENCE.md#输入格式)。
每行代表什么"东西"?有没有主键?
非记录型表格(先于选对象判断): 不是所有表"每行=一条记录":
数据方向: 行状(每行=记录) vs 列状/转置(列名=时间序列+行名=指标→转置) vs 宽格式面板(列名=时间+行名=实体→不转置,进行双维度分析,问用户侧重时间趋势还是实体对比)。
时间序列连续性: 间隔不等禁直接算环比,标"间隔N期"报绝对变化/年化率。缺失原因不明→问"无数据还是零"。
三角形/Cohort: 行=队列,列=偏移期(M0/M1…),右下角空=尚未可观测(非缺失),不计缺失率;首列定义常数(M0=100%)跳过变异检测。
主键适宜性: 时间戳、高空值率列不适合当主键。发现主键可疑(重复、空值>5%)主动提醒。
每列搞清楚:类型、业务含义(不是列名直译)、取值范围和空值率、单位、分类值含义。
测量层级(决定能做什么统计):
用大白话——不写"PaidOnTimeRate 是 0-1",写"近12月准时付款率,0.95=100笔里95笔按时付了"。
列名可能是错的: 不盲信列名。"收入"列实际可能是支出,"日期"列可能混了文本。用值域反推真实含义(全是负数→大概率不是"收入"),对不上就问用户。
基数: 1:1 / 1:N / M:N?看外键列值是否重复。基数决定聚合还是拆表。
自反链接: 同表内某列引用本表另一行。扫列名找"父/上级/源/原/前置/依赖/后续/阻塞/触发",引用值可为ID或名称。识别后重建树/依赖结构;先验证:父节点数值是否等于子节点之和?是→聚合节点(验证合计+占比);否→独立值(差异是发现)。时间区间列对(开始+结束)→配对字段,算持续天数,检测重叠+状态-时间矛盾("进行中"但结束日已过=逾期)。
派生属性: 同行内列间计算(利润=收入-成本)→从相关性分析排除。不排除: ①累积/递推列(余额,跨行依赖)→核心分析对象,验证递推逐行成立;分组递推(多物料台账)按分组键组内验证,不跨组,空=0。②层级聚合(父=子和)→验证合计+占比。③用户直接问的列→分析目标。排除仅限"同行计算+用户没问"。
语义补结构: 列名匹配和值域重叠都找不到时,用业务语义推断("下单客户"="会员"),再用值域重叠验证。双通道,单通道容易漏。
同名≠同义: 两张表有同名列不代表是同一概念(表A的"ID"可能是客户ID,表B的"ID"可能是产品ID)。匹配前必须验证值域是否重叠+业务语义是否一致,不能只靠列名相同就 join。
≥3表输出关系图骨架:
| 关系类型 | 从表.外键 → 到表.主键 | 基数 | 关联强度(强/弱/待验证) |多表操作链: 发现关联后,明确 join 顺序——从主表出发,按关联强度排序,先强后弱。每步 join 后验证匹配率,匹配率<80% 暂停问用户。
关联可能是虚假的: 值域重叠可能是巧合(如两张表都有"001/002/003"但一个是产品编号一个是员工编号)。关联强度标"待验证"的,必须用业务语义确认后再用,不能直接 join。
口径差异(语义层): 同一概念在不同表可能口径不同("金额"在订单表含税、在财务表不含税;"客户数"在营销表含潜在、在成交表只含已签)。跨表比较前先确认口径一致,不一致标注差异。
数据来源可信度(信任层): 这份数据谁生成的?手工录入还是系统导出?有没有被人工改过的痕迹(如某些行格式明显不同、数值被"修正"为整数)?来源不明或可信度存疑→在报告中标注"数据来源未确认,结论仅供参考"。
链接不完整或字段含义不明就主动问。
列出:总行数、总列数、数值列范围、分类列取值、时间跨度、缺失值情况。
大表处理: >100行用代码跑全量聚合(不逐行贴进分析),>1000行分块处理后合并。分析基于聚合结果,不基于肉眼扫行。
结构异常扫描: 多行单元格/空行/子标题行/汇总行混入→标注并排除出数据区。多级汇总(明细→小计→总计):识别标志=维度列含"合计/小计"或为空或数值=上方明细之和;所有层级排除,单独做算术验证。整表已是聚合→重心=验证合计+结构占比,不做均值/σ。
数据质量评估(IBM 6维扫描):
| 维度 | 查什么 | 告警级别 |
|---|---|---|
| 准确性 | 数值是否可信(明显离群、单位错误、小数点错位) | 🟡/🔴 |
| 完整度 | 必要字段缺失率(>20%阻断,5-20%警告,<5%提示) | 🔴/🟡/🟢 |
| 一致性 | 同列内格式/大小写/编码不统一(如"北京"/"beijing"/"BJ") | 🟡 |
| 即时性 | 数据是否反映当前状况(如用2024数据做2026决策) | 🟡 |
| 唯一性 | 主键/业务键重复(重复>0即警告,>5%阻断) | 🔴/🟡 |
| 有效性 | 值是否满足类型/格式/范围约束(如日期列有"待定"文本) | 🟡 |
告警处理:🔴阻断→暂停分析问用户;🟡警告→标注后继续,结论降置信度;🟢提示→记录不影响。
高频陷阱速查(top15,其余见 [REFERENCE.md § 低频陷阱](REFERENCE.md#低频陷阱)):
每个主题同时打出 Data + Logic + Action + Security,不是做完一个维度再做下一个。
对每个主题:
上锁(支撑什么决策)→ rubric(先定规则)→ Data → Logic + 交叉验证 → Action(下锁)→ Security
↓ 主题级自检(算对?验证够?安全标?)
↓ 打下一个主题每个主题问:谁关心?支撑什么决策?(如"供应商表现"→"要不要续约")
先明确:什么算正常/异常、阈值在哪。用户没给阈值 → 根据数据分布(均值±σ、分位数、IQR)自动推断,标注"自动阈值"。若目标列方差=0(所有值相同),跳过阈值推断和离群检测,直接报告"该列无变异",分析重心转向"为什么完全一致"(数据是否被截断/填充/尚未录入)。
列出相关字段、关键数值、数据来源(到表/文件)。
先跑确定性计算(聚合、分布、缺失率),再做关联推理(单表:函数关系/趋势/离群;跨表:匹配率/时间对齐/口径差异)。
交叉验证——每个结论至少两种独立方法:
| 类型 | 做法 |
|---|---|
| 方法交叉 | 不同计算方法独立验证 |
| 维度交叉 | 按时间/客户/品类切分,看模式是否稳定 |
| 血缘交叉 | 从结论回溯原始数据,核对口径 |
| 逻辑交叉 | 归纳(数据→结论) vs 演绎(假设→数据) |
| 上下文交叉 | 对照业务常识验证合理性 |
验证不通过: 差距小→中置信度;差距大→低置信度建议核查;完全矛盾→不硬推结论。
维度交叉必选规则: 数据含分类维度(部门/品类/地区/客群)时,维度交叉为必选方法,不可用其他交叉类型替代——辛普森悖论只有切分后才能发现。
阈值敏感性: 当结论对阈值选择敏感(不同合理阈值产出不同名单/判断)时,并列展示 2-3 个阈值方案及各自结论,不只给一个"自动阈值"结果。
思维纪律(防过度分析):
思维链格式(每结论必附): ①rubric ②数据(到行号) ③逻辑 ④交叉验证(≥2种) ⑤结论+置信度+来源锚点。追不到行标"来源未明"不下硬结论。完整模板见 [REFERENCE.md § 思维链](REFERENCE.md#思维链)。
逻辑工具优先——能算相关系数就不说"看起来有关"。
动态拆解: 每步看中间结果再决定下一步,别预先排好所有步骤。
中途回退: 分析中发现 Phase 1 的对象粒度/结构判断有误 → 立即回 Phase 1 修正,再重跑当前主题。不在错误结构上继续堆分析。
歧义解读用多视角 subagent: 触发条件:两个合理解读会导致相反的行动建议(如"该清库存" vs "该囤货")。小解释分歧不触发。触发时用 Agent/Task 工具 spawn 2-3 个 fresh subagent 各持一个视角(统计严谨派/业务实用派/怀疑派),只给数据+问题+分歧点,各自独立输出解读。综合时:2个以上视角一致→采纳;有强反对→在报告中标注反对理由,不只呈现选中结论。
| 模式 | 含义 | 适用 |
|---|---|---|
| ⚡ 直接可做 | 用户自主操作 | 标记、提醒、报表修正 |
| 📋 提案待审批 | 需审批 | 资金处置、合同变更 |
| 🚫 不主动执行 | 只生成事实清单交人工,不做定性 | 合规/人事/法律判断 |
🚫 比 📋 更克制——连提案都不做,避免锚定偏差。
梯度行动: 同一发现对应多个可能行动时,按克制程度梯度列出(⚡→📋→🚫),标注各自适用条件,由用户选择执行层级。不只给最激进的一个。
每个行动附:闭环验证(做了后怎么看效果)+ 风险提示(做错了会怎样)。
| 维度 | 问什么 |
|---|---|
| 字段等级 | 🔴(姓名/身份证/手机号/银行卡/病历/薪资)、🟡(成本/内部价/利润率/合同)、🟢(产品名/日期/品类) |
| 标记传播 | 上游🔴字段推导的结论是否继承🔴? |
| 角色适配 | 给谁看合适?不给谁看? |
| 用途 | 适合用于什么场景?不能挪作什么用? |
| 组合风险 | 多字段组合能否定位到个人?≥2个🔴/🟡必查 |
每个主题打完过三问:算对了吗(口算验证)?验证够了吗(≥2种方法名)?安全标了吗(五项全过)?不通过当场补。
3.0 安全审核前置: 扫所有主题Security段——标注完整?传播链完整?角色适配?用途?Action模式?有问题回Phase 2补。
3.1 主题互关联: 各主题印证还是矛盾?口径不同还是真矛盾?互补→写明各回答什么决策+综合行动。
3.2 结论溯源: | 主题 | 来源锚点(到行/字段) | 方法 | 验证 | 结论→行动 |。来源必须到行+字段,追不到标"来源未明"。
3.3 全量安全汇总: 🔴/🟡/🟢 所有字段一张总表。
脑子里过一遍 10 项(A1-A5 计算逻辑 + B1-B5 安全行动),不过关回去补。完整清单见 [REFERENCE.md § 自检清单](REFERENCE.md#自检清单)。
关键项:数学复算、交叉验证≥2种、CoT五步齐、来源追到行、结论反查对得上、Security五项全、Action模式对。
自检通过后,不是直接交付。再做一轮对抗性验证——目标是试图推翻自己的结论:
证据闸门: 每一步验证必须展示实际计算/定位结果作为证据。禁止说"验证通过""看起来对""应该没问题"——没有展示重算输出的"已验证"等于没验证。
独立审查员(subagent): 对抗自审不是自己审自己。仅标准/深度路径触发(简单路径=自己重算关键数字)。
用 Agent/Task 工具 spawn fresh subagent,只给:①相关数据行(结论引用的行,非全表)②待验证结论(选置信度最低/风险最高的2-3个)③关键假设(1-2条前提)④用户问题。不给推理过程/分析思路/中间计算(物理隔离防锚定)。判定:一致/不一致/无法复现,不一致必须说明哪里不对+数据实际是什么。完整 prompt 模板见 [REFERENCE.md § 审查员模板](REFERENCE.md#审查员模板)。
Tiebreaker: subagent判"不一致"时不盲改——定位具体单元格核对:主agent错→改;subagent看错行→保留标"审查员误判"。方法分歧≠错误: 双方数据正确但方法不同(环比% vs 绝对差)→选定匹配用户问题的方法或并列两种。
3次失败规则: 如果一个结论连续 3 次用不同方法都无法验证通过 → 停下来质疑前提(对象粒度认错了?join 键选错了?混淆变量没控制?),不要继续表面修补。
防御修复闭环: 发现漏洞后不止步于"标注问题"——构建修复(补数据/换方法/加限定条件)→ 验证修复后结论是否变化 → 记录残余风险("即使修复后,仍有X%不确定性来自Y")。
任何一步发现问题 → 回 Phase 2 修正对应主题,修正后重跑 4.1 + 4.1b。最多循环 3 轮,3 轮后仍有未解决问题 → 标注为"未解决"交付,不硬推结论。
🔴 对抗自审不可跳过(形式按路径分:简单=重算关键数字,标准/深度=subagent独立验证)。 跳过 = 把错误留给用户发现。
交付后主动问:有没有不对?哪个方向深入?不确定结论说明原因。会话内纠错→一句记下教训后续引用,不跨会话。
第一轮基础扫描→问方向。第二轮深入+验证→问要再细吗。第三轮专项深挖。深挖某主题→其他结论不动,追加不覆盖。
无可靠自动记忆。别假装记得。用户当场提供或文件里翻到才算数,否则从零开始。别编。 详见 [REFERENCE.md § 代理记忆](REFERENCE.md#代理记忆)。
输出格式模板、视角派生示例、自检清单、必须问场景、代理记忆详见 [REFERENCE.md](REFERENCE.md)。
角色视角定义见 [ROLES.md](ROLES.md)。完整案例见 [EXAMPLES.md](EXAMPLES.md)。
已收录 1 个 Skill