Data Analysis

基于 CellCog 的 AI 数据分析与可视化,支持数据清洗、探索性分析、假设检验、统计报告、机器学习模型评估、数据集画像及图表仪表盘。上传 CSV 即可获得完整 Python 分析结果。

已扫描
适合谁
需要快速分析数据的业务分析师、缺乏编程基础但需数据洞察的职场人士
不适合谁
无网络环境无法调用API的用户、对数据隐私要求极高的敏感场景使用者
国内可用性
需网络配置。可能需要网络配置或第三方服务可访问。
安装难度
新手友好(★☆☆)。基于终端操作、依赖、API Key 和本地环境要求的初步判断。

安装与下载

openclaw skills install @nitishgargiitd/data-cog

Skill 说明

命令、参数、文件名以原文为准

数据分析 - 你的数据有答案,CellCog 找到它们

从上传的文件中进行数据分析与可视化。

大多数 AI 工具在你询问数据时只会返回代码。而 CellCog 直接返回实际结果——包括图表、清洗后的数据集、统计报告和可视化仪表板。只需上传混乱的 CSV 文件并给出简短提示,CellCog 的编码代理便会自动探索数据,发现其中的模式,并以美观的方式呈现。全程支持完整 Python 操作,涵盖数据清洗、建模评估等全流程任务。

如何使用

在会话中首次使用 CellCog 时,请先阅读 cellcog 技能文档以获取完整 SDK 参考——包括文件处理、聊天模式、超时设置等信息。

OpenClaw(即发即忘)模式:

result = client.create_chat(
    prompt="[你的任务提示]",
    notify_session_key="agent:main:main",
    task_label="my-task",
    chat_mode="agent",
)

除 OpenClaw 外的所有代理(阻塞等待完成):

from cellcog import CellCogClient
client = CellCogClient(agent_provider="openclaw|cursor|claude-code|codex|...")
result = client.create_chat(
    prompt="[你的任务提示]",
    task_label="my-task",
    chat_mode="agent",
)
print(result["message"])

为什么 Data-Cog 不同于其他工具

代码是工具,不是输出

其他 AI 工具给你的是 Python 代码并说“运行这个”。而 CellCog 会为你执行代码,直接交付结果:

其他 AI 工具Data-Cog
“这是分析数据的 pandas 脚本”这里是你的实际洞察与图表
“运行这段 matplotlib 代码查看图表”图表已生成,并附带分析注释
“这个 SQL 查询能找出异常值”已发现 23 个异常值,解释其含义
“你需要 scikit-learn 来做这个”模型已完成训练,展示准确率与特征重要性

你上传数据,得到答案。代码在后台自动运行。


你可以完成的数据工作

探索性数据分析(EDA)

快速理解数据:

  • 数据集概览:“分析这个 CSV —— 分布情况、缺失值、异常值、相关性及数据质量摘要”
  • 模式发现:“这份销售数据中存在哪些趋势和规律?给我惊喜。”
  • 异常检测:“找出这份服务器日志中的异常模式——什么看起来不正常?”
  • 关系分析:“在这个数据集中,哪些因素最强烈地影响客户流失?”

示例提示:

“分析这个数据集:

<SHOW_FILE>/path/to/customer_data.csv</SHOW_FILE>

我对这个数据了解不多。请提供:

  • 总体概况:行数、列数、数据类型、缺失值情况
  • 关键分布与统计摘要
  • 最有趣的关联关系
  • 是否存在异常值或数据质量问题
  • 3-5 个突出的发现

以交互式 HTML 报告形式呈现,包含图表。”

数据清洗与转换

将混乱数据整理成可用格式:

  • 清理脏数据:“清理这个 CSV —— 修复不一致的日期格式,处理缺失值,删除重复项,统一列名”
  • 数据转换:“将这份交易数据按产品类别汇总为月度报表”
  • 数据合并:“根据 customer_id 合并这三个 CSV 文件,生成统一数据集”
  • 特征工程:“从这份原始数据中创建可用于房价预测的有用特征”

示例提示:

“清理并转换这个数据集:

<SHOW_FILE>/path/to/messy_data.csv</SHOW_FILE>

已知问题:

  • 日期格式混杂(MM/DD/YYYY 和 YYYY-MM-DD)
  • 'Revenue' 列包含美元符号和逗号
  • 存在重复行
  • 'Region' 列有缺失值

清洗后返回干净的 CSV,并附上修改说明。”

统计分析

严谨的数值分析:

  • 假设检验:“我们的 A/B 变体之间转化率是否存在显著差异?”
  • 回归分析:“哪些因素能预测该 HR 数据集中的员工薪资?构建回归模型。”
  • 时间序列分析:“分析这份月度收入数据——趋势、季节性,并预测未来 6 个月”
  • 用户分群分析:“按注册月份制作用户留存的分群分析”

示例提示:

“我们在结账页面进行了 A/B 测试:

<SHOW_FILE>/path/to/ab_test_results.csv</SHOW_FILE>

字段:user_id, variant (A 或 B), converted (0/1), revenue, timestamp

请告诉我:

  • 变体 B 是否具有统计学意义的优势?(p 值、置信区间)
  • 转化率差异
  • 人均收入差异
  • 样本量是否足够?
  • 我的建议:上线 B 版本还是继续测试?

用清晰的图表展示,并给出通俗易懂的结论。”

可视化与报告

将数据转化为视觉故事:

  • 图表生成:“创建一组图表,展示这份数据的季度表现”
  • 仪表板报告:“基于这份销售数据构建一个可交互的仪表板,支持按地区和产品筛选”
  • 演示级可视化:“从这份研究数据中生成适合发表的高质量图表”
  • 对比可视化:“可视化我们的指标与行业基准的对比情况”

机器学习应用

无需繁琐配置即可实现机器学习:

  • 分类任务:“基于此数据集预测客户流失——训练模型,展示特征重要性”
  • 聚类分析:“根据用户行为将这些客户划分为若干群体——自然存在多少个簇?”
  • 预测建模:“使用历史数据预测下一季度销售额”
  • 模型评估:“我已训练一个模型——这是预测结果。请评估:准确率、精确率、召回率、混淆矩阵、ROC 曲线”

示例提示:

“从这份数据集中预测客户流失:

<SHOW_FILE>/path/to/customer_features.csv</SHOW_FILE>

目标字段:'churned'

  • 训练模型,尝试至少两种算法
  • 展示特征重要性——是什么导致流失?
  • 提供混淆矩阵和 ROC 曲线
  • 用通俗语言总结:“客户流失的前三大原因是……”
  • 基于发现提出可操作建议

我要的是洞察,不只是指标。”


支持的数据格式

格式上传方式
CSV通过 SHOW_FILE 上传
Excel (XLSX)通过 SHOW_FILE 上传
JSON通过 SHOW_FILE 上传
Parquet通过 SHOW_FILE 上传
SQL 导出文件通过 SHOW_FILE 上传整个导出文件
内联数据在提示中直接描述小型数据集

输出格式

格式适用场景
交互式 HTML 仪表板可探索的图表、筛选功能、下钻分析
PDF 报告可分享的分析报告,含图表与结论
清洗后的 CSV/XLSX用于后续流程的干净或转换后数据文件
Markdown快速洞察,便于集成至文档

数据分析推荐聊天模式

场景推荐模式
快速清洗、简单图表、基础统计"agent"
复杂分析、多技术结合、机器学习建模、全面报告"agent team"

**大多数数据任务推荐使用 "agent" 模式**。数据清洗、探索性分析、图表生成和常规统计分析在此模式下表现良好。

**复杂分析项目推荐使用 "agent team" 模式**——适用于多方法分析、模型对比,或需要深入解读数据含义的场景。


示例提示

极简提示,最大洞察:

“分析这个:

<SHOW_FILE>/path/to/data.csv</SHOW_FILE>

告诉我所有有趣的内容。”

仅此而已。CellCog 的编码代理将自动进行数据概览、探索性分析、模式识别,并以图表形式呈现发现。你无需知道该问什么——代理会自行判断。

商业分析示例:

“分析我们的电商业务数据:

<SHOW_FILE>/path/to/orders.csv</SHOW_FILE>

我需要:

  • 收入趋势(每日、每周、每月)
  • 表现最好与最差的产品
  • 客户购买频率分布
  • 平均订单金额变化趋势
  • 季节性规律
  • 5 个可立即执行的增长建议

生成包含所有图表的交互式 HTML 仪表板。”

研究数据分析示例:

“分析来自 500 名受访者的调查数据:

<SHOW_FILE>/path/to/survey.csv</SHOW_FILE>

研究问题:

  1. 年龄组与产品偏好之间是否存在显著关系?
  2. 满意度评分在不同区域是否有差异?(ANOVA)
  3. 哪些因素最能预测推荐意愿?(回归分析)

包括:统计检验、p 值、效应量、以及适合发表的图表。

输出为 PDF 报告格式。”


提升分析效果的小贴士

  1. 直接上传并提问:无需逐列描述。CellCog 会自动读取数据并识别内容。
  1. 明确你的问题:“什么导致流失?”比“分析这个数据”更聚焦。两者都有效,但前者响应更快。
  1. 说明受众对象:“给我的 CEO”意味着简洁摘要;“给数据团队”则需展示方法论。
  1. 说明用途:“我要向董事会汇报” vs “我要用于机器学习管道”——上下文决定输出风格。
  1. 不要过度指定方法:让 CellCog 自主选择合适的统计方法。重点在于你想了解什么,而非必须用哪个算法。
  1. 迭代推进:上传数据 → 获取初步分析 → 提出后续问题 → 深入挖掘。CellCog 会保持上下文连续性,支持多轮对话。

如果未安装 CellCog

运行 /cellcog-setup(或根据工具不同使用 /cellcog:cellcog-setup)进行安装与认证。

OpenClaw 用户:请运行 clawhub install cellcog

手动安装:执行 pip install -U cellcog 并设置 CELLCOG_API_KEY。详见 cellcog 技能的 SDK 参考文档。

N
@nitishgargiitd

已收录 4 个 Skill

相关推荐