TTokenySpace
返回 Skills 列表

Data Analyst Expert Free

面向100MB以内单文件数据分析任务,支持上传文件读取、基于pandas执行分析代码并结构化输出结论与建议。

#中文
0

安装到 Tokeny(自动)

下载 ZIP
安装"data-analyst-expert-free"技能
技能信息:
- 名称: Data Analyst Expert Free
- 标识: data-analyst-expert-free
- 描述: 面向100MB以内单文件数据分析任务,支持上传文件读取、基于pandas执行分析代码并结构化输出结论与建议。
- 版本: 1.0.0
下载地址:
https://www.tokeny.space/api/skills/data-analyst-expert-free/download
继续

复制上方内容到 Tokeny 客户端并在会话中发送即可自动安装;也可直接 下载 ZIP并拖动到技能窗口安装。

SKILL.md

数据分析专家 免费版

一、概述

数据分析专家免费版面向需要把数据分析任务"委派"给 AI Agent 完成的用户。Agent 接收自然语言描述的分析任务,在工作目录中读取上传的文件,执行数据分析代码,并以结构化方式输出结论。

免费版聚焦单文件、单任务的委派场景,适合 100MB 以内的数据文件与单次分析任务。

核心能力

2.1 任务理解框架

接收任务后,Agent 自动解析以下要素:

要素说明示例
分析对象数据来自哪里sales.csv
分析目标想得到什么结论"找出销售额下滑的品类"
分析方法用什么方法描述统计 / 相关分析 / 时序分解
输出形态产出什么图表 / 报告 / 结论卡片

输入: 用户提供1 任务理解框架所需的指令和必要参数。 处理: 解析1 任务理解框架的输入参数,完成核心逻辑,返回结构化响应。 输出: 返回1 任务理解框架的响应数据,包含状态码、结果和日志。

2.2 文件操作规范

  • 上传文件自动放置在工作目录 ./
  • 代码中直接用文件名访问:open('data.csv', 'r') / pd.read_csv('sales.csv')
  • 禁止使用绝对路径或上级目录引用,避免路径错误
  • 多文件任务需在 upload_files 参数中列出所有相关文件

输入: 用户提供2 文件操作规范所需的指令和必要参数。 处理: 解析2 文件操作规范的输入参数,完成核心逻辑,返回结构化响应。 输出: 返回2 文件操作规范的响应数据,包含状态码、结果和日志。

2.3 代码执行驱动

  • 默认基于 pandas + numpy 完成数据计算
  • 可视化基于 matplotlib + seaborn,中文字体预置
  • 计算结果自动捕获并以 Markdown 表格/代码块呈现

输入: 用户提供3 代码执行驱动所需的指令和必要参数。 处理: 解析3 代码执行驱动的输入参数,完成核心逻辑,返回结构化响应。 输出: 返回3 代码执行驱动的响应数据,包含状态码、结果和日志。

2.4 结论结构化输出

三段式结构化结论,确保每次分析都有"可执行洞察":

输入格式

参数名类型必填说明
inputstring数据分析专家(免费版)处理的输入数据或指令
optionsobject附加配置选项,如模式选择、格式偏好等
callback_urlstring异步处理完成后的回调通知URL
# ...
**输入**: 用户提供4 结论结构化输出所需的指令和必要参数。
**处理**: 解析4 结论结构化输出的输入参数,完成核心逻辑,返回结构化响应。
**输出**: 返回4 结论结构化输出的响应数据,包含状态码、结果和日志。
**能力覆盖范围**:本skill的核心能力覆盖以下场景关键词:面向委派任务的数、据分析助手、支持文件操作、代码执行与结论结、构化输出的免费核、心能力、数据分析专家免费、版面向需要把数据、分析任务、完成的用户、提供任务理解、文件读写、构化输出的核心能、核心能力、自然语言任务理解、分析什么、等库完成实际计算、数据概览、关键发现、业务建议三段式结、模板变量替换、DATE、SESSION、GROUP、等运行时变量等。这些关键词对应description中声明的使用场景,均已在上述能力点中提供对应的操作支持。
- 执行此能力时使用`input_params`参数,支持创建/查询/导出操作
# ...
## 数据概览
- 数据量: X 行 × Y 列
- 时间范围: ...
- 数据质量: 缺失/重复/异常情况
# ...
## 关键发现
1. 发现1(附数据支撑)
2. 发现2(附数据支撑)
3. 发现3(附数据支撑)
# ...
## 业务建议
1. 短期建议(本周可执行)
2. 中期建议(本月可执行)
3. 长期建议(本季度可执行)

2.5 模板变量替换

支持运行时模板变量自动替换:

变量含义替换时机
$DATE$当前日期任务执行时
$SESSION_GROUP_ID$会话组标识任务执行时
$USER$当前用户任务执行时
$WORKDIR$工作目录任务执行时

适用场景

角色典型场景输入输出
业务人员销售数据周度复盘sales.csv + "找下滑品类"结论卡片 + 改进建议
运营专员活动效果评估events.xlsx + "评估转化"对比图 + ROI 计算
个人开发者日志数据分析logs.json + "找异常模式"异常清单 + 频次表
学生/研究者调研问卷分析survey.csv + "做描述统计"描述表 + 分布图

不适用场景

以下场景数据分析专家(免费版)不适合处理:

  • 实时流数据处理
  • 小规模数据手动分析
  • 非结构化文本情感分析

触发条件

需要数据分析、报表生成、统计洞察、数据可视化时使用。不适用于非本工具能力范围的需求。

使用流程

预计上手时间:< 60 秒

4.1 上传文件并描述任务

[上传 sales.csv]
# ...
请分析这份销售数据:
- 时间范围: 2024 年全量
- 关注问题: 哪些品类销售额同比下滑?
- 输出: 下滑品类清单 + 原因假设 + 改进建议

4.2 Agent 内部处理流程

1. 解析任务:对象=sales.csv,目标=找下滑品类,方法=同比对比
2. 读取文件:pd.read_csv('sales.csv')
3. 数据清洗:类型转换、缺失处理
4. 计算同比:groupby 品类 + 同比百分比
5. 生成结论:三段式结构化输出
6. 输出建议:短期/中期/长期

示例

[上传 sales.csv, products.csv, regions.csv]
# ...
请关联三份文件分析:
- sales.csv: 销售明细
- products.csv: 商品主数据(含品类)
- regions.csv: 区域主数据(含大区)
- 输出: 各大区各品类销售额交叉表 + 热力图

五、配置示例

5.1 文件访问最佳实践

# 正确:直接用文件名访问
import pandas as pd
df = pd.read_csv('sales.csv')
# ...
# 错误:绝对路径或上级目录
# df = pd.read_csv('/uploads/sales.csv')  # 禁止
# df = pd.read_csv('../data/sales.csv')   # 禁止

5.2 任务模板

[任务] {分析目标}
[数据] {文件名}
[方法] {建议方法,可选}
[输出] {期望形态,如:图表 + 表格 + 文字结论}
[约束] {时间范围、维度限制等}

5.3 多文件关联示例

# 多文件关联分析
sales = pd.read_csv('sales.csv')
products = pd.read_csv('products.csv')
regions = pd.read_csv('regions.csv')
# ...
df = sales.merge(products, on='product_id', how='left') \
          .merge(regions, on='region_id', how='left')
# ...
pivot = df.pivot_table(
    index='region_name',
    columns='category',
    values='amount',
    aggfunc='sum',
    fill_value=0
)

六、最佳实践

  • 任务描述明确:说清"分析什么、用什么方法、产出什么"
  • 文件清单完整:多文件任务务必在 upload_files 列出全部文件
  • 直接用文件名:代码中不要写绝对路径或上级目录
  • 预期管理:小数据集(<100MB)用免费版,大数据集用专业版
  • 结论三段化:每次分析输出"数据概览 → 关键发现 → 业务建议"
  • 结果复核:Agent 给出的结论需结合业务直觉复核

常见问题

Q1: 文件上传后存放在哪里?

A: 文件自动放置在 Agent 的工作目录 ./ 下,代码中直接用文件名访问即可,如 pd.read_csv('sales.csv')

Q2: 免费版支持多大的文件?

A: 推荐用于 100MB 以内的文件。更大文件建议使用专业版的流式读取与分块处理。

Q3: 多个文件如何关联?

A: 在 upload_files 参数中列出所有文件,Agent 会自动识别关联字段并执行 join 操作。

Q4: 为什么强调"直接用文件名"?

A: 因为上传文件会被放置在工作目录,使用绝对路径或上级目录引用会导致路径错误,是新手最常见的坑。

Q5: 模板变量什么时候替换?

A: 模板变量(如 $DATE$)在任务执行时由运行时自动替换为实际值,用户无需手动处理。

已知限制

本免费体验版限制以下高级功能:

  • 禁用大数据集(>100MB)流式处理
  • 禁用多任务编排与依赖管理
  • 禁用结果缓存与复用
  • 禁用定时任务与自动化分发
  • 禁用自定义输出模板与品牌化
  • 禁用与企业数据库(如 PostgreSQL)集成

解锁全部功能请使用专业版:data-analyst-expert-pro

  • 当前为免费版本,如需完整功能请升级到付费版获取全部能力

依赖说明

运行环境

  • Agent 平台: 任意支持 SKILL.md 与文件上传的 AI Agent(Claude Code / Cursor / Codex / Gemini CLI 等)
  • 操作系统: Windows / macOS / Linux
  • Python: 3.8+(代码执行需要)

第三方依赖

依赖项类型是否必需获取方式
LLM APIAPI必需由 Agent 内置 LLM 提供
pandasPython 库必需pip install pandas
numpyPython 库必需pip install numpy
matplotlibPython 库可选pip install matplotlib(可视化)
openpyxlPython 库可选pip install openpyxl(Excel)

API Key 配置

  • 本 Skill 基于自然语言指令,无需额外 API Key
  • 如对接外部 API,需用户自行提供访问凭证,通过环境变量传入,禁止在对话或脚本中明文硬编码

可用性分类

  • 分类: MD+EXEC(纯 Markdown 指令,核心功能需要 exec 命令行执行能力)
  • 说明: 基于自然语言驱动的 AI Skill,通过文件操作规范与结论结构化输出保障委派任务质量

错误处理

错误场景原因处理方式
配置错误参数缺失或格式错误检查依赖说明中的配置要求
运行时错误运行环境不满足确认运行环境符合依赖说明
网络错误连接超时或不可达执行ping命令测试网络连通性,检查防火墙和代理设置连接后执行ping命令测试网络连通性,检查防火墙和代理设置连接后重新执行命令,参考国内替代方案

输出格式

{
  "success": true,
  "data": {
    "result": "数据分析专家(免费版)处理结果",
    "execution_time": "0.5s",
    "metadata": {
      "version": "1.0",
      "processor": "data analyst expert"
    }
  },
  "execution_log": ["解析输入参数", "执行核心处理", "格式化输出结果"],
  "error": null
}

评论

加载中…