DT-Bot 是面向本地数据仓库的 AI 工作流:载入磁盘上的 CSV / XLSX 原始表,自动拆成原子表单(单表单文件),再按描述完成表头整理、清洗、合并与拆分,入库后做 SQL 统计,最后导出报表。
尤其适合:表多、杂乱、规则多,清洗复杂且每天还要重复做一遍的数仓场景。
全程零 Python、零 SQL——用自然语言描述要做什么即可,零基础都可上手。同时支持千万量级表格处理、每天可定时执行;数据侧也更安心:AI 只接触第一行表头与提示词,明细数据全程留在本地,不外传。
目前免费体验!目前免费体验!目前免费体验!
DT-Bot 工作流目前一共 14 个智能体节点,真正承担核心处理的其实只有 7 个。节点虽少,但足以覆盖常见的数据清洗与统计场景——我们主打的就是:零基础使用简单。
下图左边为配置工作流时的节点预览图:
1. 载入表格
从磁盘读取数仓里面的所有表(CSV/XLSX),并自动解析文件中的全部表单输出给下游节点。
只有一个提示词参数需要设置,如下图:
上图配置了3个任务步骤,支持全部执行。提示词其实自己随便描述,能听懂意思就行了。
“载入表格” 同时支持三种常用取表方式:
① 获取整个文件
例如:
获取 “D:\商品数仓\商品主档_多渠道.xlsx”获取 “D:\商品数仓\01_原始数据” 下所有 xlsx
② 获取指定表单
适合:只要某一个业务 sheet,不想把无关表单带进流程。
例如:
获取“D:\商品主档_多渠道.xlsx” 的“京东自营”表单
③ 获取某个表单的单元格切片范围
例如:
载入 “D:\商品数仓清洗\商品主档.xlsx” 的“天猫旗舰店”表单的 A1:G20 区域,输出“天猫订单”载入 “D:\data\sales.csv” 的 A1:D 区域,输出“销售明细”
载入完成后,DT-Bot 会把结果整理成若干单表单文件输出。后续节点都基于这些文件继续加工,最后再入库成表,供统计汇总与报表使用。
注意: 所有操作都是通过 “文件名称”来进行引用的。
2. 表头整理
专门处理表格第一行表头:支持重命名、新增、补全列名。支持描述多步骤,用文件名称来引用。
提示词支持下面3种方式:
① 重命名 / 字段映射
“天猫订单”表修改表头:单据编号 → 订单号成交日期 → 下单日期门店 → 门店名称SKU → 商品编码“京东订单”表修改表头:单据编号 → 订单号成交日期 → 下单日期门店 → 门店名称SKU → 商品编码
② 调整顺序
“天猫订单”调整表头顺序:商品编码,商品名称,类目,售价,在售状态,品牌,条码,渠道来源,所属大区,供货商
③ 新增表头
“天猫订单”表,新增表头:按顺序命名为“列1,列2,列3……”一直到“列60”“天猫订单”表,新增表头:商品编码,商品名称,类目,售价,在售状态,品牌,条码
3. 表格合并
表格合并非常强大,支持多步骤描述,能支持“上下拼接、左右连接、按行号横拼”, 左右连接时,还支持自动匹配字段。也只有提示词参数。
① 上下拼接(多表合成一张长表)
适合:结构已对齐,只是按地区、按月份拆成了多份文件。当列参差不齐时,也能自动匹配合并。
1. 将以“天猫销售_” 开头的表进行 合并,输出“天猫12月总销售”2. 将所有文件进行合并,输出“天猫总销售”3. 将“天猫销售_1”,“天猫销售_2”进行合并,输出“天猫12月总销售”
② 左右连接
适合:一张是明细,一张是主档/维表,要用编码把信息补进来。
## 多表连接合并 , 智能匹配关联字段1. “订单”关联“商品”,“客户”,合并,输出“订单宽表”## 左连接合并2. 以“订单明细”为主表,根据客户编号从客户信息表中左连接,补上客户名称、联系电话。## 右连接合并3. 以“客户信息”为主表,根据客户编号从订单明细中右连接,补上订单金额、下单日期;没有订单的客户也要保留。## 内连接合并4. 把“销售流水”和“商品主档”按商品编码做内连接,只保留两边都能匹配上的行,并带上商品名称、品类。## 全连接5. 把门店库存表和退货明细按 SKU 做全连接,两边数据都保留,对不上的字段留空。
③ 按行号左右横拼
适合:两张表行数对应、需要并排对照(较少用于数仓入仓,多用于核对)。
门店A、门店B,按行号左右拼在一起,方便对照查看。
4. 内容清洗
支持多步骤描述,内置python+sql引擎,对行,列进行任意整理,十分强大。
“天猫销售表”清洗:1. 删除“客户名称”列中的“有限公司”后,再删除前后空格。2. 将“在职状态”中的“已离岗”替换成“离职”后,再将“在岗”替换成“在职”。3. 把 “登记日期” 列(格式:2024/09/12)提取出季度。4. 从“商品规格”中先提取容量信息后,再提取包装数量。5. 把 “折扣” 列统一转成两位小数。6. 把 “完成时间”(格式:“2024年9月14日”) 和 “开始时间” (格式:“2024年9月14日”) 计算相差天数。7. 把 “手机号” 列为空的,用同一行的 “联系方式” 列补。“客户表”清洗:1. 删除“备注”,“手机号”列。2. 新增一列“工资合计”,结果等于“基本工资”加上“岗位工资”。3. 将“开户地址”列按空格拆分成“省”“市”“区”三列,原始“开户地址”列要保留。4. 删除“基本工资”小于 5000 的员工记录。5. 只保留“入职日期”在 2025-01-01 之后的记录。6. 先按“部门”升序,再按“基本工资”降序排序。7. 按“用户姓名”和“身份证后四位”组合去重。8. 筛选出“手机号”重复的记录。
清洗完生成的表名就是清洗之前的表名。后续就可以进行入库成表了。5. 数据入库
数据入库无任何参数配置,就是将上一个节点的所有输出文件进行入库。表名就是文件名,会在本地开启duckdb磁盘数据库。
最大的亮点: 你不用指定表字段类型,内部会智能的检索表字段类型,自动完成建表。
6. 表sql统计
通过提示词描述,进行sql统计。全程不用你懂任何sql技术。
支持的能力: 包括横向拼表(JOIN)、上下拼接(UNION)、条件筛选、排序、跨表汇总计算、分组聚合、窗口函数等。简单来说,懂 SQL 的人都知道——SQL 能做的,它都能做。
比如下面统计描述:
1. 帮我看一下整体的订单量、退款订单量、退款率和退款总金额。2. 按店铺名称分组,看看每个店铺的订单总数、退款订单数、退款率和退款总金额。3. 按退款原因分组,分析不同退款原因分别有多少退款订单、退款金额是多少。4. 按月份看订单量、退款量和退款金额的变化趋势。5. 统计一下哪些订单金额异常,比如小于 0 或等于 0 的订单有多少,这些异常订单里退款情况怎么样。6. 帮我找出退款金额最高的前 10 笔退款记录,看看都是什么订单、什么商品、什么退款原因。
上面统计根本就没有描述基于哪些表进行统计,内部会在当前数据库中进行智能选表,所以表名,字段名一定要有业务意义。
也可以指定哪些表进行统计描述:
1. 基于“订单明细”表,筛选出下单日期在2024年且订单金额 > 100 的记录,然后按“城市”汇总,输出每个城市的订单数、总金额、平均金额,并按总金额从高到低排序。
7. 报表导出
这个就是选中数据库任意表进行导出csv/xlsx/html 。
表名称
每一个节点输出的表名称很重要,后续节点要引用表,都只能通过名称来引用, 描述时,最好加上双引号:“表名称”。
节点可监控,可调试
工作流配置完成后,可以对每个节点进行调试,以便发现问题。
每一个节点的执行都能看到节点产生的结果数据,方便定位。
定时执行
可以设置每天几点执行工作流,睡觉时,数据也在跑。
环境变量
工作流一旦搭好,最怕的是「换个目录、换个月份就要改遍所有节点提示词」。
为此 DT-Bot 提供了提示词环境变量:在提示词里用占位符写可变部分,真正跑起来时再统一替换。
怎么用
在任意智能体提示词中写入:
例如:
载入 “${{FILE_NAME}}\01_原始数据” 下所有 xlsx把华东与华南销售流水上下合并,输出文件名称:${{FILE_OUT}}
启动工作流时,系统会读取环境变量表,把全部节点提示词里的 ${{变量名}} 替换成对应值,再开始执行。
在工作流主界面右键就可以唤起环境变量设置。
如果你是数据岗,每天都要处理大量杂乱表格、重复做清洗,可以跟着本教程动手试一下。后续还会更新更多业务案例,以及各智能体节点的详细使用说明。