你有多久没手动写过文档了?
OPENING · 开场
不是说你偷懒——而是现在的 AI Agent 越来越能干了。代码它帮你写,部署它帮你做,邮件它帮你回,日程它帮你安排。
但有个东西一直被卡着:Office 文件。
Word 文档、Excel 表格、PPT 演示——这些格式对 AI 来说一直是个黑盒。不是说完全不能碰:python-docx 能写、openpyxl 能读、python-pptx 能拼。问题是,每碰一种格式就要学一套 API,每次操作都是几十行代码起跳,写完了还得开 Office 才能看到效果到底对不对。
上周末我刷 GitHub,看到一个叫 OfficeCLI 的项目——8.4k Star,Apache 2.0 开源。读完 README 之后,我知道这个事值得写一写。
OfficeCLI 是什么?
OVERVIEW · 项目概览
一句话:OfficeCLI 是全球首个专为 AI Agent 设计的 Office 套件命令行工具。
它用一个单一的二进制文件,覆盖了 Word(.docx)、Excel(.xlsx)和 PowerPoint(.pptx) 三种格式的全部操作——读、写、改、查、渲染——而且不需要安装 Microsoft Office,也不依赖任何 Python 库。
把它扔给任何一个 AI Agent,Agent 就能像操作数据库一样操作 Office 文件。每个段落是一个路径,每个形状是一个节点,每个单元格是一个可寻址的位置。
核心能力一句话概括:单二进制零依赖、路径式元素寻址、全输出 JSON、内置渲染引擎(HTML/PNG)、150+ Excel 公式引擎写入即算、跨格式模板合并、内置 MCP 服务器。这些不是堆功能——每一条都是为了让 AI Agent 能「自己搞定」而设计的。
安装非常简单。Linux / macOS 一行:
CMDcurl -fsSL https://raw.githubusercontent.com/iOfficeAI/OfficeCLI/main/install.sh | bash
Windows 用 PowerShell:
CMDirm https://raw.githubusercontent.com/iOfficeAI/OfficeCLI/main/install.ps1 | iex
装完验证一下:
CMDofficecli --version
然后演示几个最实用的场景。
场景一:创建一个 PowerPoint 并添加内容
# 创建空白 PPT
officecli create report.pptx
# 添加一页幻灯片
officecli add report.pptx / --type slide --prop title="Q4 报告" --prop background=1A1A2E
# 在幻灯片上加一个文本框
officecli add report.pptx '/slide[1]' --type shape \
--prop text="营收增长 25%" --prop x=2cm --prop y=5cm \
--prop font=Arial --prop size=24 --prop color=FFFFFF
# 查看大纲
officecli view report.pptx outline
# → Slide 1: Q4 报告
# → Shape 1 [TextBox]: 营收增长 25%
# 渲染成 HTML 在浏览器里看
officecli view report.pptx html
场景二:实时预览——改代码、浏览器秒刷
这个是让我觉得最爽的功能。开一个终端跑 officecli watch,浏览器里就会有个实时渲染的预览页面。然后你在另一个终端里执行 add / set / remove,浏览器里瞬间更新。
# 终端一:启动实时预览
officecli watch deck.pptx
# 终端二:随便改,浏览器自动刷新
officecli add deck.pptx / --type slide --prop title="新页面"
officecli set deck.pptx '/slide[1]/shape[1]' --prop text="改一下"
这个「渲染 → 看 → 改」的循环,对 AI Agent 写 PPT 来说就是视觉反馈——Agent 不用盲猜排版效果了。
场景三:Excel 公式写入即算
# 创建一个 Excel,写两个数
officecli create budget.xlsx
officecli set budget.xlsx '/Sheet1/A1' --prop value=100
officecli set budget.xlsx '/Sheet1/A2' --prop value=200
# 写公式,读出来值已经算好了
officecli set budget.xlsx '/Sheet1/A3' --prop "value==SUM(A1:A2)"
officecli get budget.xlsx '/Sheet1/A3' --json
# 返回: {"attributes": {"value": 300}}
不需要打开 Excel 重新计算,150+ 函数写入即求值。
场景四:模板合并——一次设计,N 次填充
这是生产环境最实用的功能。AI 设计好模板(这是最贵的),后面填充数据可以走批处理(零 token 成本):
# 模板里有 {{client}} 和 {{total}} 两个占位符
officecli merge invoice-template.docx out-001.docx '{"client":"Acme","total":"$5,200"}'
四个场景跑下来,一个感受越来越清晰:这套 CLI 范式,和 Python 库那一套走的是完全不同的路。下面掰开说。

50 行 Python vs 一行命令
COMPARISON · 范式对决
大多数开发者第一次接触 Office 自动化,走的是 Python 路线——python-docx、openpyxl、python-pptx。这套路线能用,但有几个问题,尤其是对 AI Agent 场景来说:
1. 三套完全不同的 API
python-docx 操作段落用 add_paragraph(),openpyxl 操作单元格用 cell.value =,python-pptx 操作形状用 slide.shapes.add_textbox()。三个库三个心智模型。AI Agent 要在一次对话里切三次 API 风格——这本身就是 token 浪费和出错来源。
OfficeCLI 统一成一个范式:officecli <操作> <文件> <路径> --prop key=value。三种格式全是这一套。
2. 看不见效果
Python 库写完了,你得双击打开文件才能知道排版对不对、颜色合不合适、有没有溢出。AI Agent 没有「眼睛」,它只能读 DOM 结构,判断不了视觉效果。
OfficeCLI 内置了渲染引擎——view html 输出 HTML,view screenshot 输出 PNG。Agent 可以「看」到自己的产出,发现标题溢出、形状重叠,然后修正。
3. 没有自愈能力
Python 库报错通常是异常堆栈——对人类开发者能看懂,对 AI Agent 就是暴力试错的开始。
OfficeCLI 的错误信息是结构化的:
{
"error": "Slide 50 not found (total: 8)",
"code": "not_found",
"suggestion": "Valid Slide index range: 1-8"
}
Agent 读到 not_found + 建议范围,马上就知道怎么修正——不需要解析堆栈、不需要猜。
直接看对比
创建一个带标题和文本框的 PPT,Python 需要:
from pptx import Presentation
from pptx.util import Inches, Pt, Emu
from pptx.dml.color import RGBColor
prs = Presentation()
# 选空白版式
blank_layout = prs.slide_layouts[6]
slide = prs.slides.add_slide(blank_layout)
# 加标题
left = Inches(1)
top = Inches(1)
width = Inches(8)
height = Inches(1.5)
title_box = slide.shapes.add_textbox(left, top, width, height)
title_frame = title_box.text_frame
title_frame.text = "Q4 报告"
title_para = title_frame.paragraphs[0]
title_para.font.size = Pt(36)
title_para.font.bold = True
title_para.font.color.rgb = RGBColor(0xFF, 0xFF, 0xFF)
# 加内容
content_box = slide.shapes.add_textbox(Inches(1), Inches(3.5), Inches(8), Inches(2))
content_frame = content_box.text_frame
content_frame.text = "营收增长 25%"
content_para = content_frame.paragraphs[0]
content_para.font.size = Pt(24)
content_para.font.color.rgb = RGBColor(0xFF, 0xFF, 0xFF)
prs.save('deck.pptx')
OfficeCLI:
officecli create deck.pptx
officecli add deck.pptx / --type slide --prop title="Q4 报告" --prop background=1A1A2E
officecli add deck.pptx '/slide[1]' --type shape \
--prop text="营收增长 25%" --prop x=2cm --prop y=5cm \
--prop font=Arial --prop size=24 --prop color=FFFFFF
50 行 vs 3 行。而且 OfficeCLI 的版本 AI Agent 可以直接生成——因为它是一个 CLI 命令,不是一套 API。
这不是说 Python 库没用。在需要精细控制、复杂业务逻辑的场景,Python 仍然有优势。但如果你要让一个 AI Agent 帮你生成报告、整理表格、做 PPT——CLI 范式明显更适合 Agent 的工作方式。
下次你需要生成一份带格式的 Word 报告,或者一个带公式的 Excel 表格——别急着 import python-docx。先在终端敲一行 officecli create,看看你 30 秒能跑出什么。

在 Hermes Agent 中怎么用?
INTEGRATION · 集成指南
重点来了。在 Hermes Agent 中使用 OfficeCLI,有三种方式:
方式一:直接用 terminal 调用(最快上手)
OfficeCLI 是一个标准的命令行工具,Hermes Agent 的 terminal 工具可以直接执行:
用户:帮我用 OfficeCLI 创建一个 Q4 季度报告 PPT,包含三页:概览、数据、展望
Agent 会自己拼出命令序列并通过 terminal 执行。因为所有输出都是 JSON,Agent 可以在执行后立即解析结果、判断是否成功、失败时自行修正。
这个方式不需要任何配置——只要 officecli 在 PATH 里就行。
方式二:MCP 服务器集成(推荐)
OfficeCLI 内置了 MCP 服务器,可以通过 JSON-RPC 暴露所有文档操作。这是为 AI Agent 深度集成设计的方式:
# 先把 Hermes Agent 支持的 MCP 路径注册好
# 然后启动 MCP 服务器
officecli mcp start
注册后,Agent 会获得一系列结构化的 office 操作工具,而不是原始命令行。参数校验、错误处理、类型提示都由 MCP 层接管。
不过,Hermes Agent 当前的 MCP 注册流程需要手动配置。在 Hermes 的配置中添加 OfficeCLI 的 MCP 服务器信息后,Agent 就能像调用内置工具一样操作 Office 文件。
方式三:写一个 Hermes Skill(最优雅)
把 OfficeCLI 的常用工作流封装成一个 Skill,放到 ~/.hermes/skills/ 下。这个 Skill 定义好常用场景的命令模板,Agent 加载后直接调用。
比如创建一个「生成季度报告」的 Skill,里面预置了 PPT 模板结构、Excel 数据表模板、Word 报告模板。用户说「生成 Q4 报告」,Agent 直接跑模板 + 填充数据,几秒出结果。
具体的 Skill 模板这里不展开了,有需要的可以自己参考 OfficeCLI 官方的 SKILL.md(curl -fsSL https://officecli.ai/SKILL.md)。
一个真实场景演示
假设我对 Hermes Agent 说:「帮我建一个项目进度追踪 Excel,包含任务名称、负责人、截止日期、状态四列,再加一个统计完成的公式。」
Agent 会这样干:
1officecli create progress.xlsx
5officecli view progress.xlsx text 确认结果
全程不需要我碰 Excel。
OfficeCLI 不是一个孤立的工具。它的出现,和另外几个趋势放在一起看,指向了同一个方向:
AI Agent 的工具链正在从「库调用」范式转向「CLI + 协议」范式。
Claude Code 的 claude CLI、OpenAI Codex 的终端模式、OfficeCLI 的 CLI-first 设计——这些不是巧合。当 AI Agent 成为主要用户,工具的设计标准变成了:
一条命令能完成
不要用 50 行库调用——Agent 生成 CLI 命令的准确率远高于生成多行库调用代码
输出必须是结构化 JSON
不是给人看的文本,而是机器可解析的结构——Agent 不需要正则抓 stdout
必须有自愈能力
错误信息要告诉 Agent「下一步怎么做」,而不是丢一个堆栈让它猜
必须有可视化反馈
Agent 需要能「看到」自己的产出——渲染引擎不是装饰,是闭环的一部分
python-docx 不是被淘汰了,但它确实不是为 AI Agent 设计的。 它的 API 是为人类开发者设计的——需要查文档、理解对象模型、记住方法签名。这些对 Agent 来说都是阻力。
而 OfficeCLI 做对了一件事:它把 Agent 当作一等用户,而不是把人类工具强塞给 Agent。
这个思路——工具为 Agent 而设计,不是让 Agent 去适应工具——会在未来两年渗透到每一个开发者工具领域。
装不装,一句话:如果你经常让 AI 处理 Office 文档,现在 curl -fsSL https://raw.githubusercontent.com/iOfficeAI/OfficeCLI/main/install.sh | bash 一行搞定。用 Hermes Agent 的直接 terminal 调,想深度的封装成 Skill 或接 MCP——零配置到深度集成,三条路都能走通。
当工具开始为 AI Agent 重新设计,那些为人类开发者优化的工具,可能比我们以为的更快过时。
既然看到这里了,如果觉得有用,随手点个赞、在看、转发三连吧。