一键将 PDF/DOC/DOCX/PPTX 转换为 Markdown,支持中文编码与 OpenClaw 深度集成,适合文档批量处理与内容分析。
说明:
## 核心用法
Office to Markdown Converter Skill 是一款专注于办公文档格式转换的 OpenClaw 技能,支持 PDF、DOC、DOCX、PPTX 四种主流格式转 Markdown。用户可通过 `exec` 直接调用、wrapper 函数集成或完整封装三种方式使用,输出结构化结果包含字数统计、预览片段及文件元数据。
## 显著优点
1. **格式覆盖全面**:独家支持 legacy .doc 格式(via word-extractor),解决旧文档迁移痛点
2. **中文友好**:word-extractor 内置中文编码处理,避免乱码问题
3. **OpenClaw 原生集成**:提供完整的 JavaScript API 与错误处理范式,支持批量转换与链式分析
4. **开源生态**:依赖均为 MIT/BSD 许可,无商业限制
5. **可观测性**:内置 DEBUG 模式、分级超时策略与内存调优指南
## 潜在局限
– **非内容丢失**:不提取图片、复杂表格转换 imperfect、密码保护文档直接失败
– **性能瓶颈**:PPTX 依赖 Python 子进程,大文件处理较慢;DOC 需二进制解析,速度中等
– **环境依赖**:Node.js + npm 必需,PPTX 需额外 Python3 环境
– **单文件处理**:无原生多线程/流式处理,批量场景需自行实现循环
## 适合人群
– **RAG/知识库构建者**:需要将历史文档统一为 Markdown 入库
– **OpenClaw 自动化用户**:需在 Agent 工作流中嵌入文档解析节点
– **遗留系统迁移**:需处理大量 .doc 格式旧档案的技术团队
– **合规审计场景**:需提取文档纯文本进行敏感信息扫描
## 常规风险
– **执行安全**:依赖 `exec` 权限,需确保输入文件路径可信,防止命令注入
– **资源消耗**:大文件可能触发超时或内存溢出,需按文档配置分级策略
– **编码边缘 case**:极少数非标准编码 .doc 仍可能乱码,建议关键文档先转 .docx









