AI 公文智能优化助手
开源链接:GitHub - linhut/document-ai-assistant
基于国家标准 GB/T 9704 的公文格式智能检测与修复 —— 应用本地化、数据本地化、多模型选换。
项目简介
在日常的公文写作和审核工作中,我发现绝大多数人(包括我自己)写出来的公文格式多多少少都有不规范的地方——字号不对、行距偏差、标题层级混乱、页码格式错误等等的这些问题,单个看起来不起眼,但积少成多,严重影响公文的严肃性和专业性。人工逐项对照标准去检查,效率极低且容易遗漏。
本项目基于 GB/T 9704-2012《党政机关公文格式》国家标准,开发了一套本地运行的桌面应用,只需上传 .docx 公文文件,系统自动完成格式检测、问题定位和一键修复,全程数据不离开本机。同时集成了 AI 能力,支持对公文内容进行智能润色和优化建议。
核心痛点
经过大量实际使用感受,在日常文档类工作中总结出最头疼的四个问题:
- 格式规范记忆困难:GB/T 9704 标准涉及字体、字号、行距、页边距、标题层级、页码、版记等很多的细则,普通人根本记不全,每次都要找模板对照,效率极低。
- 人工审核效率低下:一份文档动辄十几页,逐段逐句对照格式标准人工审核,耗时耗力且容易遗漏,尤其是正文中的小标题层级、附件标注、抄送格式等细节。
- 修改成本高:发现格式问题后,手动修改 Word 文档经常牵一发动全身——改了标题字号,行距又不对了;调了页边距,页码位置又偏了。反反复复调整,一份公文能改半小时。
- AI 辅助不好用:虽然市面上有很多 AI 写作工具,但针对公文格式规范的工具很少,准确率也低,而且大多需要收费,生成的内容格式依然不合规。
解决方案
针对以上痛点,我构思设计了一套全链路自动化的解决方案:
1. GB/T 9704 全标准规则引擎
预置完整的国标格式检测规则,覆盖公文处理全流程:
- 版头检测:份号、密级、紧急程度、发文机关标志、发文字号、签发人等
- 主体检测:标题格式(二号小标宋)、主送机关、正文字号(三号仿宋)、行距(28.95 磅固定值)、各级小标题等
- 版记检测:抄送机关、印发机关、印发日期的格式和位置
- 页面设置:上边距 37mm、下边距 35mm、左边距 28mm、右边距 26mm、页码格式(— X —)
以上所有规则以 YAML 配置,支持三级优先级覆盖:官方标准 < 自定义规范 < 用户偏好,灵活适配不同单位的个性化要求。
2. 八大公文文种专项适配
针对不同类型公文的格式差异进行专项处理:通知、请示、报告、函、会议纪要、决定、通告、公告。
- 每种文种有独立的格式校验规则和模板
- 自动识别文种类型,应用对应的检测规则
- 支持上行文(请示/报告)和平行文(函)的格式差异
3. AI 多模型可选换
集成 AI 能力对公文内容进行智能优化:
- 插件化设计:支持多家主流模型,切换零成本
- 内容润色:AI 辅助优化公文措辞、语句通顺度、逻辑连贯性
- 隐私安全:API Key 使用 Fernet 加密本地存储,所有文件处理在本地完成,不依赖网络
4. 一键检测 + 一键修复
极简操作流程,降低使用门槛:
- 上传
.docx→ 自动解析文档结构 - 规则引擎全量检测 → 生成问题报告
- 一键修复所有问题 → 导出规范文档
技术分层:
- 解析层:
python-docx深度解析文档 XML 结构,提取每个段落的完整样式信息 - 检测层:
RuleEngine对 DocumentModel 执行全量规则检查,按优先级排序输出问题列表 - 修复层:
RuleEngine.check_and_fix()一键修复所有可自动修复的问题 - 输出层:
generator.generate_docx()生成符合标准的新文档,保持原文内容不变
下一步更新计划
- 程序将支持国产系统环境,可在信创环境打开软件使用相关功能
- 程序将对公文红头多样式规则进行补充
- 优化在线 A4 文档编辑使用体验
本文最初发布于 LINUX DO。