102 万字语料喂出来的公文 Skill:两个仓库,一个管写一个管排

刷 B 站刷到一个两分多钟的视频,UP 主「资源汇社区」在推两个刚开源的公文类 Skill。视频节奏很快,核心就三步:复制 GitHub 地址、发给 Agent 说”帮我装”、点技能按钮然后提要求。

我把它提到的两个仓库从头到尾读了一遍,顺手核了几处数字。有些东西视频里没讲,但对真要拿去干活的人挺关键——尤其是许可证那一条。

先把两个项目摆出来,它俩不是一回事:

仓库一仓库二
项目lieflat-gongwengongwen-gbt9704-skill
干什么写材料排版式
产出符合特定文种风格的正文稿符合国标的可编辑 DOCX
许可PolyForm Noncommercial 1.0.0MIT
Star1258747

(Star 为 2026 年 10 月 4 日查询值,会变)


一、管写的那个:把公文风格变成可测量的数据

lieflat-gongwen 这个项目最抓人的地方是它的方法——不给你模板,给你统计。

作者拿了 102 万字真实公文做全量统计,把”像不像公文”拆成了一组可测量的参数,蒸馏出七类文体的写作指纹:

  • 公文族六类:调研报告、领导讲话、工作意见、经验材料、工作方案、经验总结
  • 党建族一类:千字级党建/基层经验材料

它明确写了不做哪些——通知、请示、批复、函这类有固定模板的法定公文它不碰。理由很实在:这类文体的正文结构已经定死了,风格不需要靠统计去反推。

统计出来的结论里,有几条跟我的直觉是反的:

常见认知全量数据
公文开头都用”根据……””为……”依据式只占 6%–8%,无单一主导写法
结尾必须用”请遵照执行”75%–87% 是自然收束,程式化结语出现率不足 2%
好公文要有数据支撑60%–72% 完全不用百分比(经验总结 100% 零百分比)
一级标题应简短标示内容分析类文件标题平均 17 字,承载观点;短标题只属于业务类

真正稳定的共性在语言层:平均句长 53–56 字(自媒体的两到三倍)、长句占比近一半、顿号密度每千字 14–31 个。公文的骨架是靠”A、B、C、D”式并列枚举撑起来的。

它的工作流是六步,其中第三步——读同文种的 DNA 文档和范文——作者标了”不可跳过”。而自检脚本只把一种情况判为错误:文种识别错了,比如给工作方案写出了调研报告的层级结构。其余参数偏离只作提示,不拿均值当合格线。作者的原话是:”好文章不整齐,整齐的往往是平庸作品。”

这一点我觉得挺难得。大多数写作类工具在追求”标准答案”,它反而主动放弃了这条线。


二、管排的那个:按 GB/T 9704-2012 出可编辑 DOCX

gongwen-gbt9704-skill 解决的是另一个痛点:AI 写完一堆内容,格式还得人再排一遍。

它按 GB/T 9704-2012(党政机关公文格式国家标准)生成 DOCX,管的事情很具体:版心尺寸、字体、标题层级、发文字号、页码、附件、版记。

几个我认为专业的地方:

其一,红头不乱用。 默认是普通稿(ordinary),不会因为检测到机构名称就自动上红头。要正式发文必须显式指定 formal,而且默认走预印红头纸套打——首面留白,不重绘红头和红线;只有加 --letterhead digital 才在文档里画完整电子红头。这个设计是对的,红头纸是纸上的东西,不是 Word 里的。

其二,文号会校验。 正式版式会拒绝明显不符合年份、六角括号、顺序号和”号”字规则的文号,而不是照单全收。

其三,标题写进样式。 四级标题会写进 Word/WPS 的标题样式和大纲级别,在 Word 里可以用”引用→目录”直接生成并更新。

其四,字体不装会警告。 红头和标题要用目标电脑上实际安装的小标宋体,缺字体时终端会明确警告并写出替代字体——如果加 --require-standard-fonts,宁可失败也不替代。

标准本身的状态我也核了一下:GB/T 9704-2012 现行有效,2025 年 5 月 30 日复审结论是继续有效。


三、视频里没讲的五处细节

1. 两个项目的许可证不是一回事,这条最要紧。

项目许可证意味着什么
lieflat-gongwenPolyForm Noncommercial 1.0.0仅限非商业使用;不得用于付费写作或咨询服务,不得集成进商业产品或服务
gongwen-gbt9704-skillMIT可商用,保留版权声明即可

写作 skill 的作者在 README 里写得很直白:”这是一个源代码可见、非商业使用的项目,不是 OSI 意义上的开放源代码软件。”个人研究、学习、教育机构、公共研究机构和政府机构属于允许范围;商业使用要先联系作者拿单独授权。

如果你打算拿它去做付费代写、投标文书服务或者嵌进自己的产品里,先看这一条。

2. 积分说法前后对不上。 视频口播说的是”每天有 5000 积分”,而同一视频的简介文字写的是”每日白嫖 2000 万积分”。两个数字差了四个数量级,我没有实测,以官方页面为准。别因为视频里那句就以为够用或不够用。

3. 写作 skill 的语料不随包分发。 102 万字原文因版权问题全部移除了,频率数值第三方没法直接复核——这是作者自己承认的实质缺陷。另外工作方案(10 篇)、经验总结(8 篇)样本偏薄,参数仅供参考。作者也写了:”参数解决’像不像’,管不了’对不对’。”

4. 排版 skill 依赖本机字体。 小标宋体、仿宋缺失会触发替代,打印或跨环境打开时字号、行距、换行都可能变样。正式交付前必须在目标机器上核。

5. 涉密这条是硬的。 排版项目的 README 开头就挂着信息安全提醒:不要往未获授权的在线模型、第三方服务或公共仓库上传企业内部、涉密、敏感或明确禁止对外的文件。条件允许的话,把 Skill 部署在本地或企业内网环境里跑。


四、怎么装

排版 skill 用的是标准 SKILL.md 目录结构,官方列出的支持平台包括:Codex、Claude Code、OpenCode、Trae Code、Trae CLI、Kimi Code CLI、Kimi Code、TraeWork、WorkBuddy、ZCode——同一份规则,不用在七八个目录里各改一遍。

另外它给 WorkBuddy 准备了一个现成的上传包 dist/workbuddy-gongwen-skill-v2.0.0.zip,约 1.2 MB,低于平台 3 MB 的限制。

生成和校验是分开的两条命令,校验器能独立检查生成结果,这点比”生成完说一句已完成”靠谱:

写作 skill 更简单,把整个目录放进 Agent 的 skills 目录就行:


五、我的判断

这两件事本来就该分开。 写作是”内容像不像”,排版是”版式对不对”,硬塞进一个工具里,往往两头都做不好。两个独立项目各管一段,中间用一份 Markdown 交接,反而清爽。

值得留意的不是”AI 能写公文了”,而是它开始用统计指标说话。 句长 53 字、顿号密度 14–31‰、程式化结尾不足 2%——这些数字未必每条都讨喜,但至少是可以被验证、被反驳的。这比一堆”公文写作十大技巧”要实在。

但边界也很清楚。 参数管的是像不像,管不了对不对。政治表述是否得体、数据是否站得住、是否该对外公开——这些没有哪套参数能替你验收。工具能省掉的是排版和语句的重复劳动,省不掉核稿人那一道。


信息来源

原创文章,作者:蓝洛水深,如若转载,请注明出处:https://blog.lanluo.cn/13509

Like (0)
蓝洛水深的头像蓝洛水深管理员
杜酱酒在京东上自己刷的好评,有点看不下去
Previous 2026年8月4日 下午2:51
视频: 踏入这个秋季 【百花湖】
Next 2015年10月28日 下午6:06

相关推荐

发表回复

Please Login to Comment
联系QQ
联系QQ
SHARE
TOP