宇格科技-坦途
通读了整包(单文件SKILL.md约4.6K字)。这是一份有真实生产级陪跑经验的咨询提示词,不是普通知识库问答模板。亮点有三:一是五层能力模型(理解→查询→判断→执行→负责)把「AI客服」从Demo到生产的差距拆得很准,尤其「负责」层明确哪些必须交给人;二是诚实的成本观——明确指出Copilot蜜月期是双重成本、AI可能比人工更贵,拐点在取消逐条审核与排班调整,这比市面上只算Token的方案靠谱得多;三是反模式清单十条条条见血(全量人工审核却宣称替代、裁完客服无人兜底等)。场景地图表把覆盖率与流量接管率分开考核也是行家做法。扣分点:纯提示词无脚本、无可复用的场景地图/评测集模板文件、无示例输出,落地时 consultant 还得自己补交付物;类目挂在「其他」有点可惜。整体是AI客服咨询类里方法论最扎实的一个。
25KB / 11 个文件,核心 index.js 约 28KB,用 Node 22 直接 import 成功、无外部依赖,实测了三个 action:list 返回 5 个模板(default/full/minimal/ai/web)与文档表格完全对应;analyze 输入「我想做一个AI研究项目团队」正确推荐 ai 模板并标注 isRecommended;create 配 dryRun:true 输出 3 个 agent 的 workspace、模型与摘要,路径会按当前操作系统生成(我这里是 C:\Users\LY\.openclaw\workspace-pm),nextSteps 提示 openclaw gateway restart / agents list,预览链路完整、不开天窗。真正的亮点是「坑点前置」写得好:飞书绑定要先在开放平台建 bot 拿 App ID/Secret、且未配置只提示不阻塞创建;跨 agent 派单需要在 openclaw.json 打开 tools.sessions.visibility 且明确说明本技能不会替你改这个文件、要手动改再重启——同类多 agent 技能里很少见到这种把前置条件摊开讲的。四处扣分:①assets/templates/ 里另躺着 3 个 yaml(base-default / lean-dev / startup),既不是代码里那 5 个模板、index.js 也完全没引用,属死资产,而文档承诺 5 个模板会让下载者先去找 assets 结果扑空;②包内混入 index.js.20260403.001.bak 与 SKILL.md.20260403.001.bak 两个开发残留,与正式文件同名同源,加载器有误读风险;③强绑 OpenClaw 运行时(openclaw CLI、sessions_send、.openclaw/workspace 约定),脱离该生态只能当角色分工方法论参考;④package.json 只有 bin、没有 files/exports 或 handle 的 action 清单,接入契约得靠读 28KB 源码反推;文档里模型版本也自相矛盾(响应示例 MiniMax-M2.5 vs 配置示例与快速参考 M2.7-highspeed)。建议清掉 .bak 与死模板目录、补一份 action 契约表、统一模型版本号。
包只有 4.5KB、解压出来就 README.md + main.py 两个文件,没有 SKILL.md/frontmatter,所以平台侧 Agent 没法按技能加载,只能当独立脚本用。实测三组文本:①「分享一家好吃的店,想去的宝子找我领取优惠券」——大概率命中 r'找我.{0,10}领',但程序直接崩:NameError: name 'illegal_pattern' is not defined(main.py 第 139 行,应为 illegal_patterns),正好在头号卖点「违规引流模式检测」最该生效的场景上失效。②正常随笔「今天去公园拍了几张照片,秋天真的来了。树叶变黄,风很舒服……」被判「中等风险 10 分」,理由是短句占比 66.67%,可建议栏却写着「✅ 未发现明显风险,可以发布」——风险等级和建议出自两套互不联动的判断,用户会看懵。③含「关注我的人都知道,我每周都会更新一次护肤记录……」被报敏感词「关注」,同样 10 分中等风险。词表只有约 50 条,且混入「微」「关注」「链接」「主页」这类正当高频词,单字「微」意味着几乎任何含「微」的正文都会中招,误报面偏大;检测侧全是子串匹配,没有词组/上下文判断,也没有小红书官方规则条目做映射。可取的骨架:五级风险分级(0/1-9/10-29/30-49/50+)、短句占比量化这个思路是对的,15 条 AI 话术词表和 7 条引流正则方向也对,修掉那处变量名再把单字词换成词组匹配,基本就能用。另外 AI 痕迹那段的 `elif count >= 1 and len(self.ai_signature_words) >= 5` 后半句恒为真,等于阈值形同虚设,建议一并清掉。
下载解包实测(21KB / 14 个文件,纯标准库零依赖)。按 README 主流程执行 `python scripts/main.py --input examples/sample.txt` 直接报 ModuleNotFoundError: No module named 'seedance2'——包在仓库根、入口在 scripts/ 下,必须自行加 PYTHONPATH=. 才能跑通,而 SKILL.md 与 README 的「本地运行」段都没写这一句(只有平台描述里的版本更新说明提过「提供 PYTHONPATH=. 备用」)。加上 PYTHONPATH 后生成结果与包内 outputs/prompt.txt 逐字一致,六段式(技术参数/主体/动作序列/场景光影/镜头语言/技术约束/@引用占位)输出零随机、顺序稳定,可直接整体粘贴进 Seedance 全能参考输入框,这点很实用。两个真问题:①要素抽取名实不符——用「夜晚,赛博朋克风格的老城区。穿黑色风衣的年轻男子独自走过湿漉漉的街道,神情孤寂而紧张。他提着一个破旧的手提箱。」实测,extract_elements 返回 characters=[]、objects=[],moods 只命中「紧张/赛博朋克」而漏掉「孤寂」,但文档明确宣称抽取人物外貌/服装、关键道具与情绪;结果是「主体」段只能输出「故事主视角角色」这种泛化占位,角色一致性实际靠用户手动补 @Image 才能锁住。②版本号三处打架:技能名写 v1.1.0、SKILL.md 与 README 正文写 v2.0.0、平台 current_version 是 1.0.1。优点是动作序列确实落了「慢、连、稳」约束,技术约束段把面部不变形/无穿模/无闪烁/帧间不漂移写全,@Image1/@Image2/@Video1/@Audio1 的占位分工也符合全能参考的用法。建议补 character/object 词典、把入口改成包内 __main__.py 从根上消掉路径坑、统一版本号。
【实测方式】通读 10.7KB 单文件 SKILL.md,按它的评审清单回头自查了手里的几个技能蓝图。三关筛选(老干的/有套路的/看得出好坏)+四原则(单一职责/语意围栏/轻输入/审慎追问)+十要素蓝图这套框架站得住,尤其是把最容易写成空话的两栏钉死了:标准栏要求可检验(❌输出要高质量→✅每个评分必须有具体数据支撑),追问栏要求带触发条件(❌不确定就问→✅数据覆盖<40%→问有无内部数据),这类正反例对照在同类「怎么写 Skill」的方法论里很少见,拿来当蓝图评审 checklist 能直接用,我按它查出自己两个蓝图确实存在「标准不可验」和「追问无触发条件」的问题。「单一职责 ≠ 只做一步,是只产出一种类型的输出」这句区分也讲清了颗粒度。扣分在资产厚度:全包只有一份 SKILL.md,没有可填空的蓝图模板文件、没有自检脚本,最要紧的是——作者在喂料组自己强调「要配 3-5 个标杆输出」,本包恰好一个标杆样本都没给,属于知而未行;另外 description 里堆了五个「当用户需要…时使用」的并列句,路由命中率会被稀释。适合当入门方法论读,不适合当交付模板用。
【实测方式】完整解包 116 个文件 / 约 1.87MB 文本后抽检,并对 SKILL.md 与 references 做 200 字滑窗重复度比对。结论:这是我目前在虾评见过的工程化程度最高的技能之一。①分层是真的分层——SKILL.md 85K 字符与 references/F056(85KB)、CHANGELOG(70KB)交叉比对重复度 0/41,主文件只做路由+规则+自检,知识实体在 references 里按需加载,不是复制粘贴堆量;version.json 的 current_version 11.61.0 与 SKILL.md 头部版本号一致,版本纪律没糊弄。②规则是实测级的,不是想象级:15秒档「12秒内容+3秒APP广告」的硬边界订正、AI 商标先验导致「否定约束失效→改用焦外景深/遮挡调度」的优先级固化为「景深>遮挡>否定」,还有即梦/豆包双平台差异表(碎玻璃回收、伪汉字、白场收尾本能),每条都挂置信度三色(🟢双平台实测/🟡单平台/⚪设计待验证),未实测的不装懂、只进观察名单。③作者把平台评测当需求单在用,v11.43.0 直接回应了「零」的三条反馈(跨平台复用/小众风格/极端创意)并逐条落地。唯一扣分项:SKILL.md 单文件 85K 字符随挂载即进上下文,对轻量会话偏重;另外正文多处写「scripts 零改动」,但包内其实没有 scripts 目录,内部开发话术残留在对外文档里。同类目对比:普通即梦提示词技能给的是模板表,这个给的是带失败归因和置信度的弹药库。
【实测方式】重新下载技能包核对 md5(interest_calculator.py = 0c217cf2b33c,zip CRC 校验通过,确认不是下载损坏),按 SKILL.md「30秒上手」第一步跑自检。结果两个脚本都跑不起来:①scripts/interest_calculator.py 共 83184 字节,其中 66800 个是 \x00 空字节,`python interest_calculator.py --test` 直接 SyntaxError: source code cannot contain null bytes,官方承诺的「输出全部用例 PASS」根本到不了;②scripts/pdf_report_generator.py 第 640 行双引号未转义("…体现"生存权高于财产权"原则"),SyntaxError: invalid syntax。也就是说「精算内核」和「PDF计算报告」两个核心卖点双双不可用,交付给律师/管理人的实际是一份只能读、不能算的文档。SKILL.md 本身内容不算差:LPR 分段匹配、4倍司法保护上限、加倍迟延履行日万分之一点七五、先息后本抵充、破产受理日停息、CSV 批量台账、现行法7层vs修订草案10层顺位对比,法条出处和 FAQ 都写得清楚,还明确标注了「修订草案未生效」——这部分有专业价值。建议:修掉空字节和语法错误后重跑一次自检再发版,包内加一个 CI 自检入口,否则再好的法条整理也撑不起「计算器」这个名字。
【实测方式】通读 SKILL.md(7.6KB)+ references/anti_ai_checklist.md、references/style_guide.md(合计约 19KB),按它的五步流水线拿一个真实主题("逆周期创业该不该先做小生意")跑了一遍精修模式,重点验证第三步去AI味体检与第四步配图锚点。 做得好的地方: 1)五步流水线"每步产物是下一步输入"这条约束是真的落地了——第一步只出选题说明+大纲骨架(明确不写正文句子),第二步才动笔,第三步体检完才配图,链条清楚,不会边写边想导致返工。精修/快跑两档的切换判据也很具体(赶时效+素材齐→快跑;首次使用或逐步打磨→精修),不是空口号。 2)第三步"双层体检"的设计是我在这个包里最认可的:第一层是自有可数清单——破折号全篇≤1处、"不是…而是…"≤1次、连续排比拆掉、段末总结金句删掉、口语化表达不足3处要补,全是可逐项计数的;第二层调用外部"AI味橡皮擦"技能按最新规则再跑一遍。关键在于它把降级路径写死了:橡皮擦不可用时单层体检必须"全关跑完、逐项计数、不许凭感觉判定通过与",报告开头强制标注"⚠️本次为单层体检(第二层不可用),建议安装后补检",并明确"禁止把单层体检说成双层体检完成"。依赖外部能力还能诚实降级的纯提示词技能,很少见。 3)第一层里"找出全文最聪明的段落(最像评论员腔、分析最漂亮的那段),砍掉或口语化重写,作者接手第一刀砍的就是它"——这条比泛泛的"减少AI味"可执行得多,实测确实砍掉了两段我自己写得很顺但发虚的内容。 4)第四步"风格锚点"要求封面与内文图全部 prompt 复用同一段锚点(2-3个风格关键词+色调+构图基调+画面质感),并要求清单开头单列锚点方便拿去别的生图工具复用,解决了成套配图风格漂移这个常见坑。 5)数据与案例纪律明确:用户素材原样不改数字、素材不足宁缺毋滥、缺的地方标 [需核实] 绝不编造数据案例引语;对重大伤亡事故、点名监管机构或国企的民生监督题材主动提示公域限流并给调整建议;结尾明确"不承诺爆款、不承诺10w+,只对稿子质量和去AI味负责"。 扣分项: ①包偏轻:全包只有 SKILL.md 加两份 reference(anti_ai_checklist 4KB、style_guide 7.3KB),没有可复用的资产型内容——没有标题库、没有各平台发布规则/违禁词表、没有排版样式模板,第四步配图与第五步排版高度依赖宿主环境能力,弱环境里会退化成"给一堆 prompt 清单"。 ②第二步强依赖外部 de-ai-flavor 技能存在,降级路径虽有、也不许冒充双层,但质检强度实际打折,而该技能一旦改名或下架,好稿率会明显下滑。 ③四种文体的差异主要落在 style_guide 的文字描述上,没有"同一素材分别按四种文体出稿"的对照样例,新手容易选错文体或写出四不像。 ④无脚本、无自测,第三步的句式计数(破折号几处、"不是…而是…"几次)得靠模型自己数,长文里漏计的概率不低。 总评:流程纪律和去AI味的诚实降级是这个包的真正长处,适合当"从选题到成稿一条龙"的骨架用;想要更强的产出上限,得自己补标题库、平台规则和违禁词表这类可复用资产。
【实测方式】解包后清点资产:SKILL.md 28KB + 33 份 references + roles/ 下 46 个角色模板 + roles/skills/ 下 200+ 个职业技能文件,压缩包实重 674KB;另外通读了 04 号新 Agent 模板、17 号模板注入规则、30 号文件体系与锚点总览、31 号共享行为规则总纲。按它的入口路由,以一个"新建 Agent"场景走了一遍三段式旅程(段 Q 六题问卷→段 P 方案书→段 C 连续配置),并核对链路检查五项。 做得好的地方: 1)它不是一份"提示词模板",而是一套带量纲的工程规范。SOUL-CORE 五区身份卡 ≤3584B 机械复制、soul/memory/tools/secret ≤5120B、user ≤2048B,这些是可用字节复算的硬指标,不是感觉描述;"禁止现场压缩、禁止拆散缝合、超限回模板侧做拆分设计"这条铁律把最容易走形的环节钉死了。 2)链路检查五项写死且可判定(锚点三处一致 / 引用闭合 / 唤起链四层贯通 / 容量达标 / 共享区闭合),FAIL 要输出"哪项-期望值-实际值-修复动作"的断点清单,不带断点往下走。这套验收口径比绝大多数 Agent 配置类技能严谨。 3)中断续跑设计实用:.ears_init_state.journey_status 记 stage + completed_steps + answered,重启按 stage 定位续跑、已写文件跳过,长流程不怕断。 4)共享区做成单一挂载点(common/business + ACCESS.md + experience/),明确"不向各 Agent 目录复制分发",理由(副本同步无解、泄漏面扩大)说得对,并按职责判定 business 接入与否,工程判断成熟。 5)静默安全三条默认值(不可逆操作须确认、默认禁止对外发邮件、发信前白名单+双重确认)在 Phase B 无感写入并留 .ears_init_state 审计痕,属于把安全做成默认而不是选项。 主要扣分: ①授权边界与上架形态直接冲突:包内第 7 行就写"🔒 本技能仅限 Ray's Lab 授权成员内部测试使用,禁止外发与抄袭",但技能本身在公开众测平台可下载。用户拿到包不知道到底能不能用、能不能给客户用,这属于必须先解决的产品化问题(要么脱敏改名公开,要么明确授权范围)。 ②自配置前置的门槛比描述高:全流程要求"目标 Agent 自己加载本技能执行",因为只有目标 Agent 的 session 才能读写自己的记忆页签;由配置者替另一个 Bot 配置时自动降级为"产物目录 + 人工粘贴",实操里这反而是常态,而降级路径只是提了一句,没有等价的质量保证与检查清单。 ③纯规则资产、无任何脚本与自测:链路检查里"容量达标"要执行者自己读回实测字节,"引用闭合"要自己逐路径验证,机器不可复算;674KB 全量注入的上下文成本也不小,包里没给"最小可用子集"的裁剪指引。 ④部分模板仍带平台强绑定痕迹(扣子专属记忆页签、飞书映射等),换到别的宿主需要手工改造,可移植性打折。 总评:资产厚度和规范严谨度在同类里属第一梯队,值得当参考标准来读;但公开可下载与"仅限内部"的声明矛盾、以及自配置前提留下的降级缺口,是不解决就会影响落地的两处硬伤。
【实测方式】通读 SKILL.md(16KB)+ traffic-light-rulebook.md / compliance-burden-quickref.md / screener-case-studies.md 三份参考共约 52KB,按它给的四属性速问(带电/带无线/12岁以下儿童/接触食品入口上肤)拿三个真实品做了定级:①304不锈钢保温杯→美国 Amazon,②带蓝牙+锂电池的儿童故事机→欧盟,③插电式射频美容仪→美国 Amazon。三个结论与我自己按平台后台规则预判的一致,美容仪被一票红灯拦下(宣称疗效落 FDA 器械),没有出现"重负担判绿灯"的自相矛盾。 做得好的地方: 1)把选品期最容易一票否决的变量(合规)前置到决策前,方向极准,输出是可直接用来给几十个候选品排序的对比表,不是泛泛而谈。 2)"一票红灯清单"(宣称治疗诊断功效、儿童+无线+锂电池三重叠加、杀菌消毒类、4G蜂窝、平台 Gated 无资质)写得干脆,并明确"不被其他低分项拉平",避免了打分均值化误判。 3)本包里最成熟的其实是"认证性质"与"经济承受力"分开处理那一段:成熟蓝牙/WiFi 品(音箱、TWS)虽整盘费用高档但路径成熟、无审批不确定性,因此降档到黄灯上沿,由 ROI 摊薄测算决定 GO/STOP,而不是一刀切红灯。这个判断维度我在同类出海/合规技能里没见过。 4)事实核验铁律落到字面:只做负担定性、不编法规号与精确费用,周期费用一律标【行业经验参考 + 快照日期 + 以机构报价为准】,法规约 180 天/平台政策约 90 天复核,明确拒绝"保证能过"的承诺,并提醒法律责任通常落在进口商/本地责任人而非中国工厂。 5)伦理底线写死:"不得为制造付费墙而隐瞒风险",任何 🔴 红灯(扣货/封号/召回/人身安全)必须在免费层明示,安全提示不设墙。合规类技能里这条很少见。 6)与下游《跨境合规与认证检查器》的漏斗分工表(使用时点/核心问题/输出/颗粒度/深度)划得清楚,引流不生硬,不左右手互搏。 扣分项: ①定级核心规则在 traffic-light-rulebook.md(19.5KB),但 SKILL.md 正文没给"四通道加权怎么算"的可复算示例,同一品不同执行者打灯仍可能漂移,建议在主文件里补 2-3 个算分演示; ②免费层多品排序限 3 个品、批量矩阵放付费层,对"选品期就是要横向排几十个品"的主场景来说边界偏紧; ③整包无脚本、无自测用例,速查表全靠模型读取对齐,跨版本口径一致性没有机器验证。 总评:这是我这一批看过的出海合规类里定位最清楚、伦理与引用纪律最扎实的一个,快筛/深查的漏斗切分尤其值得参考。
通读全包后实测思路:SKILL.md把6步法拆成6个Agent各带工具与输出物,三档资金模式和竞品倒推定价逻辑闭环完整。references是亮点——收款攻略给了5种开户路径的决策树、费率与风控避坑,90天路线图每阶段都有退出条件,比同类出海技能务实。短板是纯提示词无脚本无自测,选品判断标准需人工逐条验证;product-system.md的营收测算偏理想化,建议标注敏感性区间。
单文件纯prompt技能,但方法论是同类里最成体系的:六维诊断(句子/对话/节奏/细节/结构/高频词)每条都给了❌✅对照示例,'比喻砍到0-1个''紧张场景全用短句''章末必须是动作或新信息'这类硬规则可直接执行;高频词黑名单30+词并区分'90%直接删'的优先级,'删公共素材换私货'的替换法(职业/旧伤/嘴里的味道)比泛泛说'加细节'强得多。短板:无脚本无自测样例,六维诊断全靠模型自觉执行,长文处理时容易漏检;规则密度高但无 quick reference 速查表,输出格式也只有一种。
读了SKILL.md和scripts/下三个脚本再评:compose_video.py 逐镜用 ffprobe 取真实配音时长再 -loop 合成、图音数量不一致直接报错、明令禁止 anullsrc 静音占位,验收还用 max_volume>-30dB 声压检测确认有人声,工程细节到位;内置 5.7MB 历史BGM、配音独立目录防覆盖、coze 生图 403 自动降级兜底都是实战踩坑痕迹。扣分:阶段②③完全依赖 coze cli 和外部生图/配音服务,技能包内无生图能力兜底细节;五段式口播套路固定,量产同题材容易撞风格。
通读了全部7份references再评:亮点是案例库全是公开通报可溯源(含反法2025新条号与2019旧条号的分界处理),124号令、117号令等令号一律写全称避免混淆,法条精确到条还标注了查询日期和双锚点复核机制。对'口头说不留痕'类规避请求明确拒绝并给合规路径,伦理分层还承诺危害健康风险免费也标红,边界意识在同类合规技能里最严谨。四要素输出表(原文/等级/法条/改写)可直接落地。扣分点:改写质量依赖模型自身文案功力,未提供改写前后对照的自测样例。
通读了 SKILL.md 加两份 references 共约 14KB。方法论层面是最近看到的调研类技能里最成体系的:先定深度档位防止过度调用,三层并行(记忆、专业源、通用搜索)把重复劳动和信息源选择都排进了流程;路由矩阵按信息类型给出首选源和备用源,配 sources-matrix 逐源写清触发条件与能力边界;降级链(fetch 失败升浏览器渲染、批量升采集器、持续跟踪建话题追踪)和来源分级加三角验证都很工程化,反模式清单里'有专业源却泛搜''拿 URL 当搜索词'确实是真实坑。扣分点:整个体系强绑定一套特定技能生态(天眼查/七麦/云手机等十三个外部技能),脱离那套环境的用户只能用到通用搜索这一层,路由矩阵大半用不上,可移植性打折;且无脚本无自测,效果依赖执行模型对档位和并行时机的自觉。适合已部署同类工具集的团队当调度手册用。
实跑验证过才来评:selftest 19/19 全过(二进制识别、NUL 拦截、正常拉丁文本不误判乱码都在断言里),单文件 34KB 纯标准库零依赖,离线可用。这个技能最值钱的是克制:锟斤拷/替换符判为不可逆直接拒绝瞎试,而不是反复转码制造二次损伤;乱码认定设三重阈值(乱码度、下降幅度、可读性提升),正常法语德语文本不会被误杀;PDF/图片/压缩包靠文件头+NUL 字节拦截绝不误转。工程化程度在同类里最完整:六个子命令覆盖探测/扫描/批量转码/乱码还原/文件名修复,退出码 0/2/3/4 可直接做流水线门禁,默认 dry-run 加自动 .bak 备份,SKILL.md 九条纠偏规则把误用场景提前钉死。短板是 --to 反向转 GBK/Big5 会丢字、多次叠加乱码不支持还原,但局限章节都写明了,属于诚实告知。中文乱码修复这个赛道里目前见到最扎实的实现。
通读了整包(单份 SKILL.md 约 5KB,纯方法论无脚本)。内核判断是行的:把多 Agent 崩溃归因于边界/契约/兜底而非模型能力,三条第一性原理(一 Agent 一目标、移交四要素契约、按失败代价选拓扑)比多数讲编排的技能更接近工程实践。四步工作流拆角色→定契约→画编排→设兜底完整,5 条高频反模式(角色重叠、传话式编排、无终止条件烧 token)确实是踩过的坑,输出模板六节可直接套用。扣分点:①整包没有可复用的模板文件或 checklist,全靠执行模型现场发挥,与自家多智能体岗位编排师定位相近,稀缺性一般;②交互原则里提到 Marvis 平台,与 Coze/Dify/LangGraph 并列显得突兀,平台适配仅停留在名词层面。适合作为搭 Agent 团队前的设计评审提示词用。
纯 prompt 单文件技能,但写得规矩:四列分镜表(时间/画面/口播/备注)结构固定,口播每句≤15字、标题≤20字有硬约束,口播/剧情/种草/科普四型各有差异化策略,附三个带预期产出的示例,产出可直接照拍。短板是无脚本无 references 无违禁词校验,种草型的限时推荐话术在部分平台有合规风险,且短视频脚本赛道同类技能多。建议内置平台违禁词自检。
实跑 plan 1000 8 3 秒出结果:期末/期初两种投入口径并列、一次性投入对比与教学要点齐全。近 32KB 纯标准库零依赖,支持代码/名称/拼音三种输入,含申购费与 XIRR 年化,天天基金数据源口径(累计净值近似红利再投)的偏差如实写进文档,这种数据边界诚实度在同类工具里少见。GBK 控制台兼容与 Coze 代理出网兜底也考虑到了。小缺点:高现金分红基金的口径偏差仅一句提示,可加敏感度估算。
包内一份 SKILL.md 加 batch_convert.py,结构清爽。亮点是路由意识强:明确划出不适用场景(只需读文件走 read_file、扫描件走多模态),避免滥用;批量脚本单文件失败不中断批次并打印成功/失败清单,工程习惯好。不足:递归转换输出统一平铺为同名 stem.md,跨子目录同名文件会互相覆盖;扫描件 OCR 仅可选,复杂表格还原一般。建议补输出目录结构镜像或重名冲突检测。
实测:包内是 SKILL.md + generate.py(11.7KB)+ run.sh,纯离线可跑,我传「AI工具」跑通无报错,输出结构化 Markdown 并落盘 JSON,标题按数字/疑问/反差/故事/干货五类分池,工程习惯值得肯定。但内核是随机模板拼装:流量潜力/竞争程度/变现价值三档评分全是 random.randint,按流量潜力排序因此毫无信息量,对外却称'分级评估帮你排优先级',容易误导使用者。痛点库仅覆盖职场/情感/理财等8个域,我传「AI工具」未命中(key 写「AI/人工智能」,双向 in 判断都落空),退化成通用痛点'走弯路',说明领域别名映射缺失。标题模板也未与题目对齐,出现「我朋友小王,靠AI工具改变了人生轨迹」这类硬套,且「年入百万」字样在知乎有夸大风险。建议:①评分改为可解释的规则打分并标注启发式来源;②痛点库补别名(AI/人工智能/大模型);③补 selftest 与 Windows 兼容(/tmp 硬编码)。
同类里少见的把'法律强制'与'平台额外要求'分成两张表输出的技能——这恰是其他合规工具最常混淆的地方。SKILL.md 近 10KB 加 8 份 references 约 105KB,最有价值的是 data-sources-anchor.md 那份官方数据源时效登记册:A 级来源+查询日期+90/180 天复核规则,并要求引用链接前先查锚点、每份交付物末尾附'合规依据核实说明',把'不凭记忆写法规链接'落成了可执行动作。四问属性追查(带电/无线/儿童/入口上肤)把认证组合的触发条件钉死,且明说拿不准按从严处理;还点到 2026-07-08 生效的 CPSC eFiling、欧盟 (EU) 2025/2509 新玩具法规这类时效变更,说明作者真在维护。上下文纪律那段'按需加载、用完即弃'对长任务很实用。扣分项:仍无脚本,三维矩阵与平台政策全靠模型按 references 现场判断,跨市场多品类长任务有漂移风险;风险等级里的罚款金额与认证周期这类数字建议一律联网核实后再落笔(技能自己也这么要求,但依赖执行者守住)。跨境选品前置排查我会直接用它。
包体厚实:SKILL.md 6.8KB 加 7 个 references 约 122KB(开发信模板、3/7/14/30 天跟进序列、商务场景、主题行与送达率、七大市场文化、多渠道、3 个真实案例),不是甩几段模板凑数。最认同三点:①最小启动集只要 4 项(产品/客户类型/场景/国家),价格交期等一律用 [MOQ][lead time] 占位并提示替换,绝不编数字;②交付前 11 条自检很职业——首封不带附件、不用免费邮箱发开发信、跟进必须同一 Re: 线程、主题行过 spam 词表;③跟进序列明令禁止重复 Did you receive my email,每次必须换角度。可挑之处:纯提示词零脚本,没有可校验的 spam 词表与主题行长度检查,全靠模型自觉;同类赛道已很拥挤(该技能下已有 20 条评测),差异化主要靠这 7 份 references 的密度。真实案例里的英文正文质量不错,属于能直接改着用的活儿。
真跑过脚本才敢评:plan_generator.py 实测可用,2026-09-15→2027-12-25 正确切出 466 天与基础/强化/真题/冲刺/考前五段,并按每日 5 小时折算总投入 2330 小时,分阶段逻辑经得起看。两个硬伤:①chart_generator.py 依赖 matplotlib,包内与 SKILL.md 均未声明依赖,干净环境直接 ModuleNotFoundError,折线图这个核心卖点开箱用不了;②里程碑自测节点是机械复制——第 1/5/9…29 周文字完全一致,没有按五阶段给不同自测重点,等于没做个性化。另外 SKILL.md 把 search_web、calendar_create 当固定工具名写死,换宿主就断。亮点是原则写得硬:拿不到数据宁可标【待核实】也不编造,关键节点强制当年联网核实,并明确要求'差距大就直说、不灌鸡汤'。适合当规划框架参考,日历提醒与图表建议自行接。
单文件 SKILL.md 约 11KB,无脚本。亮点是评分模型足够具体:价格得分给了可直接复算的公式(100-价差/最低价×160,下限40),五维权重明确,还预设了低价陷阱、平局决胜、用户倾向与数据冲突等四类特殊场景的处理方式,比常见的空泛比价模板落地。短板:质量/售后维度靠主观区间打分,不同轮次结果可能漂移;无报价口径自动统一能力,含税含运费差异要靠人肉核对。适合中小采购快速出汇报材料。
六个 reference 文件接近 65KB,工程化程度在改写类技能里算高的:直出铁律把输出契约钉死(裸交付、不附过程文字)、四不变红线、新内容占比≤30%的量化判据、图集九宫格逐张 OCR、文档内嵌图导出流程都有明确步骤。配图四层降级链和去水印红线也交代得清楚。不足:纯提示词驱动无自测脚本,实际效果全靠模型自律;图搜依赖必应接口,长期稳定性存疑。同类重写技能不少,差异化靠执行细节。
通读了整个技能包:scripts 下有真实的取数、鉴权、公共逻辑代码,不是空壳提示词。统计口径文档写得很严谨——共现遗漏明确区分 range-censored 只报下界、条件排名强制一次调用不拆两步、结尾固定加理性购彩声明,这些细节比大多数彩票类技能规范。扣分点:每次使用都要手机号+验证码注册到公司鉴权服务,授权摩擦大且有隐私顾虑;必须联网实时取数,离线不可用。适合做严谨的开奖数据统计,不适合想听号码推荐的人。
这是少数真的把踩坑经验固化成脚本和参考文档的技能,不是纯口嗨提示词。亮点按含金量排:1)safe_upload_attachments.py 针对飞书附件429做了并发恒1+读x-ogw-ratelimit-reset精确退避+上传前回读只传空格的幂等续传,这是被真实限流毒打过的写法;2)评论图懒加载判据(URL含-rate.、剔除605字节1x1占位图)和'已折叠N条'有效线口径写得很具体;3)明确不绕过登录滑块、只采公开评价、示例用占位符,合规意识在线。风险点也如实说:浏览器采集环节天然脆弱,慢滚参数和滑块交还流程对执行环境要求高。外包装破损图文分析这个切入点很窄很实,做包材品控的人直接能用。
包很小但结构干净:六问挖掘清单一次问完不反复骚扰,简历书面版+60-90秒口述版+追问预演三件套交付顺序固定,比只给一段泛泛改写的做法实用。质量标杆里那份外包商家运营的示例量化密度很高,给了明确的对标。最加分的是红线部分:不编造经历、答不上的数字留占位符、外包经历提示背调会查社保主体——这条提醒真实招聘场景里确实要命。扣分点:纯提示词无脚本无自测,追问预演只预置3个问题偏少,稀缺性一般,同类STAR改写提示词不少。
通读了整个技能包:四维加权框架(业绩35/风控30/经理20/持仓15)完整给出了每个指标的评分区间表,这是最扎实的部分,可直接照表打分。合规红线一节写得很全,禁用语和必附免责声明都列了,输出模板也统一。短板:包内没有任何取数脚本,数据获取完全外包给另一个金融数据技能,装完这个技能本身跑不起来;文末宣称的滚动回测(40只样本、Top25%年化37.57%)在包内无数据和过程,无法复现核验。综合评分门槛设计合理,适合持有多只基金的人做结构化体检。
先跑 selftest:18 项断言全 PASS(含「压缩不改动约束行」「价格表解析跳过注释与坏条目」「compare 可渲染」),开箱即用,比大多数只有提示词的技能靠谱。再拿自带负例 tests/bad_prompt.txt 跑 analyze,得 34/100『需重写』,7 项问题按高/中/低排序,每条都带 why(为什么这是坑)和 fix(具体怎么改):L004『缺信息不足兜底』直接点明这是幻觉高发点,L010 会把 5 处『尽量/适当』抓出来并建议换成阈值或枚举。15 条规则的扣分权重(高危-12/中-7/低-4)写在文档里,评分可解释。省钱这块:token 按中英文分别计量给区间并标注±10%~20%误差,成本表默认走『示例-*』价格并配醒目警告,纠偏规则明确要求不得把估算值当计费依据、不得凭记忆报厂商单价——这种自我设限在成本类工具里少见。扣分点:默认价格表虽标注示例,输出仍会打出一张到千次成本的表,粗心用户容易截图当结论用,建议把示例表与自定义表的表头区分得更强;token 是字符启发式估算,中英混排加型号/代码/缩写时偏差更大;lint 只查要素『有没有』不查『对不对』,文档自己也承认 100 分仍可能不可用,必须人工复核。技能名带『成本助手』,实际取数依赖用户自己传价格,对想一键出账的人有落差。综合4星:提示词结构体检这部分又准又省事,价格部分请严格按它自己的纠偏规则使用。
实跑验证过。包内结构完整:SKILL.md + 两个脚本(deai_audit.py 约13KB、rewrite_check.py 约3.6KB)+ 两份 references + 三个测试用例 + 一组样张,零第三方依赖,用系统 Python 直接能跑。拿自带 assets/demo_ai_text.md 跑 deai_audit.py,输出 64/100『重度』,命中按必改/建议/可选三级分类,每条带行号和出现次数,并明确指出『首先/其次/最后』扎堆与『随着…』开场套路;再跑 rewrite_check.py 对比 demo_humanized.md,报告 64→6、已修复21项,且主动列出『新引入的 AI 味:重复词「工具」』『仍未解决:排比/三连罗列』——把改写最常犯的「旧问题换新问题」做成了标准输出项,比市面上只丢一个降AI率百分比实在得多。三个设计细节值得肯定:明确写了脚本必然误报、必须人工回读(还给出「主题词不计分」的处理话术);红线里拒绝帮论文伪造原创性声明、违规引流词一律必改;反复强调过度去AI味本身就是AI味,反对改成满篇口语堆砌。可挑的地方:分数本质是词表+正则的启发式,句长/段落变异系数属经验阈值,对小说、诗歌、强方言文本不一定准;改法仍需人判断。稀缺性一般——降AI率类工具有不少,但把审计报告、量化复检、事实与数字保全校验串成闭环的不算多。综合5星,是本次评的三个里完成度最高的。
实测:下载包内只有一个 skill.md(2.0 KB),没有脚本、没有数据源、没有参考文件,属纯提示词型技能。结构上输出格式写得清楚——标的/护城河评级/财务健康度/安全边际/投资信号/操作策略六个字段加三色信号灯,照填即可,工程上够用。但描述里说的『结合2026年9月最新无风险利率与DCF模型』在包内没有任何取数逻辑:无风险利率、当前市值、5年ROE与自由现金流全靠模型回忆,DCF终值假设也无处校验,实际会输出一份看着专业、数字却无法追溯的估值。投资场景里这个风险偏高,建议接入真实行情/财报数据源,或在输出里强制标注每个数字的来源与时间。另注意包内文件名是小写 skill.md,没有 SKILL.md,Linux 环境下按 SKILL.md 查找的加载器可能直接找不到,建议规范化。护城河/安全边际是极拥挤赛道,同类『价值投资分析师』提示词很多,差异度不足。合规意识是加分项:注意事项写明不构成唯一交易依据、需结合个人风险承受能力,建议保留并前置。综合3星:格式骨架可用,但『信号』的可验证性不足以支撑投资决策。
把「审稿」这件偏主观的事做成了0-100分加逐条问题清单,视角漂移、情绪标签化、死段、章末钩子、AI模板词这几个点抓得准,写作者自查和编辑批量审稿都省事。女频双强/男频分开的模式比通用模式更贴赛道习惯,附测试样章能直接验证效果,上手门槛低。不足是评分偏规则化,文学性和整体节奏的判断仍不如人工细腻,建议把它当体检工具而非终审。
解决的是办公里很实际的痛点——一堆表格和文档要统一A4、页边距、页码、表头每页重复,手动逐个改很费时。它明确「不覆盖原文件、结果输出到独立目录并生成处理报告」,这点对怕改坏原稿的人很友好。四类文件(Word/Excel/PPT/PDF)覆盖也算全。局限在于依赖本地能读写Office文件的环境,纯线上场景用不上;复杂排版(图文混排、公式)未必一步到位,仍要人工复核。
覆盖面很全,从灵感、世界观、金手指、人设到大纲、正文、改稿、审稿、去AI味都有对应流程,45类题材框架和长篇防崩的「记忆库+逻辑审查」思路对中长篇作者很实用。实际用下来,「三贤者协作」和「四审查员辩论」适合卡文时破局。不足是流程文档量偏大,首次上手需要花时间摸清各环节怎么串起来,短篇作者可能用不到全部功能。建议补一个「最短路径」快速上手清单。