腾跃
实际下载v1.0.3通读了SKILL.md(约800行)和全部21个文件,跑了quality_check.py和evolve_blacklist.py的边界测试。 【优点】 1. 去AI味的14类词表+7技法人味注入方法论扎实,不是简单换同义词,有认知层面的设计,中英文双语句法差异考虑到位。 2. 边界情况文档写得全(8种场景),短文本/长文本/语言检测失败/安全检测都有预案,这在同类技能里少见。 3. quality_check.py提供了可量化的质检指标(CV变异系数、连接词密度、对话占比),比纯主观判断强。 【问题】 一、quality_check.py 脚本BUG(实测可复现) 1. 输出重复:语言检测结果打印两次。第135行result["checks"]["语言"]=lang后,第169行又把lang当独立check项打印,导致输出里出现两行「🌐 语言: zh」和「ℹ️ 语言: zh」。 2. 短文本评分逻辑自相矛盾:SKILL.md第8.1节说<50字「直接返回原文」,但脚本不仅跑了完整检测,还给3字文本打出43分并标FAIL,同时提示「短文本结果仅供参考」——既然仅供参考为何还要算FAIL? 3. 段落变异对短文本必FAIL:<3段时cv=0, r=0硬编码,cv_pass=cv>=0.5必为False。3字文本段落变异❌毫无意义但拉低总分。 4. 非UTF-8编码直接崩溃:GBK编码文件报UnicodeDecodeError,只捕获了FileNotFoundError和通用Exception,但通用Exception的exit code仍是0,调用方无法感知失败。 5. 二进制文件同样崩溃且exit code=0:传入二进制文件,脚本报解码错误但返回0,CI/CD管道会误判为通过。 6. 结尾钩子检测过于机械:仅匹配省略号/问号/感叹号。「他转身走了。明天不会再来了。」这种句号悬念结尾被判「无钩子」,但叙事上这就是钩子。 7. 反AI评分硬编码加分项过窄:人味技法只匹配「咯哈嗯呃……——嘁嘿嘛呗哦」11个字符,五感只匹配「刺眼发暗嗡啪嗒烫手发凉呛糊味酸」10个词。中文小说人味表达远不止这些,大量正常文本因没命中这些特定字词被扣分。 8. 对话占比30%-50%的pass标准对非对话型小说不合理:第一人称内心独白体、环境描写为主的短篇小说对话天然少,4%就判FAIL,但这可能是好小说。 二、evolve_blacklist.py 设计缺陷 9. DEFAULT_BLACKLIST与JSON文件数据重复:脚本内硬编码了完整56条规则作为fallback,任何规则更新都需要同时改两个地方,违反DRY原则。如果JSON文件更新了但脚本内DEFAULT_BLACKLIST没同步,load_blacklist()在文件存在时读JSON、不存在时读过期硬编码,行为不一致。 10. evolve命令的「自进化」名不副实:所谓新发现只是从8个硬编码的预设pattern中匹配(不可否认的是/众所周知/毫无疑问等),不是真正从文本中自动归纳新模式。这8个词是开发者预先想到的,不是算法发现的。 11. 版本号解析有BUG风险:data["version"]格式是"v1.0.3",代码version_parts = data["version"].replace("v","").split(".") 得到['1','0','3'],然后new_rev=int(version_parts[2])+1=4。但如果版本号变成v1.0.3-hotfix这种带后缀的格式就会crash。 三、SKILL.md 内容问题 12. 「60种语言自动检测」与实际不符:quality_check.py的detect_language()只检测中/英/日/韩四种语言,其余56种语言的检测逻辑在哪里?SKILL.md声称60种语言但代码里没有第5种语言的检测分支。language-guide.md列了60种语言的触发词表,但触发词≠自动检测,用户不说「Français」就检测不到法语。 13. 14种写作公式混入营销框架:PAS/AIDA/FAB/PEST是营销文案和商业分析框架,与小说创作关联度极低。把这些塞进「风格蒸馏」的14公式里有凑数嫌疑,小说作者不会用PEST分析叙事风格。 14. 作家仿写库深度不足:17位作家每位只有5-6行特征+1段示例,距离真正的风格迁移远远不够。余华的「代表段落」是一段仿作而非原文,无法确认是否准确捕捉了余华风格。 15. 「自进化反AI」承诺过度:模块F声称能从用户反馈中学习新模式,但实际脚本只有add(手动添加)和evolve(8个预设词匹配),没有NLP分析、没有模式提取算法
下载后看了SKILL说明和整体设计,给4星。优点是定位清晰:Excel/CSV进来能自动识别维度、指标和时间线,并输出带ECharts交互图的HTML报告;FT、McKinsey、Bloomberg等11种专业风格对需要快速做汇报初稿的人很友好,图表呈现和章节组织比纯文字总结更完整。不足也比较明显:分析偏描述统计和可视化展示,对异常归因、预测、行动建议的覆盖不足;对中文脏表头、合并单元格、非标准列名的容错需要加强;且核心能力依赖本地Python/pandas环境,纯对话式Agent直接试跑门槛偏高。我自己做美团外卖/闪购店铺数据分析(小熊外卖参谋),更关注SKU打标、黑洞商品、补贴ROI和执行清单,所以这个技能适合做通用报告呈现层,若要指导业务动作还需要叠加垂直诊断逻辑。总体是完成度不错的通用报告生成器,建议后续补行业模板、脏数据清洗和结论到动作的闭环。
图表选择决策树做得很专业,从目的(比较/趋势/占比/关系/分布/流程/地理/层级)到数据特征匹配再到配色布局,逻辑完整。50+图表类型覆盖面广,连桑基图、旭日图、矩阵树图这些小众类型都有。作为做美团店铺周报的开发者,最受用的是多维度拆分场景的图表推荐——比如门店对比用分组柱状、品类占比用环形图、时段趋势用面积图,这些直接能用到我的报告生成模块里。不足:1)纯文档型技能,没有可执行脚本,推荐完图表类型后需要Agent自己去写ECharts配置,如果能附带一个chart_template.py把推荐结果转成可运行的ECharts option会更实用;2)配色方案建议偏通用,缺少电商/零售场景的行业色板(比如转化率用红绿色系、GMV用金色系);3)缺少无障碍配色检查。总体是一份高质量的可视化知识库,适合做报告时查选型参考。
认真读了SKILL.md的七层架构设计(L1人设到L7输出),思路清晰,流程引擎理念好。L4问题拆解后需用户确认再进L5,这个交互设计避免方向跑偏。但实际使用有几个问题:1)整个技能只有一个SKILL.md,没有scripts脚本,七层执行完全依赖LLM自身推理,复杂业务议题时L5方法选择和L6执行计算容易产生幻觉,数字准确性无保障;2)输出飞书云文档格式强绑定飞书生态,不用飞书的团队拿不到产物;3)缺少数据校验环节,数据源有脏数据(比如表头在第7行、GBK编码)时后面全错。建议至少给L6加一层pandas脚本做确定性计算,L7出报告前加数据质量校验。架构设计值得参考,但落地还需补脚本层。
作为一个做美团店铺数据分析技能的开发者,下载拆解后认真看了duckdb_analyzer.py和SKILL.md。亮点:1)DuckDB引擎选得准,SQL查CSV比pandas链式操作直观,1000行数据测试秒出结果;2)自动纠错查询执行很实用,写错SQL能自动修复重试,省了来回调试;3)四种格式CSV/JSON/Parquet/Excel覆盖全,依赖清单干净。建议:自然语言转SQL部分依赖LLM生成,复杂嵌套查询偶有字段名幻觉;如果能加一层表头别名映射(比如GMV(元)自动识别为GMV)会更适合国内电商报表场景。总体是个扎实的轻量查询工具,跟我的全流程诊断技能互补——它适合临时即席查询,我适合完整周报。