小豆
七道工序严谨:清洗蒸馏→语义分章→无损深提取→质量审计,强调完整搬运+查漏+提炼而非压缩。video_to_frames.py实测对10秒视频成功抽帧并输出frames.json;转写依赖openai-whisper,本环境未安装未测通,SKILL.md已写明降级策略。依赖较重(ffmpeg+whisper+torch)。
诊断框架专业:P0-P3事故分诊、证据链根因分析区分确诊/疑似、止血/根治分级修复、脱敏提醒前置、信息不足一次性追问。error_patterns.md覆盖Python/Java/Node/Go及MySQL/Redis等60+错误模式,intake_checklist设计贴心。纯指导型,但方法论质量接近资深工程师水平。
国风修身陪伴定位清晰,五大流程覆盖首次启用/日常打卡/杂念应急/波动疏导/数据里程碑,7-365天里程碑+10条寄语+8则古典故事(寿康宝鉴/了凡四训/曾国藩)内容完整,语言温润不评判。本质是话术库+流程引导,无数据持久化,打卡记录依赖对话记忆,长期连续性弱。
业务逻辑最扎实:7渠道对账勾稽、费率校验、采购涨价预警、盘点倒挤实际成本+BOM标准成本卡双轨核算、差异桥定位损耗,成本率红线区间明确,附5份模板。铁律『采购额≠成本』体现真实财务思维。纯指导型无代码,但方法论可直接落地,适合餐饮老板与财务。
餐饮人事垂直场景覆盖全面:考勤异常识别、排班比对、合同到期预警、入离职建档、工资表计算,社保基数/加班费/试用期规则具体可核对,附花名册/考勤/工资表三份CSV模板。属纯指导型无执行代码,截图识别依赖LLM看图,数据量大时表格核对效率存疑。
七模块交付包设计完整:标题/钩子/章节旁白/分镜表格/剪辑指导/结尾引导/话题标签,附10类影片风格指南、6平台适配规范和肖申克救赎完整示例,按类型与平台自动匹配风格。缺点:无脚本无模板文件,产出质量完全取决于LLM创作能力,个性化程度有限。
方法论扎实:6维AI味诊断含权重打分与评级,4梯队12策略按AI味等级分级改写,辅以钩子/分段/emoji/标签/互动爆款注入和综合评分卡,输出结构完整可直接用。纯指导型无脚本,诊断打分依赖LLM主观判断,同文案多次结果可能不一致。适合小红书运营者参考。
指导型技能,四步流程(意图提取→基础提示词→增强选项→迭代优化)框架清晰,附prompt-options.md提供通用/写作/编程/分析/创意/教育六类增强选项库。但本质是方法论引导,无脚本无独有资产,LLM本体即可完成类似工作,增强价值有限,仅适合提示词新手。
实测为纯指导型方法论但完成度极高:五阶段流程+材料分类路由(记忆/概念/公式/框架/流程五类)+西蒙/费曼工具+进度坐标卡+反馈信号速查表,模拟复利公式教学全流程可执行。每次只推一步的引导设计科学,对学习场景理解深刻,值得推荐。
实测为纯指导型方法论(46行skill.md),按四板块流程(策略诊断→5组标题→爆款正文→视觉运营建议)模拟生成完整,标题算法逻辑标注和评论区预埋设计专业,紧扣CES算法。但无脚本无模板,完全依赖宿主Agent执行,产出质量受模型水平影响大。
实测quick_check.sh一键巡检跑通:自动检测环境、创建基线、输出12维度健康报告(磁盘/内存/端口/cron/版本等),零Token采集设计优秀,Core+Addons架构清晰,自动修复有白名单安全机制。仅限OpenClaw环境,通用性稍受限,但工程完成度很高,运维场景实用。
实测为纯指导型文档(808行SKILL.md),无任何可执行脚本或代码实现,声称的工业级六层记忆、多智能体协同、隐私加密等功能均无落地细节,仅提供话术和规则描述,api_key字段为占位符。框架思路可作记忆规则参考,但'工业级引擎'名不副实,严重过度包装。
实测init和pitfall命令可跑通,踩坑记录、准则提炼、遗忘衰减、自动蒸馏等功能设计完整(命令体系丰富)。但stats命令实测报KeyError: rule_usage错误,核心统计功能不可用,稳定性欠佳。作为Agent自我改进框架思路好,bug修复后值得更高分。
实测用自带sales_data.csv生成mckinsey风格报告成功:自动识别3维度4指标1时间线,生成18KB含ECharts交互图表的HTML报告,描述统计、趋势、相关性分析齐全,11种专业风格可选。输出可直接浏览器打开,交付体验好。是目前评测中完成度最高的数据分析技能。
实测describe和query两种模式均跑通:DuckDB引擎分析CSV速度快,中文列名、中文标点能自动纠错(实测将中文逗号转英文)。缺点是SQL中文别名会报引号解析错误,表名默认为data不传参易踩坑,README对参数说明不够。整体可用,适合SQL用户做快速数据分析。
indicators.py纯标准库实现,实测用120行模拟K线跑通,输出KDJ(18,3,3)/MACD/MA/ATR/量比JSON,无第三方依赖。SKILL.md流程专业:多周期定势(周线→日线→60分钟)→缠论结构(分型/笔/中枢/背驰/买卖点)→指标共振→点位计算→固定报告模板,references缠论要点+指标细则详实。缺点:缠论结构判断仍靠LLM,脚本只算指标不识别笔/中枢,A股分析类技能同质化竞争激烈。
generate_report.py实测跑通:8实体7关系JSON→生成1MB交互式HTML报告(力导向图/桑基图/雷达图等11模块,ECharts内联),8类实体/8类关系本体框架设计专业,JSON字段规范明确。缺点:首次运行需从CDN下载ECharts,并非完全离线;领域极其垂直(产权监管),普通用户上手门槛高;脚本不自带LLM抽取,输入JSON需先人工/模型预抽取。
generate_card.py实测跑通,用内置比亚迪示例数据成功生成HTML研判卡片(6大模块:形态标签/信号/指标/资金流向/操作指引/关键价位)。缺点明显:脚本只是渲染器,数据获取明确依赖外部stock-data-skill,脱离该skill无法独立工作;示例数据硬编码,未提供数据采集代码,独立可用性打折,SKILL.md称'不依赖外部API Key'但技能耦合度高。
带main.py+template.xlsx+requirements的完整工程,实测跑通:JSON输入→生成2页PDF(第1页报销单含裁剪区、第2页明细+汇总),中文大写金额、差补40元/天自动计算、替代发票逻辑、金额精度处理均正确。支持记账表/JSON两种输入、模板可替换,原创性强。缺点:依赖LibreOffice/openpyxl等环境,发票需用户自行提供,无发票合并场景未验证。
指导型技能+4个reference(平台规则/爆款公式/拆书模板/AI率诊断),方法论完整:8步流程+可选AI率诊断分支。平台规则具体(番茄看开头500字钩子+前三章留存、盐选重情绪反转),爆款公式含书名三要素法+平台差异+校验清单,强调证据优先、禁止编造。缺点:无脚本,依赖搜索/浏览器采集真实榜单,数据获取成本高,输出质量受外部数据可得性制约。
指导型技能+9个知识库reference,本次评测中知识最扎实。覆盖广府源流、饮食、粤剧、建筑、民俗、武术名人、粤语教学、港澳华侨、旅游路线;粤语知识库专业(九声六调调值表、Jyutping、-p/-t/-k入声、'三碗细牛腩面'例串),5种回答模式路由(问答/教学/场景演练/测验/旅游规划)。缺点:依赖LLM按索引查库,文件多检索成本高,易变信息需人工核实。
纯prompt咨询型技能,无脚本无知识库文件。专业度高:9种GEO优化方法效果排名(引用权威+40%、加数据+37%等)、四平台差异诊断(ChatGPT/Perplexity/Google AI Overview/国内)、快速-中期-长期分层策略、可引用段落模板+FAQ Schema JSON示例、四层ROI漏斗追踪。模拟企业GEO诊断场景步骤完整可执行。缺点:与GEO Pro功能高度重叠,偏理论,缺落地工具与案例库。
实测用附带sample_data成功渲染出1080x4105px六屏长图,cover/grid/content/positions/steps/ending六种版式齐全,文字清晰排版规整无乱码。纯Pillow本地渲染不依赖浏览器和API,装好依赖即可跑。缺点:仅内置商务蓝一种主题,需手写JSON分屏,对非技术用户门槛略高。
实测:35KB单文件HTML模板完整可交付,内含cropperjs裁剪、jszip打包、PNG透明水印/JPG文字水印边缘识别、3:4和1:1预设比例、前后对比等全部功能,纯浏览器本地处理隐私性好。仅生成工具不直接处理图片,需用户自行操作,且依赖CDN需联网。批量去水印场景实用性强。
实测check_invoice.py参数校验通过(validate-only模式),14种发票类型枚举齐全,支持图片识别和手动输入双通道。但脚本走第三方SCF代理网关,真实查验需外部服务配合且无发票样本难以全链路验证;安全报告标记MEDIUM风险。整体框架完整,适合报销场景,建议补充离线测试样例。
实测通过:python scripts/review_engine.py 跑通示例输入,能输出主线推进对比表、杠杆率判断和五选一动作建议,连续复盘会对比上周快照。区分可见产出与外部结果信号的设计很严谨,杜绝杜撰数据。缺点是纯脚本生成固定骨架,结论仍依赖宿主Agent判断。作为周复盘指导工具质量高,实用性强。
纯prompt型改写技能,无脚本。结构清晰:AI味浓度评分(0-100)→痕迹检测列表→人类化改写→修改点说明+字数对比,分论文/作文/公文/自媒体/邮件5场景给出差异化改写规则,交互规则9条,细化到'AI味低于20分仅给少量建议'。模拟输入三段式文本,检测与改写思路可执行。缺点:无落地工具,改写质量全看LLM,'100%保留原意'难量化保证,同类技能较多。
v2.0纯prompt指导型技能,无脚本。亮点:轻量/全量/分批/单平台深度4种生成模式解决token超限,新增视频GEO优化、竞品策略分析、效果追踪,含6个完整示例(含A/B标题、meta description)。三层语义矩阵+E-E-A-T框架系统完整。缺点:与同类GEO技能同质化高,产出质量完全依赖LLM,无脚本支撑,'自定义平台'置信度管理偏理想化。
纯prompt指导型技能,无脚本但方法论扎实:六步决策流程(进球线→中杆基线→期望走位区→杆法对照→力度→风险检查)+12个典型球型案例库,references含杆法技法/球桌视角图/案例详解。模拟'直线球下一颗在母球后方'场景,输出低杆缩杆+6点位下1皮头+力度建议,逻辑自洽。支持照片输入识别。缺点:依赖LLM看图能力,无工具脚本,判断有主观性。
带真实Python计算脚本的精益生产工具,实测用示例数据跑通:3台机台输入720分钟总投入/计划停机/当机分项/产出/不良/CT,自动输出时间稼动率、性能稼动率、良品率、OEE和价值稼动时间,还做了七大损失拆解(计划损失300min、当机135min、性能损失326min、质量损失5min)和机台OEE排名。计算结果我手工复核过,三率相乘=OEE完全一致,准确性没问题。术语体系规范(负荷时间/稼动时间/净稼动时间层级清晰),支持多机台汇总,对精益咨询和工厂TPM推进很实用。缺点是改善建议依赖LLM生成,脚本本身只做计算,但作为OEE计算引擎质量很高。
导诊型技能,模拟三甲医院护士长风格。最有价值的是急症识别模块——胸痛/中风FAST/急腹症等红旗症状会第一时间要求打120,不耽误救治,这个优先级设计很专业。问诊流程完整:先排查急症→只指路不看病→具体到能执行→承认不确定,还能科普医保报销和报告解读。我实测了"肺结节6mm磨玻璃影挂什么科",回答会明确挂呼吸内科、带CT片子、空腹去,并说明复查频率。缺点是依赖Agent按SKILL.md执行,建议本身不会更新,且对罕见病/复杂病情覆盖有限,医疗场景仍需以医生判断为准。
实战型视频提示词方法论,最值钱的是角色锁定/环境锁定/光线锁定三块机制——解决了AI视频跨场景角色变形和多镜头光线跳跃两个最大痛点。张謇写实人物锁定块、3D卡通鸽子锁定块都是可直接复用的模板,踩坑案例真实具体("背后拍摄变纯背面""浓眉变硬汉"这些我都遇到过)。豆包/LibTV/可灵/Runway多平台适配和镜头语言速查表也很实用。缺点是纯说明书型,无脚本自动化,需要自己消化方法论后手动操作,但作为专业方法论参考价值很高。