flash reasoning
为快速模型或免费模型开启轻量推理思考模式,在尽量不增加耗时(目标比常规回复多约50%)的前提下提升稳定性,减少逻辑错误、上下文理解偏差和输出错别字。设计初衷有二:①让付费版快速模式(如Kimi快速版等)的思考质量更高;②更关键的是让外接API免费模型的用户也能享受高质量回复——例如接入免费的GLM-4.7-Flash API,模型本身智力上限无法提高,但通过提示词优化可显著提升输出稳定性与上下文理解准确度。两种触发方式:①语音输入(默认场景)——话里带"思考/深度思考/reason/think/让我想想"等词即自动触发,无需任何符号;②打字输入——说出上述关键词,或在消息末尾加「+」显式触发。前3步为内部轻量思考不输出,仅将润色后的结果发送给用户。