最近在几个项目里密集调 GPT 和 Claude 的 API ,踩了不少坑,分享几个通用的: temperature 不是“创造力旋钮” 写代码、抽取信息、分类:0–0.3 。头脑风暴、写文案:0.7–1 。
注意 reasoning 模型( o 系列)别手动调 temperature ,官方就不建议动。 system prompt 和用户输入别混一起 行为约束、角色设定、输出格式要求写 system ;用户输入只放 user 。
混在一起模型容易把用户输入当指令执行( prompt 注入就是这么来的)。要结构化输出就用 JSON mode 别靠“请返回 JSON 格式”祈祷,GPT 有 response_format=json_object ,Claude 让它用工具调用返回结构化结果,稳定得多。
流式输出别直接拼字符串 处理好 [DONE] 结束标记、截断( finish_reason=length )的情况,不然前端会吞字或者假死。 token 计费看的是“处理量” system 里塞几万字文档每次请求都全额计费。
考虑 RAG 只传相关片段,或者用 Claude 的 prompt caching ,重复的 system 内容能省一大半。多模型统一走 OpenAI-compatible 接口 现在 Claude 、GPT 、Gemini 都有兼容 OpenAI 格式的调用方式,换模型只改 base_url 和 model 名,业务代码不用重写,迁移成本极低。
欢迎补充你们的踩坑经验。