已经实测了,可以用多模态,文字,语音,图像各种模型。响应大概 5 秒内能返回,挺快的,至于后续人多了会不会卡,现在还不确定,反正免费 Token 大家用力蹬起来。
活动链接大家可以用我的邀请链接: /ai-market-guide/ invite_code_v2=MODLTTUN 也让我沾沾光,哈哈 StepFun Step Plan API 模型测试报告 测试时间 :2026-09-20 11:38:39 CST (Asia/Shanghai)(报告更新于 2026-09-20 11:40:07 CST (Asia/Shanghai)) Endpoint : /ai-market-guide/ 认证 :Bearer ( box-secrets.json → card.STEPFUN_API_KEY ,全程脱敏,未写入本报告) 测试图 : /workspace/step-plan-test.png ( 200×80 PNG ,红色圆 + 标签 42 ) 摘要 类别 通过 失败 合计 文本冒烟 5 0 5 多模态视觉 2 0 2 视觉答案正确(含「 42 」) 2 0 2 总体判定 :通过 — 全部文本模型成功;视觉至少一次成功且答对 文本冒烟结果 提示词:要求精确回复 TEXT_OK (允许附带 reasoning ;判定:HTTP 200 且 assistant 内容非空或有可用输出)。
参数: max_tokens=96 , temperature=0 。模型 HTTP 延迟(s) finish_reason prompt completion total 内容摘要(~80) 成功 错误 step-5-preview 200 36.791 stop 22 23 45 TEXT_OK ✅ — step-3.7-flash 200 1.992 stop 23 56 79 TEXT_OK ✅ — step-3.5-flash 200 1.295 stop 23 62 85 TEXT_OK ✅ — step-3.5-flash-2603 200 1.398 stop 23 81 104 TEXT_OK ✅ — step-router-v1 200 1.452 stop 488 40 528 TEXT_OK ✅ — 多模态(视觉)结果 内容:text + image_url ( data URL base64 PNG , detail=low )。
问题:图中数字/标签是什么?只答该内容。
说明 :首次用 max_tokens=64 时,两模型 finish_reason=length , content 被截断在推理中间(未露出最终答案)。随后以 max_tokens=256 ( step-3.7-flash 另加 reasoning_effort=low )重试,均成功返回 42 。
下表为重试结果。模型 HTTP 延迟(s) finish_reason prompt completion total 内容摘要 成功 答对 42 备注 错误 step-3.7-flash 200 3.98 stop 462 56 518 42 ✅ ✅ max_tokens=256; reasoning_effort=low — step-5-preview 200 4.895 stop 202 65 267 42 ✅ ✅ max_tokens=256 — 首次视觉截断记录(供对照) 模型 HTTP 延迟(s) finish_reason completion 内容摘要(截断) step-3.7-flash 200 2.186 length 64 The user wants me to identify the number in the image. 1. * Analyze the image: step-5-preview 200 4.895 length 64 The user is asking what number or label is in the image. The image shows a pink/ 其他模型 跳过 step-image-edit-2:官方文档将其列为文生图/图像编辑模型,chat/completions 请求形态与快速冒烟路径不明确,为避免无效烧 token 未调用。
跳过 stepaudio-*:音频端到端模型需要 modalities/audio 等专用字段与音频样本,本次仅做文本与视觉冒烟。备注与选型 step-5-preview (文本) :可用;延迟约 36.791s ; HTTP 200 ;回复 TEXT_OK 。
step-3.7-flash (文本) :可用;延迟约 1.992s ; HTTP 200 ;回复 TEXT_OK 。 step-3.5-flash (文本) :可用;延迟约 1.295s ; HTTP 200 ;回复 TEXT_OK 。
step-3.5-flash-2603 (文本) :可用;延迟约 1.398s ; HTTP 200 ;回复 TEXT_OK 。 step-router-v1 (文本) :可用;延迟约 1.452s ; HTTP 200 ;回复 TEXT_OK 。
step-3.7-flash (视觉) :成功且识别到 42 ;延迟约 3.98s 。 step-5-preview (视觉) :成功且识别到 42 ;延迟约 4.895s 。
文档侧: step-3.7-flash 旗舰多模态推理,适合 agent/coding/视觉; step-3.5-flash / step-3.5-flash-2603 偏高速 agent/coding ; step-router-v1 为 Step Plan 智能路由( 不支持 图像输入); step-5-preview 文档示例支持图文。推理模型在视觉场景下建议 max_tokens ≥ 128–256 ,否则易在 reasoning 阶段被 length 截断;可用 reasoning_effort=low 缩短思考。
step-router-v1 本次纯文本正常,但 prompt_tokens=488 (明显高于其他 ~22–23 ),可能含路由侧额外上下文。错误原文(已脱敏) 本次最终结果无失败错误体(首次视觉仅为 length 截断,非 HTTP 错误)。
结论(日常使用推荐) 日常主力( agent/coding + 需要视觉) : step-3.7-flash — 文本 ~2s 级,视觉可正确 OCR ,建议配合 reasoning_effort=low/medium 与充足 max_tokens 。高频/省延迟文本与 agent : step-3.5-flash (~1.3s )或 step-3.5-flash-2603 (~1.4s ),本次均精确返回 TEXT_OK 。
质量优先预览 : step-5-preview 文本可用但冷启动较慢(本次 ~37s ),视觉正确;适合非延迟敏感任务。智能路由纯文本 : step-router-v1 可用;勿传图片(文档明确不支持)。
图像编辑 / 音频 :本次跳过;有专用需求再按官方 image/audio API 单独测。文本成功: step-5-preview , step-3.7-flash , step-3.5-flash , step-3.5-flash-2603 , step-router-v1 视觉正确: step-3.7-flash , step-5-preview 脱敏原始结果: /workspace/step-plan-test-results.json 、 /workspace/step-plan-vision-retry.json