我平时整理社媒视频时,最受不了的一件事是:为了把一段视频变成能搜索的文字稿和能直接使用的字幕,往往要先下载视频,再找转写工具、整理段落、区分说话人、调整字幕,最后还要换一个工具导出。于是我把这套流程做成了 HiTranscript 。
现在只要粘贴一个公开的 Instagram 、TikTok 或 YouTube 视频链接,就可以同时得到: 带逐词时间戳的文字稿 自动整理的说话人段落 适合阅读的 Transcript 视图 Standard 和 Social 两种字幕视图 TXT 、DOCX 、PDF 、SRT 、WebVTT 等导出文件 也可以直接上传本地视频或音频。需要处理很多视频时,还能把不同平台的链接放在同一个批次里,最后合并导出为 TXT 、CSV 或 XLSX 。
我自己最满意的地方,是 HiTranscript 不会只把模型返回的一大段文字直接扔给用户。它会利用逐词时间数据重新整理段落和字幕片段;检测到不同说话人时,还会生成可以重命名、合并的说话人标签。
转写结果可以直接搜索、复制和修改,不需要再搬到其他工具里重新整理。目前底层使用 Whisper Large V3 ,支持 99 种语言。
对下面这些场景应该会比较有用: 整理访谈、播客和公开视频 从社媒视频里提取资料 给短视频制作 SRT 或 WebVTT 字幕 把视频内容整理成文章、笔记或研究材料 批量归档 Instagram 、TikTok 和 YouTube 内容 收费方式我也尽量做得简单:新用户有 5 个免费 credits ,之后按需购买,没有订阅和自动续费;失败的转写任务不会扣 credits 。当然,它目前也有明确的边界: 只处理能够正常访问的公开内容 不会绕过登录、私密、会员、地区或年龄限制 背景噪声很大、多人同时说话或口音较重时,仍然建议人工检查 说话人的声音差异不明显时,不一定会自动生成说话人标签 这是我最近投入最多、也最满意的一个项目。
我想做的不是又一个只能输出大段文字的 AI 套壳,而是一个从视频链接到可读文字稿、可用字幕和最终导出的完整工作区。如果你平时需要整理 Instagram Reels 、TikTok 或 YouTube 视频,欢迎试试: /ai-market-guide/ 也很想听听大家的真实意见,尤其是字幕分段、说话人识别和导出流程,还有哪些地方用起来不够顺。