做畅译时踩过的坑
代码不开源,思路可以。这里记的是几次选型、几次返工、几个查错了方向的 bug,和当时是怎么想的。
说话人分离
说话人分离为什么会认错人
查了两周声纹模型,最后发现问题在更早的切分那一步
端侧部署端侧模型选型:好模型为什么上不了手机
调研推荐的方案最后没用,看起来该做的优化最后被砍掉
识别后处理识别出文字只是开始
固定时长切块为什么是错的,标点为什么要先剥掉再加一遍
交互设计机器改和人改会打架
用户改过的字被后台改回去,这种 bug 一次就够让人卸载
录音链路录一段音这件事,比我想的难得多
戴蓝牙耳机必崩、接个电话回来计时器还在走但没在录
崩溃排查只在真机 Release 才崩的 bug
开发机跑一万遍没事,装到手机上 75% 概率卡死
实时转写实时转写为什么会丢字
一场 5.6 分钟的录音,丢了 71% 的内容
数据安全差点把用户的会议记录清零
那段兜底代码我写的时候觉得挺稳妥的