口语宝 1.0 · 产品与技术说明版

把表达训练,
变成可验证的能力提升。

口语宝是一款离线优先的中英文 AI 表达训练桌面应用。产品同时处理逐字稿与原始音频,提供实时反馈、可解释指标、同题复练和长期成长证据。

Windows 桌面端本地流式 ASR中英文训练可选云端精转离线声音分析同题成长对比
01

产品摘要

一句话定位、目标用户和核心价值。

01

一句话定位

一位能在用户开口时发现表达问题、给出行动建议,并通过复练证明效果的实时表达教练。

02

目标用户

面试与复试考生、职场汇报者、销售与客服、教师与培训师、托福雅思口语学习者。

03

核心价值

让用户从“感觉自己表达不好”,走向“知道具体问题、知道下一步动作、看见第二次变化”。

产品边界:口语宝不是医疗或心理诊断工具,也不声称替代专业语言教师。它提供的是可解释、可重复的表达训练支持。
02

问题与产品定位

为什么普通转写和一次性 AI 点评不够。

现有方案的断点

  • 转写工具只记录内容,不解释表达质量。
  • 课程提供方法,但缺少真实开口时的即时反馈。
  • 一次性 AI 报告容易主观,且无法证明建议有效。
  • 只分析文字会忽略停顿和音量等声音表现。

口语宝的切入点

  • 本地实时识别,降低等待与网络依赖。
  • 把问题拆为用词、结构、证据、语速和声音表现。
  • 优先展示可复核指标,不依赖神秘综合分。
  • 通过同题复练和长期趋势证明训练效果。
03

完整训练闭环

每一步都对应用户可以执行的动作。

STEP 01

自由开始表达

默认无需选题即可开口;面试、汇报等训练方向与中英文题库作为可选辅助。

STEP 02

实时表达

边说边显示字幕和动态统计,及时提示填充、犹豫、笼统表达与语境问题。

STEP 03

训练总结

离线生成文本和声音两类指标;联网时可追加云端精转与大模型报告。

STEP 04

同题复练

保留题目和训练重点,比较前后变化,并写入长期成长看板。

04

技术架构

桌面采集、本地推理、规则分析与可选云端能力分层解耦。

交互层
自由训练与可选题库
实时字幕与问题高亮
训练总结与报告
同题对比与成长看板
↓ Electron IPC:隔离渲染进程与本地能力
音频层
麦克风降噪 / 回声消除
AudioWorklet 100ms 分块
真实采样率 → 16kHz
PCM 缓存与 WAV 编码
↓ 连续低延迟音频流
本地智能层
Sherpa-ONNX 流式 Paraformer
分层表达词库
结构 / 证据信号检测
停顿 / 发声 / 音量分析
↓ 用户主动开启后才进入云端
云端增强层
OpenAI 兼容音频精转
语境化实时建议
六维表达报告
多服务商可配置
↓ 本地保存
数据层
训练逐字稿
统计与声音指标
训练报告
复练关系与趋势
05

可解释指标体系

不把不同概念硬压成一个分数,让用户知道指标从哪里来。

指标定义与计算训练意义数据来源
每百词问题数(填充词 + 犹豫词 + 笼统词) ÷ 总字词数 × 100衡量表达中的干扰性词语密度。逐字稿 + 分层词库
表达密度(总字词数 − 填充词 − 犹豫词) ÷ 总字词数 × 100观察表达是否被口癖与犹豫大量占用。逐字稿
结构信号统计“首先、因为、因此、最后”等结论、理由、递进和收束提示。判断表达是否存在可跟随的组织线索。逐字稿规则
证据信号统计案例、经历、数据、百分比等具体支撑。提醒用户把抽象观点落到可验证内容。逐字稿规则
语速总字词数 ÷ 有效录音时长 × 60发现明显过快或过慢的表达节奏。逐字稿 + 时长
有效发声占比检测为发声的 20ms 音频帧 ÷ 全部音频帧 × 100观察大量空白是否破坏表达连贯性。原始音频
长停顿统计首尾有效发声之间超过 0.6 秒的内部静音段。区分有意识停顿与影响理解的长空白。原始音频
音量稳定性计算有效发声音频帧的分贝标准差。提醒用户保持稳定的麦克风距离和发声强度。原始音频
06

隐私与联网边界

核心训练可离线,云端能力明确、可选、可回退。

本地默认能力 无需 API Key

  • 中英文实时语音识别
  • 问题词高亮与词库分析
  • 结构和证据信号检测
  • 语速、发声、停顿与音量分析
  • 同题前后对比与成长看板
  • 本地历史记录

用户可选能力 主动配置后启用

  • 云端精转:停止录音后发送整段音频
  • 云端 AI 点评:发送逐字稿文字生成实时建议
  • 更深入的多维表达报告
  • 多家 OpenAI 兼容服务可切换
  • 云端失败时保留本地结果
  • API Key 不写入安装包,未配置时不发送文字
07

当前限制与路线图

主动说明边界,明确当前能力范围与后续规划。

当前限制

  • 本地 ASR 在强噪声、重口音和专业名词场景仍可能出错。
  • 结构与证据信号是启发式检测,不能替代人工语篇评价。
  • 声音指标反映节奏与稳定性,不等同于完整发音评分。
  • 成长趋势用于个人训练参考,不等同权威考试评分。
  • 发布渠道、自动更新与代码签名仍在规划中。

风险控制

  • 本地实时结果可由云端精转纠正。
  • 展示原始指标,避免把模型输出包装成绝对事实。
  • 云端失败保留本地结果,保证核心训练仍可离线运行。
  • 音频与逐字稿文字的云端流向分别显示。
  • 历史记录保留删除入口和本地存储边界。
近期

用户验证

  • 完成小规模前后测
  • 校准语速与停顿阈值
  • 优化专业热词
中期

训练课程化

  • 连续任务与阶段目标
  • 个性化训练计划
  • 教师与教练端
远期

多模态表达

  • 发音与韵律模型
  • 视频姿态与眼神
  • 多人模拟面试
↑ 回到顶部