口语宝 · 产品与技术说明版

把表达、发音与
专业英语练清楚。

口语宝是一款离线优先的中英文训练应用:自由对话模式提供实时表达与发音反馈;训练中心提供可点读、可跟读的发音和专业英语课程。专业词卡以翻译、标准发音、核心作用和原理解释帮助初学者理解术语所在的知识语境。

Windows 桌面端本地流式 ASR中英文训练专业术语离线点读可选云端精转离线声音分析
01

产品摘要

一句话定位、目标用户和核心价值。

01

一句话定位

一个把实时表达反馈、发音训练和专业英语点读放在同一训练中心的离线优先工具。

02

目标用户

面试与复试考生、职场汇报者、教师与培训师,以及学习流程模拟、Aspen EO、APO / ROMeo、石油炼制工程的初学者。

03

核心价值

实时训练知道怎么说;专业词卡知道术语是什么意思、怎么读,以及它在工艺或模型中为什么重要。

产品边界:口语宝不是医疗或心理诊断工具,也不声称替代专业语言教师或工程设计审查。专业词卡用于语言学习和原理理解,不提供在线控制、优化回写或现场操作指令。
02

问题与产品定位

为什么普通转写和一次性 AI 点评不够。

现有方案的断点

  • 转写工具只记录内容,不解释表达质量。
  • 课程提供方法,但缺少真实开口时的即时反馈。
  • 一次性 AI 报告容易主观,且无法证明建议有效。
  • 只分析文字会忽略停顿和音量等声音表现。

口语宝的切入点

  • 本地实时识别,降低等待与网络依赖。
  • 把问题拆为用词、结构、证据、语速和声音表现。
  • 用点读词卡连接术语的翻译、发音、核心作用与原理。
  • 优先展示可复核指标,不依赖神秘综合分。
03

完整训练闭环

每一步都对应用户可以执行的动作。

STEP 01

自由开始表达

默认无需选题即可开口;面试、汇报等训练方向与中英文题库作为可选辅助。

STEP 02

实时表达

边说边显示字幕和动态统计,及时提示填充、犹豫、笼统表达与语境问题。

STEP 03

训练总结

离线生成文本和声音两类指标;联网时可追加云端精转与大模型报告。

STEP 04

同题复练

保留题目和训练重点,比较前后变化,并写入长期成长看板。

04

技术架构

桌面采集、本地推理、规则分析与可选云端能力分层解耦。

交互层
自由训练与可选题库
实时字幕与问题高亮
专业词卡与主题筛选
离线点读与原页跟读
↓ Electron IPC:隔离渲染进程与本地能力
音频层
麦克风降噪 / 回声消除
AudioWorklet 100ms 分块
真实采样率 → 16kHz
PCM 缓存与 WAV 编码
↓ 连续低延迟音频流
本地智能层
Sherpa-ONNX 流式 Paraformer
分层表达词库
结构 / 证据信号检测
停顿 / 发声 / 音量分析
↓ 用户主动开启后才进入云端
云端增强层
OpenAI 兼容音频精转
语境化实时建议
六维表达报告
多服务商可配置
↓ 本地保存
数据层
训练逐字稿
统计与声音指标
训练报告
复练关系与趋势
05

可解释指标体系

不把不同概念硬压成一个分数,让用户知道指标从哪里来。

指标定义与计算训练意义数据来源
每百词问题数(填充词 + 犹豫词 + 笼统词) ÷ 总字词数 × 100衡量表达中的干扰性词语密度。逐字稿 + 分层词库
表达密度(总字词数 − 填充词 − 犹豫词) ÷ 总字词数 × 100观察表达是否被口癖与犹豫大量占用。逐字稿
结构信号统计“首先、因为、因此、最后”等结论、理由、递进和收束提示。判断表达是否存在可跟随的组织线索。逐字稿规则
证据信号统计案例、经历、数据、百分比等具体支撑。提醒用户把抽象观点落到可验证内容。逐字稿规则
语速总字词数 ÷ 有效录音时长 × 60发现明显过快或过慢的表达节奏。逐字稿 + 时长
有效发声占比检测为发声的 20ms 音频帧 ÷ 全部音频帧 × 100观察大量空白是否破坏表达连贯性。原始音频
长停顿统计首尾有效发声之间超过 0.6 秒的内部静音段。区分有意识停顿与影响理解的长空白。原始音频
音量稳定性计算有效发声音频帧的分贝标准差。提醒用户保持稳定的麦克风距离和发声强度。原始音频
06

隐私与联网边界

核心训练可离线,云端能力明确、可选、可回退。

本地默认能力 无需 API Key

  • 中英文实时语音识别
  • 问题词高亮与词库分析
  • 专业词卡筛选、搜索与离线标准音点读
  • 结构和证据信号检测
  • 语速、发声、停顿与音量分析
  • 本地历史记录

用户可选能力 主动配置后启用

  • 云端精转:停止录音后发送整段音频
  • 云端 AI 点评:发送逐字稿文字生成实时建议
  • 更深入的多维表达报告
  • 多家 OpenAI 兼容服务可切换
  • 云端失败时保留本地结果
  • API Key 不写入安装包,未配置时不发送文字
07

当前限制与路线图

主动说明边界,明确当前能力范围与后续规划。

当前限制

  • 本地 ASR 在强噪声、重口音和专业名词场景仍可能出错。
  • 结构与证据信号是启发式检测,不能替代人工语篇评价。
  • 声音指标反映节奏与稳定性,不等同于完整发音评分。
  • 成长趋势用于个人训练参考,不等同权威考试评分。
  • 发布渠道、自动更新与代码签名仍在规划中。

风险控制

  • 本地实时结果可由云端精转纠正。
  • 展示原始指标,避免把模型输出包装成绝对事实。
  • 云端失败保留本地结果,保证核心训练仍可离线运行。
  • 音频与逐字稿文字的云端流向分别显示。
  • 历史记录保留删除入口和本地存储边界。
近期

用户验证

  • 完成小规模前后测
  • 校准语速与停顿阈值
  • 优化专业热词
中期

训练课程化

  • 连续任务与阶段目标
  • 个性化训练计划
  • 教师与教练端
远期

多模态表达

  • 发音与韵律模型
  • 视频姿态与眼神
  • 多人模拟面试
↑ 回到顶部