Ethan AI Lab / Whisper Input

Whisper Input 图标
Whisper InputWINDOWS · V1.5.1

按住说话,松开就得到可以继续使用的文字。

它不是传统输入法,也不是会议记录软件。按下全局快捷键口述,软件完成语音识别、去口头语、结构整理或中文转英文,再把结果插入当前光标。

  • Windows
  • Cloud first
  • Apache-2.0
  • 用户词典
轻语输入当前界面总览1240 × 800
Whisper Input Windows 主界面

IN ONE SENTENCE

重点不是得到原始转写,而是得到能直接发出去的文字。

轻语输入适合聊天、写作、工作说明、任务拆解和中文口述后输出英文。它会去掉明显口头语、整理标点和层级,并尽量把结果插入光标位置;插入失败时自动复制到剪贴板。

它不会替你编造没有说过的背景。目标是忠实整理表达,而不是把语音变成新的聊天机器人。

INPUT FLOW

不切换窗口,也不打断正在写的东西。

  1. 按下全局快捷键在聊天框、文档、Issue 或任何当前输入位置开始口述。
  2. 发送到已配置的云端 ASR识别中文与工作场景中的英文术语。
  3. 按选择的风格整理原文、轻度润色、清晰结构或正式表达。
  4. 插入当前光标直接回到正在写的地方,不需要手动复制。
  5. 失败时复制到剪贴板即使目标应用不允许自动插入,也能拿到结果。
  6. 按设置保存历史在本机回看、复制或删除最近输入。

REAL INTERFACE

四张真实界面,分别回答状态、风格、模型和隐私。

这些图片来自当前 GitHub README,不是重新绘制的概念稿。

CORE CAPABILITIES

从说话到上屏,中间每一步都服务于“可用”。

01中文语音输入

适应中文为主、夹杂英文术语的工作口述。

02低延迟链路

停止说话后尽快识别、整理并插入。

03结构与正式表达

把多个口语要点整理成层级或工作文稿。

04中文转英文

用中文说清意思,直接生成英文邮件或 Issue。

05用户词典

保留人名、公司名、产品名与专业术语。

06剪贴板兜底

目标应用拒绝插入时,结果仍然可用。

FOUR OUTPUT STYLES

同一段口述,按用途整理成四种结果。

风格处理方式
原文保留原始表达,只补充断句与标点
轻度润色去掉口头语和重复词,保持原有顺序
清晰结构把多个事项整理为 1、1.1、2 的层级文本
正式表达转换为邮件、请示、反馈或交接说明

原始口述

第一把代码推上去,第二改 README,第三发安装包。

清晰结构

1. 推送代码
2. 更新 README
3. 发布安装包

DATA AND PRIVACY

这是 cloud-first 产品,设置页会明确告诉你数据去了哪里。

数据默认位置或去向
录音音频发送到用户配置的云端 ASR 服务
ASR 文本发送到用户配置的 LLM 服务进行整理
历史记录默认保存在本机,可清空
用户词典默认保存在本机,可编辑或清空
云端服务凭据Windows Credential Manager,可清除

当前主线不是离线 ASR。使用前需要按界面配置语音识别和文字润色服务,并理解相应服务商的数据政策与费用。

INSTALL AND USE

安装后只需要完成模型设置,就可以在任意输入位置开始说话。

  1. 从 GitHub Releases 下载最新版 Windows 安装包。
  2. 安装并启动轻语输入,进入“设置 - 模型设置”。
  3. 选择千问或豆包等 ASR,并配置一个文字润色模型。
  4. 设置全局快捷键和输出风格。
  5. 回到任意输入框,按快捷键开始口述。

PRODUCT BOUNDARIES

保持输入工具的定位,刻意不把它做成一套大平台。

  • 不注册 Windows 系统输入法,不接管系统 IME。
  • 不做会议记录平台,专注短到中长文本输入。
  • 不主动生成用户没有说过的信息。
  • 不加入 RAG 或 Agent 工作流,保持输入链路轻量。
  • 当前主线以真实可用的云端 ASR 为主,不宣传离线优先。

OPEN SOURCE

下载后,先用自己的真实表达试一次。

此页依据当前 README 整理,同步至 2026-08-30。模型支持、配置方式和安装资产以 GitHub 最新 Release 为准。