🎙️
免费试学

语音识别入门

6课时 · 零基础 · 不写代码 · 已开放前2课时

AI是怎么"听"的?

🤯 先问你一个问题

你对着手机说"打开灯",它真的"听懂"了吗?

答案是——没有。它不知道"打开灯"是什么意思。它只是发现"这几个声音的波形长这样",然后执行了"开灯"的指令。

这就是 AI 语音识别的真相。今天 8 分钟,搞懂它。

🎯 学完这课你能做到

  • 知道 AI"听"声音的本质——不是"听",是"看声音的图"
  • 知道语音识别和图像分类其实是同一件事
  • 知道训练语音 AI 需要什么
  • 准备好下一课亲手训练一个语音 AI

一、AI 不"听",它"看"

❌ 误区:AI 像人一样"听"懂声音

你听到"你好",你理解的是"这是一个问候"。AI 没有这个理解。

AI 做的事:把声音变成一张"图",然后找规律。

对,你没听错——AI 处理声音的方式,和处理图片的方式一模一样。

你说话的时候,声音变成一条曲线(波形)。AI 把这条曲线切成小片段,每个片段变成一张"小图"。然后它看这些"小图"的形状,找规律。

"你好"的波形长什么样?"谢谢"的波形长什么样?AI 看了几千个"你好"和几千个"谢谢"之后,它发现:"你好"的波形开头有一个特定的起伏,"谢谢"的波形结尾有一个特定的衰减。

它不是"听懂"了。它是记住了"你好"的波形长什么样。

💡 啊哈时刻

语音识别的本质 = 声音波形 → 图像(频谱图)→ 图像分类。
你在图像分类课里学到的所有东西——数据质量、过拟合、泛化——100% 适用于语音识别。学了一种,另一种就通了。

二、声音怎么变成"图"?

人说话的声音,在数学上就是一条随时间变化的曲线。AI 不能直接看这条曲线(太长了,1 秒声音有几万个数字)。所以它先做一个"翻译":

🎨 声音的"照片"——频谱图

AI 把声音切成很多小段(每段 20 毫秒,比眨眼还快),然后看每段里"哪些频率的声音比较强"。

这个结果画出来,就像一张彩色热力图:横轴是时间,纵轴是频率,颜色越亮 = 这个频率在这个时刻越响。

不同声音的"长相"完全不同:

  • 🐦 鸟叫:高频区域有密集亮斑
  • 🌧️ 下雨:中低频区域持续均匀
  • 🔨 敲桌子:瞬间一个亮斑然后消失
  • 🗣️ 说话:中频区域有复杂的起伏图案

所以 AI 做的事就是:看这张"声音的照片",判断这是什么声音。跟看图认猫狗一模一样。

三、AI 语音识别在生活中哪里能看到?

你每天都在用(只是不知道)

🏠

智能音箱
"小爱同学,放首歌"——AI 识别你的声音 → 理解指令 → 执行

📱

手机语音输入
打字太慢?说一句话,AI 变成文字

🏥

医院心电监护
AI 实时分析心跳声音,异常时报警

🏭

工厂机器监控
AI 听机器运转的声音,发现"异响"就报警——提前知道机器要坏了

四、训练语音 AI 需要什么?(和图像分类一样)

1
🎧 数据(录音教材)

大量"贴了标签"的录音。每条录音都要告诉 AI"这是鸟叫""这是下雨""这是敲桌子"。

关键:至少 50 条录音,不同人、不同语速、不同环境。如果 50 条都是你一个人、正常语速、安静环境录的——那你的 AI 就只"认识"你的声音。换个人说话,它就傻了。

2
🧠 模型(大脑)

跟图像分类一样,选一个"大脑"来装规律。我们平台提供 CNN(基础款)和 CRNN(加强款,能理解声音的先后顺序)。

新手先用 CNN,够用。

3
🔁 训练(练习)

跟图像分类完全一样:AI 猜 → 数据说"错了" → AI 调整 → 再猜。几百万次之后,就是模型了。

💡 核心认知

图像分类、语音识别、文本分类——本质上是同一件事:分类。
输入不同(图片/声音/文字),但核心流程一样:把输入变成数字 → 找规律 → 输出一个类别。
学会一种,其他都通了。

📝 第1课小结(3 句话记住)

  • AI 不"听"声音,它"看"声音的图(频谱图)——跟看图认猫狗是同一件事
  • 语音识别 = 图像分类——只是"图片"换成了"声音的波形"
  • 训练需要 3 样东西:录音数据 + 模型 + 训练(跟图像分类一模一样)
下一课 → 训练你的第一个语音AI

训练你的第一个语音AI

⚡ 这节课你会亲手做一件事

训练一个 AI,让它区分 50 种不同的声音:鸟叫、下雨、敲桌子、汽车、婴儿哭……

30 秒训练,不写代码,点 3 个按钮。

训练完,你对着麦克风说一句话,AI 就能告诉你"这是什么声音"。

走,开始。

🎯 学完这课你能做到

  • 亲手训练一个语音分类 AI(30 秒)
  • 用麦克风实时测试 AI 的识别能力
  • 理解 CNN 和 CRNN 的区别(人话版)
  • 知道为什么 50 类比 10 类更难

一、认识 2 种"大脑"

平台上提供 2 种模型,听着很吓人,其实很简单:

🧠 CNN(基础款)

就像图像分类里用的 ResNet18。它看声音的"频谱图",找图案规律。

优点:快、简单、够用
缺点:不理解"先后顺序"("先敲门后说话"和"先说话后敲门"在它看来差不多)

新手建议:先用 CNN。

🧠 CRNN(加强款)

CNN + 循环网络。除了看"图案",还看"顺序"——就像你听一句话,不仅听每个字,还听语序。

优点:能理解时间顺序,效果通常更好
缺点:训练更慢

什么时候用:CNN 效果不够好时,再换 CRNN 试试。

二、开始训练(真的只要 30 秒)

  1. 选数据集:下拉菜单选 ESC-50
    ESC-50 是什么? 50 种环境声音(鸟叫、下雨、敲桌子、汽车、婴儿哭、狗叫……),每种 40 条录音,共 2000 条。是语音识别入门最经典的"教材"。
  2. 选模型:选 CNN(基础款,够用)
  3. 设置轮数:epochs = 10
  4. 点"开始训练"
    第一次会自动下载 ESC-50 数据集(约 56MB)。之后缓存在本地 data/esc50/ 目录,不用重复下载。

三、看 AI 怎么"学听"

第 1 轮 — AI 猜对了 9%(跟瞎猜差不多)
第 2 轮 — 猜对了 15%(开始有感觉了)
第 5 轮 — 猜对了 42%(超过 1/4 了!)
第 10 轮 — 猜对了 62%(每 10 个对了 6 个)

✅ 训练完成!

📊 为什么 62% 听起来比图像分类的 74% 低?

因为类别多了。图像分类是 10 类(瞎猜也有 10%),语音识别是 50 类(瞎猜只有 2%)。从 2% 提到 62%,进步其实非常大。

就像考试:10 道题选对 7 道 = 70 分。50 道题选对 31 道 = 62 分。后者的难度远大于前者。

四、实时测试:对着麦克风说一句话

训练完了,来最爽的部分——

  1. 点"实时识别" — 打开麦克风
  2. 制造一个声音 — 拍手、敲桌子、或者播放一段鸟叫
  3. 看结果 — AI 会告诉你"这是拍手声,置信度 85%"

🧪 真实测试场景

你拍了一下手:

AI 说:"拍手声 — 85% | 敲门声 — 8% | 其他 — 7%"

对了。85% 的置信度,说明它"很确定"。


你敲了两下桌子:

AI 说:"敲桌子 — 72% | 拍手声 — 15% | 其他 — 13%"

还是对了,但置信度降了——因为敲桌子和拍手的声音确实很像。这就是真实的 AI:大多数时候靠谱,但偶尔会"看走眼"。

五、常见问题

Q:CNN 和 CRNN 到底选哪个?

A:先用 CNN。它快、简单,效果已经够用。如果 CNN 的准确率你不满意,再换 CRNN 试试。CRNN 能理解"先后顺序",对复杂场景(比如区分"先敲门后说话"和"先说话后敲门")会更好。

Q:50 类太多了,能只练几类吗?

A:能!后续课程会教你自定义数据集——比如只练"鸟叫""下雨""敲桌子"3 类,准确率会高很多。就像你只考 3 道题,比考 50 道题容易。

Q:我的声音能被识别吗?

A:能!第 5 课专门教你用自己的录音训练 AI。录 50 段你的语音,训练一个"你的声音识别器"——发微信语音时,AI 自动帮你转成文字。

📝 第2课小结(3 句话记住)

  • 训练语音 AI 和训练图像 AI 是同一件事:选数据 → 选模型 → 点"开始训练"
  • CNN = 基础款(够用),CRNN = 加强款(理解顺序)——新手先用 CNN
  • 50 类比 10 类难,62% 准确率其实进步很大——从瞎猜 2% 到 62%,AI 已经"学会"了

🎉 恭喜!你已经完成了免费试学内容。

后续 4 课时将带你:

为什么 AI 会"听错" → 3 个技巧准确率翻倍 → 用自己的声音训练 → 毕业项目:异常声音检测(工厂机器故障预警)

想让学生也体验 AI 语音识别的乐趣?

预约免费产品演示,了解完整的AI教育实训方案

联系我们