一、AI 不"听",它"看"
❌ 误区:AI 像人一样"听"懂声音
你听到"你好",你理解的是"这是一个问候"。AI 没有这个理解。
AI 做的事:把声音变成一张"图",然后找规律。
对,你没听错——AI 处理声音的方式,和处理图片的方式一模一样。
你说话的时候,声音变成一条曲线(波形)。AI 把这条曲线切成小片段,每个片段变成一张"小图"。然后它看这些"小图"的形状,找规律。
"你好"的波形长什么样?"谢谢"的波形长什么样?AI 看了几千个"你好"和几千个"谢谢"之后,它发现:"你好"的波形开头有一个特定的起伏,"谢谢"的波形结尾有一个特定的衰减。
它不是"听懂"了。它是记住了"你好"的波形长什么样。
💡 啊哈时刻
语音识别的本质 = 声音波形 → 图像(频谱图)→ 图像分类。
你在图像分类课里学到的所有东西——数据质量、过拟合、泛化——100% 适用于语音识别。学了一种,另一种就通了。
二、声音怎么变成"图"?
人说话的声音,在数学上就是一条随时间变化的曲线。AI 不能直接看这条曲线(太长了,1 秒声音有几万个数字)。所以它先做一个"翻译":
🎨 声音的"照片"——频谱图
AI 把声音切成很多小段(每段 20 毫秒,比眨眼还快),然后看每段里"哪些频率的声音比较强"。
这个结果画出来,就像一张彩色热力图:横轴是时间,纵轴是频率,颜色越亮 = 这个频率在这个时刻越响。
不同声音的"长相"完全不同:
- 🐦 鸟叫:高频区域有密集亮斑
- 🌧️ 下雨:中低频区域持续均匀
- 🔨 敲桌子:瞬间一个亮斑然后消失
- 🗣️ 说话:中频区域有复杂的起伏图案
所以 AI 做的事就是:看这张"声音的照片",判断这是什么声音。跟看图认猫狗一模一样。
三、AI 语音识别在生活中哪里能看到?
你每天都在用(只是不知道)
智能音箱
"小爱同学,放首歌"——AI 识别你的声音 → 理解指令 → 执行
手机语音输入
打字太慢?说一句话,AI 变成文字
医院心电监护
AI 实时分析心跳声音,异常时报警
工厂机器监控
AI 听机器运转的声音,发现"异响"就报警——提前知道机器要坏了
四、训练语音 AI 需要什么?(和图像分类一样)
🎧 数据(录音教材)
大量"贴了标签"的录音。每条录音都要告诉 AI"这是鸟叫""这是下雨""这是敲桌子"。
关键:至少 50 条录音,不同人、不同语速、不同环境。如果 50 条都是你一个人、正常语速、安静环境录的——那你的 AI 就只"认识"你的声音。换个人说话,它就傻了。
🧠 模型(大脑)
跟图像分类一样,选一个"大脑"来装规律。我们平台提供 CNN(基础款)和 CRNN(加强款,能理解声音的先后顺序)。
新手先用 CNN,够用。
🔁 训练(练习)
跟图像分类完全一样:AI 猜 → 数据说"错了" → AI 调整 → 再猜。几百万次之后,就是模型了。
💡 核心认知
图像分类、语音识别、文本分类——本质上是同一件事:分类。
输入不同(图片/声音/文字),但核心流程一样:把输入变成数字 → 找规律 → 输出一个类别。
学会一种,其他都通了。
📝 第1课小结(3 句话记住)
- AI 不"听"声音,它"看"声音的图(频谱图)——跟看图认猫狗是同一件事
- 语音识别 = 图像分类——只是"图片"换成了"声音的波形"
- 训练需要 3 样东西:录音数据 + 模型 + 训练(跟图像分类一模一样)