第一部分 · 声音的物理
协和与音程:为什么简单整数比好听
上一课你拨响了一根弦,发现"一个音"其实是基频加上一整摞整数倍泛音。那里头藏满了简单整数比。这一课要回答:为什么偏偏是简单整数比,让两个音听起来"和",而不是"吵"?答案是物理的——但它会顺手挖出一个永远填不平的缺口。
留下的问题:为什么简单整数比会让两个音协和?这究竟是耳朵的习惯,还是声音本身的物理?
本课新增:读完你能说清协和的物理机制(泛音重合与拍音)、用音分给协和度量一把尺子,并亲手撞上一个致命缺口——纯五度一个个往上叠,永远叠不回整数倍的八度(毕达哥拉斯音差)。
一、两个音同响,比的不是基频,是它们的泛音
先把问题摆正。当你同时弹下两个音,耳朵到底在比较什么?
朴素的猜想是:比两个基频谁高谁低。但这解释不了"协和"——为什么 200 Hz 配 300 Hz 听着舒服,配 283 Hz 却刺耳?两组的频率差距其实差不多。真正的关键,藏在上一课那摞泛音里。
回忆一下:一个 200 Hz 的乐音,并不只有 200 Hz,它带着一整摞泛音——200、400、600、800、1000…(基频的整数倍)。另一个音也一样,带着自己那一摞。两个音同时响,空气里挤满了两摞泛音。耳朵真正在意的是:这两摞泛音对得上吗?
看一个干净的例子。取 f₁ = 200 Hz 和 f₂ = 300 Hz,它们成 3:2(纯五度,perfect fifth)。把两摞泛音并排列出来:
f₁ = 200:200 400 600 800 1000 1200 …
f₂ = 300: 300 600 900 1200 …
看见 600 和 1200 了吗?它们在两摞里同时出现——精确重合。简单整数比的两个音,会共享一大批泛音;频率越往上,重合点越密。这些重合的泛音像两个人不约而同地唱同一句词,声音锁在一起,浑然一体——这就是协和(consonance)的物理本相。
反过来,取一个复杂比,比如三全音(tritone)约 45:32。它的泛音几乎对不上,落在彼此的缝隙里,互相摩擦、打架——这就是不协和(dissonance)。结论很硬:比例越简单,重合的泛音越多,越协和;比例越复杂,重合越少,越粗糙。
"结论很硬"——硬到可以用耳朵当场验。下面把 12 个频率比排成一条阶梯:每一对音都是低音 220 Hz,加上一个按精确比例算出的高音;排序只有一条规则——分子×分母,从最小排到最大(1:1 → 2:1 → 3:2 → 4:3 → … → 45:32)。用管风琴的音色,是因为它有一摞干净的泛音,正好用来听"对得上还是对不上"。
你不需要懂任何乐理,就能听出这条渐变:前几对(1:1、2:1、3:2、4:3)几乎融成了一个声音;中间几对(5:3、5:4、6:5、8:5)饱满、柔和,仍然稳;越往后越"毛",最后几对(15:8、16:15、45:32)像两个音在互相推搡。(要老实说一句:这条阶梯并不是严格单调的——9:8、16:15 的"毛",一部分来自下一节要讲的另一个原因,两个音靠得太近;但大趋势一目了然:比值越复杂,越不协和。)
二、八度为何"几乎是同一个音"
最极端的协和是八度,比例 2:1。它协和到什么程度?两个相差八度的音,听起来像"同一个音的高低两版"——男声和女声唱同一句旋律,差的往往就是一个八度,你几乎察觉不到它们"不是一个音"。
用泛音一看就懂。200 Hz 的泛音是 200、400、600、800…;它高八度的 400 Hz,泛音是 400、800、1200…。高音那摞,整个是低音那摞的子集——没有一个泛音落空、没有一处摩擦。重合度达到了顶点,所以八度协和到近乎"合一"。
"听起来像同一个音"可以做成一个干净的对照实验。拿一句人人会哼的旋律——贝多芬《第九交响曲》终曲里那首《欢乐颂》的开头(E E F G | G F E D)——给它配一条影子:影子的每个音,都是原旋律对应那个音乘上同一个频率比。别的什么都不变,只换这个比例:先什么都不加,再依次换成 2:1(八度)、3:2(五度)、45:32(三全音)、16:15(小二度)。
八度的影子几乎不添任何东西:你听到的还是一条旋律,只是更亮、更厚了——刚才说的"男声女声唱同一句",就是这个效果。五度的影子仍然稳,带一点空旷的古风(中世纪早期的"奥尔加农"就是这么平行地唱四度、五度的)。到了三全音和小二度,每一个音都带着一团毛刺,两条线不再像"一条旋律的两个版本",倒像两个人在各唱各的。整件事里变的只有一个数字——这就是上面那条规则的现场验证。
这个"八度=同一个音名"的直觉极其重要,它马上会变成下一课的炸药:既然八度里两个音如此接近同一身份,那把一个八度切成几份、怎么切,就成了搭建整个音高系统的起点。先记住这一点。
三、拍音:两个音"差一点点"时,会一起呼吸
协和讲完了,再看不协和的另一面——这一面不靠泛音,靠两个基频本身。
设想两个频率很接近但不相等的纯音,比如 440 Hz 和 443 Hz。它们叠加时,波峰时而对齐(一起变响)、时而错开(互相抵消变弱),合成的声音整体响度会周期性地"涨—落—涨—落",像在缓缓呼吸。这种起伏叫拍音(beating),而它起伏的快慢——拍频——恰好等于两频率之差:
拍频 = |f₁ − f₂| Hz
443 − 440 = 3,于是你每秒听到 3 次"哇—哇—哇"的涨落。这不是玄学,调音师每天都靠它吃饭:把待调的弦和标准音同时响,听拍音,慢慢拧弦让拍频越来越慢,直到"哇哇"完全消失——那一刻两个频率精确相等,音就准了。拍音是耳朵自带的、灵敏到 1 Hz 的频率比较仪。
那拍音和协和是什么关系?当两个音很接近但凑不到精确的简单比时,它们的对应泛音之间就会两两打出一堆快慢不一的拍音。拍频慢(一秒几次)时你听成"颤动";拍频快到一定程度(大约每秒几十次、两音相距落在所谓临界频带内),耳朵里负责辨音的同一小段基底膜被两个音同时挤占,融不开也分不清,于是产生一种毛刺刺的粗糙感(roughness)——这正是"不协和"的生理解释(临界频带的细节这里点到为止)。简单整数比之所以听着平滑,部分原因正是:泛音要么精确重合(毫无拍音),要么离得足够远(落在粗糙区之外)。
最后那句最反直觉:两个音越拉越开,不是应该越来越不和吗,怎么"离得足够远"反而又平滑了?别争,直接听。下面把下面那个音钉在 440 Hz,上面的音从 441 Hz 开始,一步一步拉开(差 1、3、7、15、35、70、140 Hz),每一步停三秒钟。请专注听"响度的涨落"一步步变成别的什么:
具体的分界因人、因音量而异,但大致的次序人人相同:差几 Hz 时是缓慢的"呼吸",你甚至能数出拍子;到十几 Hz,涨落快得数不清,变成一种颤动;三四十 Hz 前后最粗糙,像一张砂纸;再拉开,粗糙退去,你开始分得清这是两个音——到差 140 Hz,它们各自清清楚楚,听上去反而干净了。这就是"粗糙区":它只存在于一个窄窄的间距范围里,往近了走是拍音,往远了走是两个分开的音。
四、音程探测器:亲手把比例拖到"锁定"
道理说再多,不如自己拖一遍。下面这个部件固定一个 220 Hz 的低音,你用滑块连续改变高音相对它的频率比(从 1.0 到 2.0,即一个八度之内)。慢慢拖:接近 3:2、4:3、5:4、2:1 这些简单比时,声音会"锁定"、变干净、变协和;偏开一点,拍音和粗糙感立刻冒出来。下方的刻度条画出两个音的泛音,重合处会高亮——你能看见协和。
玩过之后你会有个强烈的体感:协和不是一个个孤立的"好听点",而是一片地形——简单比是稳稳的山谷(低张力),它们之间的斜坡布满拍音与粗糙(高张力)。这片地形,就是后面所有和声张力的物理底座:协和=放松、想停留;不协和=紧张、想往协和处解决。张力与解决这台引擎,从这里就开始供电了。
五、给协和一把尺子:音分(cents)
"比例越简单越协和"是定性的。但作曲要量化——两个律制差了多少?某个音"走"了多少?频率比是乘法的(翻一个八度是 ×2,再翻一个是 ×4),直接相减没意义。我们需要一把加法的尺子。办法是取对数,把一个八度均匀切成 1200 份,每一份叫一个音分(cent):
某个频率比 r 对应的音分数 = 1200 × log₂(r)
于是:一个八度 = 1200 音分;十二平均律的半音 = 100 音分。这把尺子的好处是可加:八度套八度就是 1200 + 1200。人耳大约能分辨 5~10 音分的差别,所以"音分"刚好是描述"准不准、协不协"的合适刻度。记住它——下一段那个缺口,正要用音分才能说清有多大。
| 音程 | 纯比例 | 音分(纯) | 协和感 |
|---|---|---|---|
| 八度 octave | 2:1 | 1200 | 极协和(近乎合一) |
| 纯五度 fifth | 3:2 | ≈ 702 | 很协和 |
| 纯四度 fourth | 4:3 | ≈ 498 | 协和 |
| 大三度 major 3rd | 5:4 | ≈ 386 | 协和(明亮) |
| 小三度 minor 3rd | 6:5 | ≈ 316 | 协和(柔暗) |
| 三全音 tritone | ≈ 45:32 | ≈ 590 | 不协和(紧张) |
六、致命缺口:纯五度,永远叠不回八度
现在,把毕达哥拉斯那两千年前的发现推到尽头,看它如何把自己逼进死角。
他手里最趁手的两块积木是最协和的两个比:八度 2:1 和纯五度 3:2。一个自然的雄心是:只用纯五度,能不能"走遍"所有的音、最后干净地回到起点?做法是从一个音出发,一次次往上叠纯五度(每次 ×3/2),叠 12 次(这正是钢琴上转一圈"五度圈"、经过全部 12 个音名后理应回到出发音的高几个八度版本)。算一下叠 12 次的总比例:
(3:2)¹² = (3/2)¹² ≈ 129.746
而"回到出发音的高 7 个八度"应该正好是:
2⁷ = 128
两个数差一点点,但就是不相等:
129.746 ÷ 128 ≈ 1.0136 ≈ 23.46 音分
这个填不平的缝隙,就是毕达哥拉斯音差(Pythagorean comma)。它说的是一件让人不甘心的事:用最协和的纯五度一个个往上叠,永远落不到精确整数倍的八度上,总是高出约 23 音分。23 音分大约是四分之一个半音——人耳明显能听出来的"走音"。
23 音分到底有多大?别只当数字看,把它听出来。下面先把 12 个纯五度依次弹出来(每个音超出一个八度就折回来,免得越爬越高):一路是熟悉的五度圈 C G D A E B F♯ C♯ G♯ D♯ A♯ E♯,最后落在 B♯ 上。按理说转了一整圈,这个 B♯ 就该是出发的那个 C。然后:先单独听出发的 C,再单独听走完一圈的"C",最后让它们一起响。
单独听,两个"C"听上去差不多——要认真比较,才觉得后一个微微偏高;一起响,你立刻听到了熟悉的东西:拍音,每秒大约 3.6 次的"哇—哇—哇"(正是上面那条阶梯里"差 3 Hz"的那种呼吸)。也就是说,纯五度叠出来的"C",和真正的 C 之间,隔着一个一耳朵就能听出来的缺口。它不是算出来的幻觉,是纯五度这块积木天生的缺陷。
这正是毕达哥拉斯那条"美=整数"之路的尽头:整数比给了我们协和,却给不了我们一个能闭合、能自由转调的音高系统。两千年里,无数律制都在跟这 23 音分的缺口讨价还价——把它藏到哪个角落、分摊给谁、牺牲哪个调。
常见误解
- 误解:协和好听纯粹是文化习惯、是从小听出来的。 (澄清:协和有实打实的物理根据——简单整数比让大量泛音重合、避开粗糙区,这一点跨文化相当稳定。但"哪种音程承担什么情绪"、容忍多少不协和,确有很强的文化与经验成分。物理给地形,文化给路线,两者都要承认。)
- 误解:拍音是乐器坏了或音质差。 (澄清:拍音是两个相近频率叠加的正常物理现象,拍频 = |f₁−f₂|。它恰恰是调音的工具——听着拍音变慢直到消失,音就准了。)
- 误解:毕达哥拉斯音差是测得不够精确,算准了就没有了。 (澄清:它是纯数学的必然——3ⁿ 永远是奇数、2ᵐ 永远是偶数,二者不可能相等。再精密的仪器也消不掉这 23 音分。)
- 误解:音分是另一种频率单位。 (澄清:音分量的是"两个频率之比",是对数刻度——一个八度恒为 1200 音分,无论它在低音区还是高音区。它度量的是音程,不是绝对音高。)