2012年2月,计算机科学背景的作者Daniel Wilkerson在arXiv提交了一篇论文,编号1202.4212,标题直译是《和声解析:迈向音乐科学理论的进展》。他的核心主张是:用声学加认知计算的方式,重新解释大调音阶、标准和弦体系,以及大三和弦听着明亮、小三和弦听着忧郁背后的机制。论文2014年6月出过一版修订(v2),核心主张没变。

这篇论文力气最大的地方,是指出亥姆霍兹19世纪的协和理论有个说不通的地方。但要先说清楚证据等级:材料能确认的只是作者自己的论证和一份挂在arXiv上的预印本,没有实验数据,没有同行评审,也没有音乐学界采纳的痕迹。它更适合当成一个可以拿去检验的认知框架,不是已经成立的音乐科学定律。

亥姆霍兹的漏洞,和Wilkerson想补的东西

亥姆霍兹的解释建立在"拍频"和泛音列上:几个音同时响,频率越接近整数比例,音与音之间的拍音就越少,听起来越"协和";不协和只是拍音多、听感粗糙的另一种说法。这套逻辑用了一个半世纪。

Wilkerson的批评是,这套逻辑只能给声音排序好坏,却解释不了和声为什么会作为一种正面效果存在——按纯协和/不协和的逻辑,最省事的选择应该是只弹一个音,加音符只会让声音更接近"不那么协和"的一端。他认为问题出在,亥姆霍兹只算了物理声学,没算大脑作为一台"必须弄清声音从哪儿来"的机器,是怎么处理同时响起的多个频率的。

沿着这个思路,他重新推导了三件事,但原创性程度不一样:

推导内容早期先例原创性归属
大调音阶Helmholtz(1863)、George Birkhoff(1933)作者承认非首创
标准和弦词典材料中未见先例作者本人主张原创
大小三和弦情绪差异的解释材料中未见先例作者本人主张原创
和声推导的三次出手 1863 亥姆霍兹 大调音阶 1933 伯克霍夫 类似推导 2012 Wilkerson v1 arXiv提交 2014 Wilkerson v2 修订版本 大调音阶推导早有先例,标准和弦词典与三和弦情绪差异是作者自称的原创部分

认知计算说的是什么,能不能验证

论文里的逻辑是:大脑听到几个频率同时响起,得先判断这是一个声源发出的,还是好几个声源叠在一起。这类问题在听觉认知研究里有专门名字,叫"听觉场景分析",心理学家Albert Bregman在上世纪90年代就系统研究过。

Wilkerson的说法是,整数比例的频率关系更容易被大脑判断成"来自同一个声源",这种判断上的省力感,就是和声"好听"的来源;大小三和弦的情绪差异,他归因于这套判断机制里频率关系的细微区别,而不只是单纯的物理协和度。

但这仍然只是论文里的论证。材料没有提供任何实验数据来检验这个判断机制是否真的对应大脑活动,也没有跨文化、跨听众的验证。大三和弦听着"积极"、小三和弦听着"忧郁",本身也可能掺杂了听觉训练和文化背景,不能当成放之四海皆准的生理反应。

研究者该怎么用,音乐人不该怎么用

对音乐认知、计算声学和音乐理论研究者来说,这篇论文提供的是一个可检验的假设,不是可以照单全收的结论。真要用,该做的是拿听觉场景分析或和声知觉的现有实验数据去核对"整数频率比更容易被识别为同一声源"这类主张是否站得住;真要引用,也该等它进入同行评审期刊,而不是直接当成新研究的基础。

对关注和声原理的作曲者和音乐教育者来说,这篇论文用处有限。它解释的是"为什么",不是"该怎么写"。标准和弦体系怎么用、大小三和弦怎么配伴奏,该怎么教还怎么教,不需要因为一篇未经评审的预印本改动乐理课或创作习惯。

接下来值得盯的,是这篇论文有没有真正进入同行评审、有没有认知科学或音乐学者引用并做实验验证。十几年过去还停留在v2预印本,本身就是个不能忽略的信号。