Transcribbit-Froschmaskottchen zuckt zusammen, während ein Handy eine aufgenommene Sprachnachricht abspielt
Recherche
7 min read

Warum du deine aufgenommene Stimme hasst: Die Wissenschaft

Von Kyle RProduct

Warum du deine aufgenommene Stimme hasst: Knochenleitung filtert dabei die Bässe raus. Eine Studie von 1966 nannte dieses Unbehagen Voice Confrontation.

Warum du deine aufgenommene Stimme hasst, hat zwei ganz unterschiedliche Gründe – und keiner davon heißt, dass deine Stimme wirklich schlecht klingt. Der eine ist Physik: Durch Knochenleitung klingt die Stimme in deinem Kopf etwas bassiger, während eine Aufnahme diesen Bass nicht mit aufnimmt. Der andere ist Psychologie: eine dokumentierte Reaktion, die Forscher 1966 Voice Confrontation nannten.

Wahrscheinlich kennst du dieses Gefühl aus einer ganz alltäglichen Situation: Deine Mailbox-Ansage wird abgespielt. Ein Freund schickt ein Video von einer Feier, und da bist du, mitten im Gespräch. Oder eine Sprachnachricht, die du gerade geschickt hast, wird am anderen Ende noch einmal abgespielt – und die Stimme aus dem Lautsprecher klingt wie eine leicht nasale Imitation von dir selbst. Diese Reaktion ist so verbreitet, dass Forscher ihr schon Jahrzehnte vor dem Smartphone einen Namen gegeben haben.

Hier ist, was tatsächlich passiert, aufgeteilt in den Teil, den du deinem Schädel anlasten kannst, und den Teil, den du deinem Gehirn anlasten kannst.


Kurzantwort

FrageKurze Antwort
Warum klingt meine aufgenommene Stimme anders?Normalerweise hörst du dich selbst über Luft und Knochen. Eine Aufnahme erfasst nur den luftgeleiteten Teil.
Ist die Aufnahme falsch?Nein. Es ist die Version, die alle anderen schon immer gehört haben.
Hasst wirklich jeder seine aufgenommene Stimme?Nicht so sehr, wie die meisten denken. Eine Studie von 2013 fand heraus, dass Menschen ihre eigene Stimme attraktiver bewerten, wenn sie nicht wissen, dass sie ihre eigene ist.
Was ist Voice Confrontation?Der 1966 geprägte Begriff für das Unbehagen, die eigene Stimme in einer Aufnahme zu hören.

Grund eins: Knochenleitung verändert unmerklich, was du hörst

Wenn jemand anderes spricht, erreicht dich der Schall nur auf einem Weg. Die Worte gehen durch die Luft, bringen dein Trommelfell zum Schwingen, und dein Gehirn verarbeitet das als Klang. Dieser Weg heißt Luftleitung – und das ist das gesamte Signal, wenn du jemand anderem zuhörst.

Wenn du selbst sprichst, bekommst du gratis ein zweites Signal dazu. Deine Stimmbänder und Atemwege vibrieren, und diese Schwingungen gelangen durch die Knochen und das Weichgewebe deines Schädels direkt zu deinem Innenohr – zusätzlich zu dem luftgeleiteten Schall, den alle anderen hören. Martin Birchall, Professor für Laryngologie am University College London, beschrieb diese Überlagerung gegenüber Time so: „Wenn wir sprechen, ist es, als würden alle den Klang über Lautsprecher hören, während wir ihn durch ein ganzes Höhlensystem im eigenen Kopf wahrnehmen“ [1].

Knochen spielen hier aus einem bestimmten Grund eine Rolle: Sie übertragen tiefe Frequenzen effizienter als hohe. Laut der Zusammenfassung im Wikipedia-Artikel zur Knochenleitung nehmen Menschen ihre eigene Stimme deshalb tiefer und voller wahr als andere; der Schädel leitet tiefe Frequenzen besser als Luft. Eine Aufnahme der eigenen Stimme klingt dadurch oft höher als erwartet [2].

Das ist schon der ganze Trick. Ein Mikrofon nimmt nur das luftgeleitete Signal auf – dasselbe, das deine Kollegen und Freunde jeden Tag hören. Spielst du es ab, fehlen die Bässe, die dein Schädel unmerklich beigesteuert hat. Was übrig bleibt, klingt dünner und höher als die Stimme, die du dein ganzes Leben lang kennst. Die Aufnahme hat nichts verzerrt. Sie zeigt dir genau das Signal, das alle anderen längst kennen, nur ohne deinen privaten Bonuskanal.

Die zwei Signale im Vergleich

Die Stimme in deinem KopfDie aufgenommene Stimme
Weg zum OhrLuftleitung plus KnochenleitungNur Luftleitung
BässeVom Schädel verstärktNicht vorhanden
Wie es für dich klingtTiefer, voller, wärmerDünner, höher, manchmal näselnd
Wer hat sie sonst je gehörtNiemandAlle anderen, schon immer

Grund zwei: die Psychologie der Voice Confrontation

Der Unterschied durch die Knochenleitung erklärt, warum eine Aufnahme anders klingt. Aber er erklärt nicht vollständig, warum du beim Anhören zusammenzucken kannst. Auch dafür gibt es einen Namen – und eine Studie.

1966 veröffentlichten die Psychologen Philip S. Holzman und Clyde Rousey „The Voice as a Percept“ im Journal of Personality and Social Psychology. Darin untersuchten sie, wie Menschen darauf reagieren, sich selbst auf einer Aufnahme zu hören [3]. Die von ihnen beschriebene Reaktion, heute meist Voice Confrontation genannt, ist das Unbehagen darüber, den Klang der eigenen aufgenommenen Stimme nicht zu mögen. Meist erklärt man es mit der Enttäuschung zwischen der Stimme, die du erwartest, und dem, was du beim Abspielen tatsächlich hörst [3].

Holzman und Rousey argumentierten, dass das Unbehagen nicht nur mit der Akustik zu tun hat. Einen Teil führten sie auf sogenannte „extra-linguistic cues“ zurück: Eigenschaften, die eine Aufnahme offenbart und die du an dir selbst sonst kaum bemerkst, etwa Nervosität, Zögern, Traurigkeit oder Gereiztheit [3]. Eine Aufnahme legt etwas von dir offen, das du beim Sprechen im Moment selbst nicht mithörst. Du erwartest deine Worte – aber nicht, wie nervös oder monoton du dabei geklungen hast.

Hinter der Überraschung steckt außerdem ein Wiedererkennungsproblem. Menschen verbringen sehr wenig Zeit damit, ihrer eigenen Stimme losgelöst vom Sprechen zuzuhören; deshalb wird das mentale Bild unscharf. In einer Folgestudie von 1967 derselben beiden Forscher konnten nur 38 % der Teilnehmenden eine Aufnahme ihrer eigenen Stimme innerhalb von fünf Sekunden erkennen [4]. Wenn dein Gehirn die Aufnahme beim ersten Hören kaum als deine eigene erkennt, ergibt auch das Zusammenzucken beim Klick auf „Play“ mehr Sinn.

Birchall bringt die zugrunde liegende Falle schlicht auf den Punkt: Wer jahrelang nur die knochengeleitete Version hört, kalibriert sein Bild der eigenen Stimme auf ein Signal, das sonst niemand empfängt. Deshalb kann sich die Aufnahme zugleich fremd und enttäuschend anfühlen [1]. Derselbe Bericht weist darauf hin, dass diese Diskrepanz für Menschen mit Körper- oder Geschlechtsdysphorie ein echtes, anhaltendes Problem sein kann: Wenn die aufgenommene Stimme nicht zum eigenen Selbstbild passt, ist das weit mehr als ein kurzer Moment Fremdscham [1].

Wenn dich das Abspielen deiner eigenen Nachrichten ohnehin dazu bringt, die ganze Sache am liebsten zu überspringen, bist du damit nicht allein. Wir sind der Frage nachgegangen, warum der Aufwand des Zurückhörens manchen Menschen schon den Play-Button verleidet. Das ist eine verwandte, aber eigenständige Reaktion auf dasselbe zugrunde liegende Unbehagen.


Der Twist: Du hasst deine Stimme wahrscheinlich weniger, als du denkst

Hier wird das Bild etwas komplizierter: Ein Teil des Unbehagens hat vielleicht gar nichts mit dem Klang zu tun.

2013 veröffentlichten Susan M. Hughes und Marissa A. Harrison eine Studie in der Fachzeitschrift Perception. Sie spielten Teilnehmenden verschiedene aufgezeichnete Stimmen vor und baten sie, deren Attraktivität zu bewerten, ohne zu verraten, dass die eigene Stimme unbemerkt darunter war. Die Teilnehmenden bewerteten ihre eigene Stimme als attraktiver als andere Zuhörer sie bewerteten – und auch attraktiver als die Stimmen aller anderen [5].

Wenn Menschen nicht wussten, dass sie sich selbst hörten, gefiel ihnen ihre Stimme durchaus. Das zeigt etwas Wichtiges: Ein beträchtlicher Teil des Unbehagens liegt gar nicht an der Akustik. Es ist die Selbstbeobachtung, die genau in dem Moment einsetzt, in dem du die Stimme als deine eigene erkennst. Nimm diese Wiedererkennung weg, und dieselbe Aufnahme wirkt nicht mehr bedrohlich.


Was das konkret für deine Sprachnachrichten bedeutet

Im Alltag trifft all das heute vor allem bei Sprachnachrichten zusammen. Davon werden täglich Milliarden verschickt, wie die von WhatsApp veröffentlichten Zahlen in unserer Zusammenfassung der Sprachnachrichten-Statistiken zeigen. Eine Sprachnachricht aufzunehmen heißt, absichtlich die reine Luftversion deiner Stimme zu erzeugen. Sie abzuspielen heißt, ihr jedes Mal zu begegnen, wenn du auf „Play“ drückst.

Die Physik sorgt dafür, dass die Aufnahme höher und dünner klingt, als du erwartest. Und bei vielen Menschen löst das Abspielen genau das Zusammenzucken aus, das Holzman und Rousey vor sechzig Jahren beschrieben haben.

An zwei Dinge solltest du dich erinnern. Erstens: Die Aufnahme ist die zutreffende Version. So kennen deine Freunde deine Stimme, und sie fanden sie nie seltsam – denn sie hatten nie Zugang zu der knochengeleiteten Version, der du vielleicht gerade nachtrauerst. Zweitens: Ein gutes Stück des Unbehagens hat mit Selbstbeobachtung zu tun, nicht mit dem Klang. Die Attraktivitätsstudie von 2013 belegt genau das [5].

Wenn dich das Abspielen deiner Stimme trotzdem jedes Mal zusammenzucken lässt, gibt es einen einfachen Ausweg: Lies die Worte, statt dir die Aufnahme noch einmal anzuhören. Ganz auf Audio zu verzichten löst nebenbei ein verwandtes Problem für die Person, die die Nachricht bekommen hat: Audio ohne Transkript kann die andere Person bei allem, was lang oder verrauscht ist, tatsächlich zurücklassen. Genau diese Lücke schließt Transcribbit: Es macht aus einer Sprachnachricht sauberen Text, damit du prüfen kannst, was du wirklich gesagt hast, ohne die Aufnahme noch einmal hören zu müssen. Starte kostenlos und schick deine nächste Nachricht als Text und Audio zugleich.


Häufig gestellte Fragen

Warum klingt meine aufgenommene Stimme höher und anders, als ich erwarte?

Weil eine Aufnahme nur den luftgeleiteten Teil deiner Stimme erfasst. Wenn du sprichst, hörst du dich zusätzlich über Knochenleitung. Die überträgt tiefe Frequenzen und lässt deine Stimme für dich voller und tiefer klingen als für alle anderen. Fehlt dieser Bassanteil – genau das passiert bei einem Mikrofon –, klingt die Aufnahme dünner und höher, als du es gewohnt bist [2].

Ist die Aufnahme oder meine eigene Wahrnehmung genauer?

Die Aufnahme ist genau. Sie entspricht exakt dem, was andere Menschen hören, wenn du mit ihnen sprichst, denn sie empfangen ausschließlich das luftgeleitete Signal. Die vollere Stimme in deinem Kopf ist die Version, zu der sonst niemand je Zugang hatte, weil der knochengeleitete Bassanteil deinen eigenen Schädel nie verlässt [1][2].

Was genau ist Voice Confrontation?

Das ist der Begriff, den Philip Holzman und Clyde Rousey 1966 in einer Studie für das Unbehagen prägten, die eigene aufgenommene Stimme zu hören. Ein Teil davon entsteht aus der Lücke zwischen Erwartung und Realität. Ein anderer Teil kommt von den sogenannten „extra-linguistic cues“: Eigenschaften wie Nervosität oder Zögern, die eine Aufnahme offenbart, die du an dir selbst beim Sprechen normalerweise nicht bemerkst [3].

Hasst wirklich jeder seine aufgenommene Stimme?

Nicht in dem Maß, wie die meisten annehmen. Eine Studie von Hughes und Harrison aus 2013 fand heraus, dass Menschen, denen nicht gesagt wurde, dass ihre eigene Stimme in einer Auswahl von Aufnahmen enthalten war, diese als attraktiver bewerteten als andere Zuhörer. Ein Großteil des Unbehagens scheint eher aus dem Erkennen der eigenen Stimme zu stammen als aus dem Klang selbst [5].

Kann man seine eigene aufgenommene Stimme wirklich nicht erkennen?

Nicht zuverlässig und nicht schnell. Eine Studie von Rousey und Holzman aus 1967 ergab, dass nur 38 % der Teilnehmenden eine Aufnahme ihrer eigenen Stimme innerhalb von fünf Sekunden erkennen konnten [4]. Die meisten Menschen verbringen viel mehr Zeit mit Sprechen als damit, sich selbst zuzuhören. Deshalb beruht ihr mentales Bild der eigenen Stimme auf einer unvollständigen Stichprobe.

Beeinflusst das, wie Menschen über das Verschicken von Sprachnachrichten denken?

Ja. Dieselbe Physik und Psychologie greifen, sobald du eine Sprachnachricht statt eines Telefonats aufnimmst. Beim Abspielen begegnest du dann auf Knopfdruck der reinen Luftversion deiner Stimme. Das ist ein wichtiger Grund, warum manche Menschen lieber ein Transkript lesen, als sich die Aufnahme noch einmal anzuhören – eine Lücke, die Transcribbit schließt.


Fazit

Warum du deine aufgenommene Stimme hasst, ist kein Rätsel mehr, sobald du die beiden Ursachen voneinander trennst. Knochenleitung verändert tatsächlich, was du beim Sprechen hörst. Deshalb klingt die Aufnahme immer dünner und höher als die Stimme in deinem Kopf – das ist reine Anatomie. Voice Confrontation ist das separate, gut dokumentierte Unbehagen, zu erkennen, dass du selbst auf der Aufnahme zu hören bist. Es wurde erstmals 1966 benannt und ist seitdem in der Forschung belegt.

Der wichtigste Punkt zum Mitnehmen ist der Befund von 2013: Menschen bewerten ihre eigene Stimme positiver, wenn sie nicht wissen, dass es ihre ist [5]. Die Aufnahme war nie das Problem, sondern die Wiedererkennung. Das zu wissen lässt das Zusammenzucken nicht ganz verschwinden. Aber du kannst aufhören anzunehmen, die Aufnahme würde dich anlügen. Sie ist die einzige Version deiner Stimme, die alle anderen je gehört haben – und sie hat sie nie gestört.


Quellen

  1. Why Do I Hate the Sound of My Own Voice? (Time, 2017) - time.com
  2. Bone conduction (Wikipedia) - en.wikipedia.org
  3. Voice confrontation (Wikipedia, citing Holzman & Rousey, 1966, Journal of Personality and Social Psychology) - en.wikipedia.org
  4. Recognition of one's own voice, Rousey & Holzman, 1967, Journal of Personality and Social Psychology, 6(4), 464-466 - pubmed.ncbi.nlm.nih.gov
  5. I Like My Voice Better: Self-Enhancement Bias in Perceptions of Voice Attractiveness, Hughes & Harrison, 2013, Perception - journals.sagepub.com