Sprachassistenten: Wie schlau ist mein Auto wirklich?
Shownotes
Autos verstehen längst mehr als einfache Befehle. Dank künstlicher Intelligenz beantworten sie Fragen, planen Routen und reagieren immer natürlicher auf ihre Fahrer. Doch wie intelligent sind diese Systeme wirklich schon und wie nah sind wir damit der Vision eines Autos, das mehr ist als nur ein Fahrzeug? Einen Einblick in diese Entwicklung gibt in dieser Folge Sabine Wüst, Head of AI and Group Digital Assistant bei Cariad, dem Software-Unternehmen des Volkswagen-Konzerns, das Technologien für Marken wie VW, Audi und Porsche entwickelt.
Außerdem geht es in dieser Folge um die Frage, ob es stimmt, dass Frauenstimmen wirklich tiefer geworden sind.
Hier könnt Ihr die Aha-Folge darüber hören, was unsere Stimme über uns verrät: https://open.spotify.com/episode/4s0ulz1qVSR2z49y7qhKYq
Quelle Intromusik: Knight Rider Opening Theme - Original Show Intro https://www.youtube.com/watch?v=5BsFnk83NMI
Hier findet Ihr die Studio zum Thema Frauenstimmen: HNO Leipzig https://d-nb.info/1195464207/34 https://pmc.ncbi.nlm.nih.gov/articles/PMC5832520/
Produktion: Serdar Deniz Redaktion: Antonia Beckermann
Noch mehr "Aha!"- Folgen gibt es bei WELTplus und Apple Podcasts. Alle zwei Wochen am Montag eine neue Folge. Hier bei WELT hören: https://www.welt.de/podcasts/aha-zehn-minuten-alltags-wissen/plus246844328/Noch-mehr-Alltagswissen-Aha-Bonus-Folgen-fuer-Abonnenten-Podcast.html.
"Aha! Zehn Minuten Alltags-Wissen" ist der Wissenschafts-Podcast von WELT. Wir freuen uns über Feedback an wissen@welt.de.
Impressum: https://www.welt.de/services/article7893735/Impressum.html Datenschutz: https://www.welt.de/services/article157550705/Datenschutzerklaerung-WELT-DIGITAL.html
Transkript anzeigen
00:00:02: Na, woran denkt ihr, wenn ihr diese Musik hört?
00:00:05: Ich hoffe jedenfalls, dass ich nicht die einzige bin, die jetzt an Night Rider denkt.
00:00:09: Die Serie mit David Hasselhoff aus den Achtzigern!
00:00:12: Und wenn ihr euch jetzt fragt, warum ich genau diese Musik für diese Folge ausgesucht habe – das hat nichts mit Hasselhoff zu tun sondern mit Kit, seinem sprechenden, denkenden Auto, was ihm immer wieder in der Serie das Leben gerettet hat.
00:00:25: Damals war das Science-Fiction.
00:00:27: heute Es ist ganz normal, dass wir über Sprachassistenten mit unseren Autos kommunizieren.
00:00:32: Ich möchte in dieser Folge herausfinden wie das funktioniert und was in Zukunft alles möglich sein wird.
00:00:38: Und auch in unserer Rubrik geht es um die Stimme.
00:00:41: Wir klären ob es stimmt, dass Frauenstimmen wirklich tiefer geworden sind.
00:00:45: Hallo und herzlich willkommen euch ein zu dieser Folge von Aha!
00:00:48: Ich bin Antonia Beckermann.
00:00:49: Legen wir los, schneiden uns an und ab ins Auto.
00:00:53: Aha!
00:00:54: Zehn Minuten Alltagswissen Ein Podcast von Welt.
00:01:25: Wie nah sind wir heute also wirklich an Kit?
00:01:34: Und was erwartet uns in der Zukunft?
00:01:36: Das bespräche ich jetzt mit Sabine Wüst.
00:01:38: Sie ist Head of AI and Group Digital Assistant bei Cariat, dem Softwareunternehmen des Volkswagen-Konzerns das Technologien für Marken wie VW, Audi oder Porsche entwickelt und sie beschäftigt sich täglich damit, wie Sprachassistenten wirklich besser werden.
00:01:55: Hallo Frau Wüst!
00:01:55: Ich freue mich, dass ihr da seid.
00:01:57: Ja auch von meiner Seite.
00:01:58: Herzlich willkommen
00:01:59: Frau Wüst, wir haben ja in unserem Vorgespräch über Nightrider gesprochen.
00:02:02: Wie nah sind denn unsere Autos heute jetzt an Kit?
00:02:06: Also wir sind auf einem wirklich guten Weg bei dem Thema und ich glaube das ist ein bisschen das wo auch nachher ein bisschen genauer hingucken werden.
00:02:13: es hat sich in der Assistenzwelt einfach riesig was verändert und es gibt plötzlich Möglichkeiten über die wir noch vor ein paar Jahren geträumt haben und von daher ist der Weg zu so nem Fahrzeug sehr sehr nahe und sehr schnell erreichbar glaub ich.
00:02:26: Dann lassen Sie jetzt doch einmal so ein bisschen am Anfang anfangen und für Lein erklärt, wenn ich jetzt im Auto sage Ruf Ute an.
00:02:34: Was passiert dann reintechnisch?
00:02:36: Also der Fahrer gibt im Endeffekt den Wunsch an das System und in aller ersten Schritt wird dann die Sprache in Text übersetzt und meine Intention also das was ich möchte nämlich anrufen wird im Endefekt an das system gegeben.
00:02:48: Und in der alten Welt ist es so, dass dann so ein Art Matching stattfindet.
00:02:51: Also das man auf der einen Seite anrufen guckt wo habe ich da entsprechend einen Intent was sich dann weitergeben kann und darüber wird dann entsprechend ausgelöst dass das Zitophon klingelt und ich den Anruft tätige aber wirklich eine ganz sequenzielle Abarbeitung und man hat ganz viel Intenz bestehen damit der Sekunde nach und nach mit dem Fahrzeug interagieren kann.
00:03:13: Einfaches Sprachassistenten, die gibt es im Auto ja schon seit den Neunzigern und jetzt durch die Fortschritte mit künstlicher Intelligenz gab's dann in den letzten Jahren noch mal so einen richtigen Schub.
00:03:21: Was hat KI jetzt nochmal verändert?
00:03:24: Also vielleicht um wirklich da diesen Unterschied erlebbar zu machen.
00:03:27: also in der Vergangenheit war es so dass man wirklich als Entwickler antizipieren musste was will der Kunde denn darin sagen im Fahrzeug?
00:03:34: und von daher hat der Entwickler sich hingesetzt Hunderttausende im Endeffekt Befehle runtergeschrieben mit der Überlegung, was könnte der Kunde nach vorne hin entsprechen in diesem Fahrzeug sagen.
00:03:44: Und das ist natürlich begrenzt und die Welt des KI's hat genau dieses Thema eigentlich auf den Kopf gestellt.
00:03:50: Die ist nämlich plötzlich in der Lage zu verstehen... was ich entsprechend sage.
00:03:54: Also wir müssen keinen Intenz mehr schreiben, sondern das System an sich versteht, was sie eigentlich entsprechend haben will und am besten kann man das glaube ich mit so einem Beispiel entsprechend verstehen oder ein bisschen nachvollziehen, was eigentlich da entsprechend dahinter ist.
00:04:07: Und wenn man zum Beispiel mal die Fragestellung nimmt brauche ich einen Regenschirm am Zielort Da passiert das gleiche, wie wir vorhin auch schon hatten.
00:04:14: Im Endeffekt wird bei einer Frage aufgenommen.
00:04:16: aber im Gegensatz zu diesem Intent Matching ist es so dass wir jetzt in der KI-Welt angekommen sind und in der KAI Welt ist es ja so... Das ist dort ein LLM, das nennt sich Large Language Model kennt man OpenAIJPT und sowas mit dem jeder mittlerweile interagiert.
00:04:30: Und dieses LLM nimmt im Endeffekt diese Frage und zerlegt sie in der Hinsicht, dass sie sagt, oh Zielort.
00:04:37: Wo will er denn überhaupt hinfahren?
00:04:39: Regenschirm!
00:04:39: Man braucht dann eigentlich ein Regenschurm... ...und dann brauche ich natürlich noch die Informationen über Wetter.
00:04:44: Von daher ist das was dieses Llm macht und wir nennen es bei uns Orchestrator also er dirigiert am Endeffek dann diesen Satz an seine ganzen Experten, die er rundherum hat.
00:04:54: Er geht zum Navi-Experten, er geht zum General Knowledge-Experten und er geht zu einem Wetterexperten und holt sich dort die Informationen im Endeffekt zurück um dann in diesem Orchestrator wieder die Themen zusammenzusetzen und zu sagen Pum!
00:05:07: Also du brauchst keinen Regenschirm morgen weil es soll total sonnig werden an deinem Zielwort.
00:05:12: Und das ist so ein bisschen das, was sich einfach vollkommen verändert hat.
00:05:15: Kommen von etwas wo wir runter schreiben mussten, was der Kunde eigentlich sagen will zu einer vollkommen offenen Welt in der ich alle Fragen stellen kann und jetzt diese Intelligenz im System habe.
00:05:25: Der ist dann der Lage das zu zerlegen, was ich sage und an seine ganzen Experten viele kennen auch mittlerweile Begrifflichkeit Agenten hinzugehen und dort sich entsprechend die Informationen zu holen
00:05:36: Jetzt nochmal den Vergleich machen, auch mit Frühjahr.
00:05:37: Was können denn jetzt Sprachassistenten im Auto heute wirklich besser als vor fünf Jahren?
00:05:44: und was klappt vielleicht immer noch nicht?
00:05:46: Viele kennen ja so ein bisschen dieses.
00:05:48: ich habe dich leider nicht verstanden.
00:05:49: also genau dieses Thema ist einfach aus dieser LLM-Welt jetzt entsprechend behoben worden weil das ist ziemlich... fast immer versteht und in der Lage ist das Ganze entsprechend zu zerlegen.
00:06:00: Und auf der anderen Seite haben wir natürlich mit diesen Agenten plötzlich auch noch ein viel, viel breiteres Feld an Wissen was für unser Schlossen haben weil da sind die können in eine Websurge reingehen, die können für mich überall Anfragen starten, die könnt für mich gucken ob es einen Ticket gibt, ob es da irgendwie eine schöne Wanderung ist, sie können mir Geschichten erzählen.
00:06:17: also all das was diese Agenten dieses Experten entsprechend mitbringen kann ich plötzlich dem Kunden natürlich auch als Erlebnis im Fahrzeug der möglichen.
00:06:26: Also von daher sind da zwei Welten zusammengekommen, einerseits das ganz natürlich sprachliche dass ich ganz normal mit dem Fahrzeug interagieren kann und auf der anderen Seite aber natürlich auch ein Riesen-Explosion in Anführungsstrichen anwissen was einfach verfügbar ist, auf das sich zugreifen kann und dass ich in diesen Fahrzeugkontext entsprechend mit reinbekomme.
00:06:45: Und wo würden Sie sagen Mo Haags noch?
00:06:47: Was klappt noch nicht.
00:06:48: Ich würde sagen, es geht schon wirklich viel.
00:06:51: Das was zu den nächsten Themen sind ist dass sie noch stärker miteinander interagieren zum Beispiel die Agenten.
00:06:57: Dass ich da eine Durchgängigkeit und so etwas schaffe.
00:06:59: aber ich glaube das geht schon sehr viel und wir sind auf einem wirklich guten Weg eigentlich dieses Gesamterlebnis entsprechend zu schaffen.
00:07:06: Sie haben ja eben gesagt das Fahrzeug versteht uns jetzt schon richtig gut.
00:07:09: trotzdem gibt's immer noch manche Befehle die nicht so richtig zuverlässig laufen obwohl KI jetzt große Fortschritte gemacht hat.
00:07:15: woran liegt das?
00:07:16: Einerseits ist natürlich das System, setzt sich ja auch verschiedene Komponenten zusammen und von daher muss man natürlich sagen mal alle diese Komponenten in die neue Welt bringen.
00:07:25: Und von daher sind wir einfach aktuell schon... In der Transition aus dieser alten, in die neue Welt entsprechend rein.
00:07:31: und was man natürlich auch nicht vergessen darf ist.
00:07:33: Wir sind im Gegensatz zu einem Integration eines LLMs.
00:07:37: Sind die Systemen natürlich tief integriert in Fahrzeug?
00:07:40: Und von daher sind da noch mehr Abhängigkeiten drin als wir das vielleicht heute bei unserer Websearch in Anführungsstrichen bei irgendwelchen Recherchen im Internet erleben.
00:07:48: Frau Wüstich würde gerne nochmal ein ganz konkretes Thema aufmachen nämlich das Thema Verkehrssicherheit.
00:07:53: Können Sprachassistenten im Auto aus ihrer Sicht die Verkehrssicherheit verbessern oder könnte es so sein, dass sie am Ende sogar Ablenken zusätzlich in uns vielleicht ein ganz falsches Sicherheitsempfinden geben?
00:08:04: Also grundsätzlich glaube ich das Sprach-Assistenten schon unsere Verkehrssichheit verbessert.
00:08:09: In der Hinsicht, dass Sie einfach das Thema Ablenkung von der Straße reduzieren.
00:08:14: Also wir müssen einfach viel, viel weniger auf irgendwelche Dinge gucken reagieren sondern wir können mit Sprache und dem System interagieren und das ist natürlich beim Fahren ein absoluter Vorteil.
00:08:24: Nießt es so.
00:08:24: trotz glaube ich sind das mal schon auch die Herausforderungen die wir nach vornehin haben weil wir natürlich viel stärker interagiren können jetzt mit den Assistenten und von daher viel stärker auch den Fokus in die Richtung bringen müssen, zu verstehen, in welcher Situation wir gerade sind.
00:08:38: Wo vielleicht ein Assistent da noch mal ruhig sein muss, wo er sich in Anführungsstrichen zurücknehmen muss.
00:08:42: also von daher nach vornehin gerichtet, müssen wir immer mehr in die Diskussion des perfekten Beifahrer kommen und das ist auch das was einen Assistent eigentlich am Ende realisieren muss – zu verstehen welche Situation habe ich?
00:08:53: Und es besser jetzt einfach mal still zu sein!
00:08:55: Mit Verkehrssicherheit schon eines der kritischen Themen angesprochen.
00:08:58: Anderes ist natürlich das Thema Datenschutz, also wo es wirklich die Grenze zwischen hilfreich und vielleicht auch gruselig.
00:09:04: ab wann wird ein Assistent, der vielleicht dann zu viel über mich weiß?
00:09:07: Auch ein Datenschuzproblem!
00:09:09: Und wie lässt sich das lösen?
00:09:11: Ich glaube, setzt sogar noch ein bisschen vorher an und ich glaube auch dass das ein unglaublich wichtiges Thema ist gerade auch dieses Thema Guardrails setzen.
00:09:17: Also dieses Thema was ist denn mein Assistent?
00:09:20: Was darf er denn?
00:09:22: Welche Werte soll er auch verkörpern?
00:09:25: Was sind Dinge, die ich mit diesem Assistenten machen kann und die vielleicht nicht möchte, dass das mit diesen Assistentern gemacht wird.
00:09:32: Also sich wirklich intensiv damit auseinanderzusetzen welches Produkt ich eigentlich habe welche Möglichkeiten es auf der einen Seite bietet aber auf der anderen Seite klar zu verstehen was die Grenzen dieses Systems entsprechend sind.
00:09:45: Das ist so für mich die eine Geschichte und die andere Thematik bezüglich der Daten.
00:09:49: Da brauchen wir natürlich auch eine Datentransparenz, da muss es sein nach vorne hin weil wir ein Interesse haben immer mehr über den Kunden in Anführungsstrichen zu verstehen um nach vornhin pro aktive Rückmeldung etc.
00:10:00: zu geben wo es auf der anderen Seite aber die Transparenze gewährleistet sei dass der Kunde weiß Was wird über mich zusammengefasst?
00:10:06: Was weiß das System über mich?
00:10:09: und genauso die Möglichkeit zu haben, das möchte ich jetzt nicht.
00:10:11: Und ich möchte entsprechend meine Daten löschen im System.
00:10:14: Ich glaube diese zwei Dinge spielen ganz eng dort zusammen um am Ende wirklich auch einen sicheren vertrauensvollen Assistenten ansprechen anbieten zu können.
00:10:22: Wie sieht jetzt aus Ihrer Sicht die Zukunft aus?
00:10:24: also was sind so die nächsten großen Schritte?
00:10:27: Also ich glaube, da sind so ein paar Themen die einfach rausstechen.
00:10:30: Ein Thema wird immer mehr dieses Thema Empathie empathisch sein das Thema was wir eben gerade schon hatten personalisiert also zu wissen wen habe ich denn eigentlich auf der anderen Seite und das Thema durchgängiges Kundenerlebnis, also wirklich dieses Gesamterlebes zu schaffen.
00:10:46: Und für mich ist deshalb immer so dieses Bild dieses perfekten Beifahrers.
00:10:51: Wenn Kinder langsam unruhig lauter werden dann ist es vielleicht einfach dass er eine spannende Geschichte erzählt.
00:10:57: wenn ich ein Restaurant suche weiß er einfach dass ich gerne einen Salat haben möchte und dementsprechend schon das richtige Restaurant aussucht.
00:11:05: Und wenn vielleicht mein Problem nicht mit Sprache gelöst werden kann, sondern weil ich ein Video brauche, um es einmal zu erklären.
00:11:10: Dann zeige ich entsprechend das Video.
00:11:12: und von daher glaube ich ist das so ein Thema wo wir uns einfach weiter immer weiter entsprechend hin entwickeln und wo er aber auf der anderen Seite was ich vorhin meinte als perfekter Weihfahrer genauso weiß, boah da ist jetzt eine Verkehrssituation, dann bin ich jetzt einfach still und gucke dass entsprechend die Situation entsprechend gut funktioniert.
00:11:29: Und von daher würde ich sagen entwickeln wir uns dahin die Richtung immer weiter in Richtung Kit Und so weit weg ist es nicht mehr.
00:11:36: Das ist doch ein wunderschönes Schlusswort, ich danke Ihnen sehr Frau Wiest!
00:11:39: Der KI ist das ja ganz egal ob unsere Stimme hoch ist oder tief.
00:11:43: aber tatsächlich hat es im Alltag Auswirkungen und das hatte Folgen für die Stimmen von Frauen.
00:11:49: Stimmt es dass Frauenstimmen in den letzten Jahrzehnten tiefer geworden sind?
00:11:53: Darum geht es jetzt.
00:11:57: Warum ist das so?
00:11:59: Die kleine Alltagsfrage
00:12:02: Stimmen von Frauen werden ja meist eher als hoch, weich oder sanft beschrieben.
00:12:06: Tatsächlich sprechen aber mehrere wissenschaftliche Studien dafür, dass Frauenstimmen in den vergangenen Jahrzehnten im Durchschnitt tiefer geworden sind.
00:12:14: Stellt sich die Frage?
00:12:15: Warum?
00:12:17: Eine der bekanntesten Studien zur Entwicklung von Stimmfrequenz stammt von der Uniklinik Leipzig.
00:12:22: Dort haben Forscher die Stimmen mehreren Tausend Leipzigerinnen und Leipziegern untersucht.
00:12:26: Und das Ergebnis?
00:12:27: Frauen sprechen heute deutlich tiefer als Frauen der selben Altersgruppe noch vor wenigen Jahrzehnten.
00:12:33: Besonders auffällig war das Absinken der Sprechstimme zwischen dem zwanzigsten und dem vierzigsten Lebensjahr.
00:12:39: Um die Frage nach dem, warum zu beantworten haben die Forschenden erstmal biologische Faktoren geprüft.
00:12:44: also hat sich der Kehlkopf verändert, die Stimmlüppen spielen vielleicht Hormone Körpergröße oder Gewicht eine Rolle?
00:12:50: Nichts davon traf zu zumindest nicht in dieser jungen Alters Gruppe.
00:12:53: Rein biologisch werden Frauenstimmen im höheren Alter tiefer, insbesondere nach Terminopause.
00:13:00: Aber warum schon im Alter zwischen zwanzig und vierzig Jahren?
00:13:03: Einen Hinweis auf die wahrscheinliche Antwort auf diese Frage fanden die Forschenden in der Psychologie.
00:13:08: Psychologische Studien zeigen immer wieder dass Menschen mit tieferen Stimmen eher die Eigenschaften Kompetenz, Autorität, Vertrauen- und Durchsetzungsvermögen verbinden.
00:13:18: Wenn wir das im Hinterkopf behalten und uns dann die gesellschaftliche Veränderung von Rollenbildern in den letzten Jahrzehnten anschauen, dann wird ein Zusammenhang deutlich.
00:13:26: Frauen übernehmen heute deutlich häufiger Führungs- und Entscheidungsposition als noch vor einigen Jahrzehnten.
00:13:32: Wenn also tiefer Stimmen als kompetenter und autoritärer wahrgenommen werden, dann könnte das dazu beitragen dass Frauen ihre Stimme meist unterbewusst im Laufe ihres Lebens tiefer einsetzen – insbesondere eben zwischen dem zwanzigsten und dem vierzigsten Lebensjahr!
00:13:47: Ein prominentes Beispiel zeigt, dass Stimmen sogar ganz gezielt verändert werden können.
00:13:52: Die ehemalige britische Premierministerin Margaret Thatcher hat ihre Stimme vor ihrem Amtsantritt von einem Sprech-Trainer tiefer und resundanter ausbilden lassen – und das Ziel war in der Öffentlichkeit autoritärer zu wirken!
00:14:04: Egal ob hoch oder tief wie wichtig unsere Stimme ist und was sie über uns verrät, darüber habe ich in einer anderen Folge von AHA schon einmal mit einer Wissenschaftlerin gesprochen.
00:14:12: Den Link den stelle ich euch in die Show notes.
00:14:15: Und dann sage ich noch Danke an Elena Blüm, die sich für uns für diese Folge mit den tieferen Frauenstimmen beschäftigt hat.
00:14:21: Meine Stimme, die seid ihr jetzt erst mal wieder los für heute aber ich hoffe natürlich ihr seid auch bei der nächsten AHA-Folge wieder mit dabei!
00:14:27: Bis dahin sag' ich tschüss, bleibt gesund, bleibt neugierig und bis ganz bald.
Neuer Kommentar