Zum Inhalt springen
Co-Intelligence

// Transkript

#10: Voice AI im Unternehmen: 7 smarte Anwendungen für Sprache & Sound

Vollständiges Transkript dieser Episode des Co-Intelligence Podcasts. 5.117 Wörter. · Auf YouTube ansehen ↗

0:09 SPEAKER_00: Heute geht's

0:10 SPEAKER_00: wie wir mit KI Sound erstellen können.

0:15 SPEAKER_01: Die 3. Spannende Kategorie, für

0:16 SPEAKER_01: für mich eine der spannendsten, ist die Generierung von KI Songs, Sound Design.

0:21 SPEAKER_00: Es läuft mit und sagt danach, okay, welche Aufgaben sind aus diesem Gespräch entstanden? Also auch für mich superrelevant und hilfreich. Dadurch, wir den Song komplett KI generiert haben, haben wir sofort von der GMA die Bestätigung bekommen. Im Juni tritt das neue Gesetz in Kraft, dass alle Webseiten

0:37 SPEAKER_01: komplett barrierefrei sein müssen. Mit den neuen technologischen Möglichkeiten ist das Ganze deutlich einfacher.

0:50 SPEAKER_00: Willkommen zurück zum Cointelligent

0:52 SPEAKER_00: Podcast, jetzt schon in Episode 10.

0:56 SPEAKER_00: Heute geht's Sounds

0:57 SPEAKER_00: Sounds und wie wir mit KI Sound erstellen können,

1:00 SPEAKER_00: warum das für euch relevant ist im Unternehmensbezug, im Unternehmenskontext. Wir

1:04 SPEAKER_00: Wir haben euch 7 verschiedene Felder mitgebracht,

1:07 SPEAKER_00: in denen wir glauben, dass Sound Erstellung mit KI Sinn macht.

1:10 SPEAKER_00: Und wir werden die besprechen, werden dann in verschiedene Tools gehen und zeigen euch auch ein paar Demos

1:17 SPEAKER_00: von Tools, die grade ziemlich eine Edge sind und zeigen, was alles schon möglich ist.

1:23 SPEAKER_01: Genau, es geht Sound, es geht Sprache heute. Und die 1. Große Kategorie

1:29 SPEAKER_01: kann man, glaub ich, unter dem Begriff Sprachsynthese

1:32 SPEAKER_01: und Voiceovers

1:34 SPEAKER_01: betrachten.

1:35 SPEAKER_01: Da gibt's dann ganz viele, viele Unter Use Cases sozusagen im Unternehmen.

1:40 SPEAKER_01: Und zwar entweder eine Vertonung von Videos oder Social Media Videos

1:45 SPEAKER_01: oder beispielsweise auch von Präsentationen oder wenn ich Lerninhalte erstelle, so im E-Learning,

1:50 SPEAKER_01: ergibt's einfach Sinn,

1:52 SPEAKER_01: ja, Voices Stimmen sozusagen synthetisch zu generieren und dann möglicherweise auch zu internationalisieren.

1:59 SPEAKER_01: Und

2:00 SPEAKER_01: ja, eigentlich immer,

2:02 SPEAKER_01: wenn ich

2:03 SPEAKER_01: irgendwo eine Stimme oder ein Sound hinterlegen möchte, dann war das natürlich früher viel aufwendiger.

2:09 SPEAKER_01: Und heute mit den neuen

2:12 SPEAKER_01: technologischen Möglichkeiten ist das Ganze

2:14 SPEAKER_01: deutlich einfacher.

2:16 SPEAKER_00: Dazu kommt das ganze Thema Soundoptimierung,

2:19 SPEAKER_00: Audiooptimierung

2:20 SPEAKER_00: und Bearbeitung.

2:22 SPEAKER_00: Unser Sound wird hoffentlich auch immer besser,

2:24 SPEAKER_00: nicht nur, weil wir ein tolles Team haben, was uns hier hilft, sondern weil die auch Tools nutzen.

2:29 SPEAKER_00: Denn heute kann man mit KI Tools,

2:32 SPEAKER_00: Webinare,

2:33 SPEAKER_00: Podcasts,

2:34 SPEAKER_00: all das, was man schon irgendwo im Kasten hat, im Nachhinein verbessern.

2:38 SPEAKER_00: Rauschunterdrückung.

2:40 SPEAKER_00: Ich hab letztens sogar einen Use Case gesehen,

2:42 SPEAKER_00: da wurden Akzente, länderspezifische Akzente

2:46 SPEAKER_00: aus der Sprache rausgefiltert.

2:48 SPEAKER_00: Weiß nicht, man mein Nuscheln auch rausnehmen kann, aber vielleicht ja demnächst. Stimmt, das war der das war der Case oder für

2:55 SPEAKER_01: Callcenter,

2:56 SPEAKER_01: wo sie quasi, Callcenter sind ja relativ oft entweder auf den Philippinen, zumindest amerikanische

3:01 SPEAKER_01: Ja.

3:01 SPEAKER_01: Oder in Indien. Und dann haben die eben diese

3:05 SPEAKER_01: spezifischen Akzente dieser Länder rausgenommen, dass dann die Amerikaner denken, sie sprechen mit Amerikanern.

3:10 SPEAKER_01: Und das ist ja da

3:13 SPEAKER_01: sehr, sehr wichtig in den USA, vor allem zurzeit.

3:16 SPEAKER_01: Gut, in Deutschland macht's vielleicht auch Sinn, wenn wir mal den bayerischen Akzent oder andere Akzente rausnehmen, dass die Leute Hochdeutsch sprechen.

3:23 SPEAKER_01: Vielleicht können wir das auch mal über unseren Podcast legen,

3:26 SPEAKER_01: unsere regionalen

3:28 SPEAKER_01: Nuancen rauszunehmen.

3:29 SPEAKER_01: Oder wir reden einfach dann komplett bayerisch. Ich als Preußler rede dann bayerisch, das wär auch was. Ah ja, Hessisch könnte ich am liebsten. Hessisch publiziert. Können wir mal gucken. Weiter, hier kommt der KI Agent.

3:40 SPEAKER_00: So. Und das ist natürlich wichtig, wenn ihr im Unternehmen Sound aufnehmt, ja, dann erscheint das professioneller, wenn wenn das

3:47 SPEAKER_00: wenn die dann wenn die Rauschumgebung drin ist, wenn das Soundlevel besser ist, wenn man solche Verhasbler wie eben auch mit E-Vac machen kann. Genau. Ja, genau, wie Du sagst. Also 1. Kategorie ist Sounderstellung

3:58 SPEAKER_01: mit künstliche Sounderstellung, ob

4:00 SPEAKER_01: ob das Stimmen oder Töne sind. 2. Kategorie

4:02 SPEAKER_01: richtige

4:04 SPEAKER_01: richtigen Sound in Anführungsstrichen eben zu optimieren,

4:07 SPEAKER_01: Fehler rauszunehmen.

4:09 SPEAKER_01: Die 3. Spannende Kategorie, für mich eine der spannendsten und weil sie einfach am meisten Spaß macht, ist die Generierung

4:15 SPEAKER_01: von KI,

4:17 SPEAKER_01: also Generierung von KI Songs, von Musik,

4:20 SPEAKER_01: also Sounddesign.

4:21 SPEAKER_01: Egal ob das jetzt vielleicht ein neuer Jingle ist für mein Unternehmen

4:26 SPEAKER_01: oder für ein Werbespot oder wirklich ein,

4:29 SPEAKER_01: ja, einfach ein Song,

4:30 SPEAKER_01: den ich vielleicht generieren kann für mein Team. Das kann was Internes sein. Das kann auch was für Kunden sein, wenn ich weiß,

4:38 SPEAKER_01: einen auf den Kunden zugeschnittenen

4:40 SPEAKER_01: Song im b-two-b-Vertrieb

4:42 SPEAKER_01: erstelle, der was mit mir zu tun hat, je nachdem, in welcher Industrie ich bin und ich auch quasi mit so was Lockerem rüberkommen kann, dann ist es sehr, sehr spannend. Die Zuhörer sollten auch mal Ende dieses Podcasts

4:55 SPEAKER_01: dableiben und vor allem dann die Outro noch mal genau hören. Vielleicht gibt's da einen von uns KI generierten Song,

5:02 SPEAKER_01: der über den Podcast ist.

5:04 SPEAKER_00: Auf jeden Fall ein spannendes Thema und macht einfach Spaß. Wenn ich mal angesprochen werde demnächst in der Bar, was ich so mache, kann ich sagen, bin ich bin Songproduzent.

5:12 SPEAKER_01: Und das kommt in Berlin besonders gut. Das kommt in Berlin sehr, sehr gut, genau. Generell, Songproduzent,

5:18 SPEAKER_01: Musiker und so kommt immer gut an. Mit diesen Tools, und wir sprechen auch gleich noch mal bisschen zu den Tools, kann ich eben nicht nur die Texte generieren, sondern kann dann auch noch definieren,

5:28 SPEAKER_01: welche Musikrichtung

5:29 SPEAKER_01: es sein soll. Und kann da wirklich aus Hunderten Musikrichtungen ausprobieren, ob jetzt irgendwie deutscher Pop oder Rap ist oder Blues

5:37 SPEAKER_01: und dann eben die Songs genau in dem Stil entwerfen,

5:40 SPEAKER_01: wie sie ja zum Setting passen, für was ich eben diesen Song nutzen möchte. Das Dingle, was wir hier haben im Podcast,

5:48 SPEAKER_00: hier reinzukommen, ist auch natürlich KI generiert, gehört sich so. Und auch die Sprache, die ihr da hört im Intro und Outro,

5:54 SPEAKER_00: ist auch mal schon eine KI Stimme. Also auch das geht heute schon und ist natürlich für Unternehmenskontext

5:59 SPEAKER_01: auch schon heute relevant. Und das Ganze wird immer besser, ne. Also ich mein, klar hört man teilweise auch bei unseren Intros und Outros noch, das könnte eine KI Stimme sein, eine Geschwindigkeit

6:09 SPEAKER_01: und jetzt gefühlt sagen wir das in jeder Episode, die Geschwindigkeit,

6:14 SPEAKER_01: wie sich die Technologie verbessert, ist einfach wirklich crazy. Und am Ende der Episode

6:20 SPEAKER_01: haben wir noch ein kleines Beispiel, wo wir mit' KI sprechen.

6:24 SPEAKER_01: Und das Ganze müssen wir auf Englisch machen, weil die aktuell bis ja in dieser Qualität

6:29 SPEAKER_01: nur eine englische Stimme verfügbar ist. Aber

6:32 SPEAKER_01: das ist schon crazy, wenn man dann sieht, wie realistisch

6:36 SPEAKER_00: mittlerweile die Antworten sind, was für Pausen die KI macht. Ja, wie empathisch es auch wirkt, ne. Das ist jetzt nicht so wie der Computer, der in der Warteschleife sagt, bitte 2 oder 3 drücken. Genau, ja.

6:47 SPEAKER_00: Neben diesen Aspekt, dass Musik komplett neu oder Sounds komplett neu generiert werden können, gibt's natürlich auch die ganze automatische Transkription

6:54 SPEAKER_00: und auch die Meetinganalyse.

6:56 SPEAKER_00: Heißt für euch vielleicht spannend, wenn ihr in vielen Meetings seid, viele in Zooms oder in Google Meet oder in Teams oder wo auch immer. Ja, da gibt's viele Tools, die mittlerweile das ganze Meeting aufnehmen,

7:07 SPEAKER_00: euch dann zusammenfassen

7:09 SPEAKER_00: und dann die Möglichkeit geben, genau dahin zu springen. Also

7:12 SPEAKER_00: man sieht das Transkript,

7:14 SPEAKER_00: sieht der und der hat das und das gesagt. Man kann dann reinklicken und hinspringen

7:18 SPEAKER_00: und sieht genau, an welchem Punkt im Video man da war.

7:21 SPEAKER_00: Setze ich ganz gerne ein. Hat man auch oft, wenn man jetzt in Meetings geht, dass man dann sieht, hier Moritz ist da und Moritz AI Noteaker ist auch da. Ja. Und dann im Hintergrund dieses ganze Transkript erstellt wird. Für mich ist es ein absoluter Gamechanger, wenn wir in Vertriebsgesprächen

7:34 SPEAKER_01: sind. Natürlich sage ich am Anfang immer dazu, weil es ja auch sichtbar, dass der Snippie, der Nodeaker mit dabei ist und ist es

7:41 SPEAKER_01: ist es dann eine ganz nette Unterhaltung schon über den Nodeaker am Anfang.

7:45 SPEAKER_01: Und

7:46 SPEAKER_01: der oder die gegenüber soll natürlich wissen, dass dieser Call aufgenommen, transkribiert wird.

7:51 SPEAKER_01: Aber dann ist es für mich ein Gamechanger aus 2 Gründen, weil ich zum einen einhundert Prozent im Call sein kann und der Person zuhören kann und so wirklich auf die Person eingehen kann und nicht nebenbei zuhören und irgendwie Notes

8:03 SPEAKER_01: aufschreiben muss, dass ich auch im Nachhinein ja nichts vergesse.

8:06 SPEAKER_01: Und diese,

8:08 SPEAKER_01: also im Prinzip dahinter liegt ja eine KI, die die versteht die Stimme, transkribiert die Stimme in quasi Wörter.

8:14 SPEAKER_01: Und diese Wörter können danach weiterverarbeitet werden.

8:17 SPEAKER_01: werden. Und ich nutz es sehr oft, dann Fragen zu stellen, was soll ich denn jetzt noch mal genau fürn Angebot machen? Welche Preise haben wir besprochen? Wie viel Personen ist das Angebot überhaupt relevant? Und bekommen dann die Antwort von der KI.

8:30 SPEAKER_01: Und diese Tools sind mittlerweile so weit, dass sie eine direkte Integration in ein CRM System haben, ob das jetzt ein Hubspot oder Salesforce ist und befüllen dann

8:40 SPEAKER_01: die relevanten Felder im Salesforce. Wenn ich also ein klassischen Kunden Discovery Call mache und so gewisse Punkte abfragen muss, dann versteht das Tool in die KI, was der Kunde oder potenziell der Kunde gesagt hat und aktualisiert diese Felder immer System und packt die Zusammenfassung des Calls direkt in das System.

8:58 SPEAKER_00: Und ich hab eigentlich gar keine Arbeit danach und das ist schon ein riesen Game Changer. Ich hab das für interne Calls, ich hab jetzt nicht so viele Sales Calls, aber natürlich viele interne Abstimmungsthemen.

9:07 SPEAKER_00: Da hab ich eine KI, die mitläuft

9:09 SPEAKER_00: und die mir danach nach dem Call alle Aufgaben zusammenfasst.

9:12 SPEAKER_00: Also was muss ich machen? Das gleiche Ding geht auch auf Text. Das kann also auch in meinen Mails schauen, welche Aufgaben ich habe, auch in Slack, welche Aufgaben ich habe. Ich habe dann sozusagen eine Aufgabenliste,

9:21 SPEAKER_00: die sich aus diesen verschiedenen Dingen speist.

9:23 SPEAKER_00: Aber auch wenn ich ein normales Gespräch im Büro habe, kann ich das Ding anschalten.

9:27 SPEAKER_00: Es läuft mit und sagt danach, okay, welche Aufgaben sind aus diesem Gespräch entstanden. Also auch für mich super relevant und hilfreich. Ja.

9:36 SPEAKER_01: Die nächste Kategorie, die spannend ist, Sie haben's ja schon ein bisschen angeteasert, ist die Kategorie

9:41 SPEAKER_01: Voice Bots und Sprachassistenten.

9:43 SPEAKER_01: Und da gibt's natürlich extrem viele Use Cases für beispielsweise,

9:48 SPEAKER_01: wenn ich ein Bestellung aufnehmen möchte, ob ich jetzt ein Restaurant bin, das Essen Bestellung aufnimmt oder

9:54 SPEAKER_01: ob ich vielleicht ja ein anderer Shop bin und normalerweise sitzt auf der anderen Seite eine Person. Und jetzt kann auf der anderen Seite eine KI sitzen, die smart genug ist zu verstehen, welcher Kunde ruft überhaupt an und quasi über die Telefonnummer direkt ein Match macht zu den bestehenden Kundendaten.

10:12 SPEAKER_01: Also es muss kein dummer,

10:14 SPEAKER_01: ich sag mal,

10:15 SPEAKER_01: sein oder Durchklick System, so wie wir das heute haben, wenn wir irgendwo bei der bei unserem Telefonanbieter anrufen.

10:22 SPEAKER_01: Meiner Meinung nach sollte der Telefonanbieter direkt wissen, wer ich bin, wenn ich von meiner Telefonnummer anrufe, die von dem Telefonanbieter komm. Schaffen sie aber leider nicht. Aber ein mit quasi den neuen Systemen ist es möglich, natürlich zu identifizieren

10:36 SPEAKER_01: und dann direkt auf mich einzugehen.

10:39 SPEAKER_01: Und wenn ich diese Voice Systeme eben mit dem CM System oder ERP System verbinde, dann können die mir in der Regel auch zumindest für alles, was Standardaufgaben

10:49 SPEAKER_01: sind,

10:49 SPEAKER_01: sehr gut helfen. Und das ist eben ein Thema bei Bestellungen, bei Kundenservicethematiken.

10:58 SPEAKER_00: Ja, auch auch internen Themen, interne interne

11:02 SPEAKER_00: Headdesks. Ja, wenn Du irgendwie Probleme hast mit deiner IT,

11:05 SPEAKER_00: wär das auch ein cooler Use Case, den man nutzen könnte. Ja. Ich warte drauf, dass wir eigentlich unseren Kundenservice auch an sone KI Voice anbinden können. Heute läuft wahnsinnig viel bei Chat. Das unser Chatsystem,

11:16 SPEAKER_00: das schließt schon so 40 Prozent der Tickets komplett automatisiert,

11:21 SPEAKER_00: ohne dass da ein Mensch eingreifen muss.

11:23 SPEAKER_00: Wenn ich das mit' Voice machen könnte, wäre es eigentlich doch besser,

11:26 SPEAKER_00: Denn dann könnten wir auch Kundenservice per Telefon anbieten.

11:29 SPEAKER_01: Ja und auch ich hab letztens ein Unternehmen kennengelernt,

11:33 SPEAKER_01: die

11:34 SPEAKER_01: helfen E-Commerce-Shops

11:35 SPEAKER_01: dabei, die Returns abzuwickeln

11:39 SPEAKER_01: Und Also Rücksendungen, oder? Rücksendungen, genau. Und

11:43 SPEAKER_01: Du willst ja als E-Commerce-Shop immer wissen, was die Gründe dafür sind, dass ein Artikel zurückgeschickt wurde.

11:49 SPEAKER_01: Und zwar kannst Du natürlich irgendwie anklicken, zu groß, zu klein, hat mir nicht gefallen, whatever. Die haben zusätzlich die Möglichkeit gegeben mit' Button, der einfach auf der Seite ist, kann der Kunde reinsprechen, hat mir nicht gefallen, war zu groß, wie auch immer. Mhm. Und dann werden diese Voiced Daten analysiert

12:06 SPEAKER_01: und im E-Commerce-Shop am Ende eben eine Analyse gegeben,

12:10 SPEAKER_01: was die Hauptgründe sind, bei welchem Artikel, was wiederum connectet ist mit der Seite, sodass dann auf der Seite aktualisiert wird, zum Beispiel dieser Artikel

12:18 SPEAKER_01: fällt zu groß aus in der Regel, ne, dann die Gesamtanzahl

12:22 SPEAKER_01: der Returns

12:24 SPEAKER_01: zu reduzieren. Das heißt quasi, dieses Kundenfeedback

12:26 SPEAKER_01: aufzunehmen über Stimme, weil's dem Kunden einfach extrem einfach gemacht wird, dieses Feedback zu geben, ist auch was, was früher einfach so noch nicht ging. Und weniger Pakete und weniger Rücksendungen

12:37 SPEAKER_00: freut nicht nur Onlinehändler,

12:40 SPEAKER_01: sondern auch die Umwelt. Genau. Weitere. Wobei generell

12:44 SPEAKER_01: die generative KI, glaube ich, die Umwelt nicht so freut, zumindest

12:47 SPEAKER_01: die der Energieverbrauch der ganzen Servercenter, aber das ist noch mal ein anderes Thema. Aber da haben wir ein gutes einen guten Punkt, denn

12:55 SPEAKER_00: hier ist vielleicht der Energieverbrauch sehr wichtig, bei Barrierefreiheit

12:58 SPEAKER_00: und Inklusion. Auch da können wir Sounds einsetzen.

13:01 SPEAKER_00: Ich glaube jetzt im

13:02 SPEAKER_00: Juni

13:03 SPEAKER_00: wird das neue oder tritt das neue Gesetz in Kraft, dass alle Webseiten

13:07 SPEAKER_00: komplett barrierefrei sein müssen.

13:10 SPEAKER_00: Das heißt, man muss dann also in der Lage sein, die Webseite eben nicht nur für Menschen zur Verfügung zu stellen, die komplett lesen

13:16 SPEAKER_00: und alle Farben sehen können und so weiter, sondern es muss inklusiv sein. Das heißt, ich muss in der Lage sein, auch die Webseite

13:23 SPEAKER_00: lesen zu können, wenn ich halt nicht lesen kann über Sound,

13:26 SPEAKER_00: unter anderem. Es gibt noch viele andere Aspekte, aber auch da können KI natürlich helfen, automatisiert

13:31 SPEAKER_00: Bildunterschriften zu erstellen oder wenn ich irgendwo rüber hovere, dass ich auf der ganzen Webseite oder App komplett mit Sprache navigieren kann. Ja, und ich mein, die gleichen Systeme kannst Du dafür verwenden,

13:43 SPEAKER_01: wenn Du beispielsweise draußen Sport machst. Du bist am Joggen und hast deine Blogposts und Webseiten, die Du gerne lesen möchtest,

13:49 SPEAKER_01: kannst Du quasi diese integrierten Voice Agenten auch nutzen, deine Artikel einfach zu hören, wenn Du ohnehin draußen bist oder wenn Du Auto fährst und wie auch immer. Und ja, das wird ein riesen Riesenunterschied machen, vor allem für Leute, die eben nicht sehen können, ne. Aber eben

14:05 SPEAKER_01: auch für uns, die glücklich genug sind, dass wir sehen können, einfach ein Riesenmehrwert, wenn

14:10 SPEAKER_01: wenn wir dann eben draußen unterwegs sind und trotzdem Informationen irgendwie wahrnehmen

14:14 SPEAKER_01: möchten.

14:15 SPEAKER_01: Genau, und die 7. Kategorie ist

14:18 SPEAKER_01: die Kategorie Internationalisierung,

14:20 SPEAKER_01: grade

14:21 SPEAKER_01: neue Zielgruppen zu erschließen und auch Personen, die vielleicht deine Sprache nicht sprechen, zu erreichen.

14:27 SPEAKER_01: Ob das jetzt intern mit irgendwelchen Trainings sind oder vielleicht,

14:31 SPEAKER_01: ja, Ansagen oder oder Reden Leadership

14:34 SPEAKER_01: an die ganze Company

14:36 SPEAKER_01: erreichst Du natürlich die Person besser, wenn Du die

14:39 SPEAKER_01: die Nachrichten aussenden

14:42 SPEAKER_01: kannst in der Nachricht des Empfängers. Ja. Und

14:46 SPEAKER_01: genauso könntest Du natürlich auf deiner Webseite machen, deinen Social Media Content, deine YouTube Videos,

14:51 SPEAKER_01: dass Du da eben die Möglichkeit hast, einfach die Stimmen in der Sprache der Person oder an die Sprache der Person anzupassen.

14:58 SPEAKER_00: Also ähnlich wie es bei Bildern war, wo ich ja bisher mal schauen musste, hab ich die Bildrechte dafür, darf ich das Bild auf meine Webseite einbinden, kann man die heute per Prompt erstellen, so ähnlich ist auch mit Sounds mittlerweile. Ich muss also nicht mehr schauen, welches Jingelchen ist gemafrei,

15:11 SPEAKER_00: was

15:12 SPEAKER_00: ich auf meiner

15:14 SPEAKER_00: Firmenfeier spielen möchte, sondern auch das kann ich mir eben darstellen.

15:17 SPEAKER_00: Genau. Und kann diese Klippe umschiffen.

15:19 SPEAKER_01: Genau, Du kannst die quasi die Klippe umschiffen. Es ist dann sicher gemafrei, wenn Du's selbst erstellt hast. Wir haben tatsächlich jetzt für eine Marketingaktion

15:29 SPEAKER_01: auf so alte Kassetten einen KI Song gespielt.

15:33 SPEAKER_01: Und der Drucker dieser Kassetten

15:35 SPEAKER_01: wollte oder darf

15:37 SPEAKER_01: die Kassetten nicht bedrucken ohne einen Brief der Gema, der besagt, dass eben dieser Song Gema frei ist. Aber dadurch, wir den Song komplett KI generiert haben, haben wir sofort von der Gema die Bestätigung bekommen,

15:49 SPEAKER_01: okay, Gema frei und konnten so am Ende diese Kassetten auch bedrucken.

15:53 SPEAKER_01: Und ja, das Einzige ist natürlich und das ist hatten wir schon mal in der Episode, das ganze Thema

16:00 SPEAKER_01: Urheberrecht beziehungsweise Copyright,

16:02 SPEAKER_01: sofern ich den Song nicht am Ende maßgeblich

16:07 SPEAKER_01: noch mal verändere als Mensch,

16:09 SPEAKER_01: sondern

16:10 SPEAKER_01: oder ihn einfach so lasse, dann hab ich wahrscheinlich auch kein Copyright auf diesen Song. Das muss man natürlich auch bedenken, wenn ich das jetzt für ein irgendwie ein Werbe Jingle nehme und der schlägt total ein und die Leute assoziieren

16:23 SPEAKER_01: meine Marke mit diesem Jingle.

16:25 SPEAKER_01: Ja. Dann

16:26 SPEAKER_01: habe ich, Stand heute zumindest und das kann sich noch x mal ändern, weil's natürlich ganz viele Gesetzes,

16:32 SPEAKER_01: ganz viele Gerichtsverfahren auch schon gibt und das muss ich da, glaub ich, alles noch ein bisschen finden. Aber Stand heute

16:37 SPEAKER_01: könnte dann theoretisch jeder mein Jingle nehmen, weil ich nicht Copywriten kann, wenn ich ihn nicht nach, also aus Spannend. Ja gut verändert habe. Du kannst zwar on Brand Bilder und solche Jingles produzieren, aber sie kannst Du nicht mehr so richtig schützen.

16:49 SPEAKER_00: Ja. Ist immer ein bisschen schwierig mit der Empfehlung von Werkzeugen oder Tools, denn es entwickelt sich alles so schnell weiter, aber son paar haben wir vor euch rausgesucht

16:57 SPEAKER_00: als Orientierung und wir glauben, die sind auch noch in'

17:01 SPEAKER_01: Jahr von heute relevant. Schauen wir mal. Genau. Aber

17:04 SPEAKER_01: ich würd sagen, wir gehen auch wieder die 7 Kategorien durch, die wir gerade besprochen haben, dass man sich daran son bisschen langhangelt und orientieren kann. Die 1. Kategorie war ja Sprachsynthese

17:16 SPEAKER_01: und Soundgenerierung.

17:18 SPEAKER_01: Und da ist schon sehr lange eigentlich Eleven Labs 1 der führenden Spieler und den Namen werden wir auch gleich häufiger noch mal hören bei den anderen Kategorien.

17:28 SPEAKER_01: Eleven Labs funktioniert

17:30 SPEAKER_01: sehr gut auch für deutschsprachige

17:32 SPEAKER_01: Stimmen. Also es gibt da viele Beispielstimmen, die ich schon verwenden kann. Ich kann da meine eigene Stimme klonen sozusagen und verwenden,

17:39 SPEAKER_01: kann dann die geklonte Stimme oder auch die bestehenden Stimmen nutzen,

17:44 SPEAKER_01: Übersetzungen in andere Sprachen zu machen. Da kommen wir gleich noch dazu. Also Eleven Labs kann relativ viel, Eleven Labs kann Soundeffekte generieren.

17:52 SPEAKER_01: Ich kann da auch ein Video hochladen beispielsweise und Eleven Labs erstellt dann passend zu dem gesehenen Video die Soundeffekte. Also es ist generell ein sehr, sehr spannendes Tool.

18:03 SPEAKER_01: Vergleichbar

18:04 SPEAKER_01: und ähnlich

18:06 SPEAKER_01: ist PlayHT

18:08 SPEAKER_01: oder PlayHT.

18:11 SPEAKER_01: Aktuell würde ich sagen, vielleicht noch ein Ticken hinter Eleven Labs, aber lohnt sich's auf jeden Fall auch mal da reinzuschauen.

18:17 SPEAKER_01: Und das 3. Tool,

18:19 SPEAKER_01: was wir uns jetzt auch gleich noch mal live anschauen,

18:22 SPEAKER_01: ist NotebookLM,

18:24 SPEAKER_01: was eigentlich noch viel mehr ist als ein als ein Audiotool.

18:28 SPEAKER_01: Eigentlich ist es fast son Wissensmanagement

18:30 SPEAKER_01: Tool, dazu werden wir auch noch mal eine Episode machen.

18:33 SPEAKER_01: Aber im Wesentlichen

18:34 SPEAKER_01: kann ich mit verschiedenen Input Quellen, beispielsweise YouTube Videos, Dokumente, die ich reinlade, PDFs,

18:40 SPEAKER_01: Internetseiten,

18:42 SPEAKER_01: daraus

18:43 SPEAKER_01: ein Podcast

18:44 SPEAKER_01: erstellen lassen, also quasi 2 Personen,

18:47 SPEAKER_01: die sich über diese Inhalte unterhalten.

18:50 SPEAKER_01: Und

18:51 SPEAKER_01: wie das Ganze geht, schauen wir uns jetzt an. Und zwar haben wir das am Beispiel

18:56 SPEAKER_01: von Dokumenten und Webseiten

18:58 SPEAKER_01: über die

19:00 SPEAKER_01: Sound- und Stimmgenerierung

19:01 SPEAKER_01: gemacht,

19:02 SPEAKER_01: passend zu dem Thema. Und ja, haben da einige Artikel reingeladen und am Ende kommt quasi

19:09 SPEAKER_01: dieser Podcast, von dem wir uns jetzt gleich mal die 1. Minute gemeinsam anhören.

19:15 SPEAKER_02: Haben Sie sich eigentlich schon mal vorgestellt, wie das wäre, ein Gespräch mit 1 KI zu führen, das sich ja fast menschlich anfühlt?

19:23 SPEAKER_02: Mhm, ja. Die Technologie macht da ja grade Riesensprünge.

19:27 SPEAKER_02: Heute schauen wir uns mal Ihre Quellen zu Voice AI genauer an. Genau. Was kann das heute? Warum ist es grade jetzt so ein großes Ding?

19:36 SPEAKER_03: Also es geht ja darum, wie aus einfachen Sprachbefehlen wirklich komplexe

19:40 SPEAKER_03: menschenähnliche

19:41 SPEAKER_03: Interaktionen werden können. Und was ist Voice AI genau, so in einfachen Worten? Im Grunde sind das intelligente Systeme, die gesprochene Sprache

19:49 SPEAKER_03: nicht nur hören,

19:50 SPEAKER_03: sondern verstehen

19:52 SPEAKER_03: und dann auch sinnvoll reagieren. Okay. Dahinter stecken so Kerntechnologien,

19:56 SPEAKER_03: also automatische Spracherkennung,

19:58 SPEAKER_03: ASR

19:58 SPEAKER_03: oder speech to text nennt man das ja auch. Ja.

20:02 SPEAKER_03: Dann die großen Sprachmodelle, die LLMs,

20:04 SPEAKER_03: die halt den Kontext kapieren. Mhm. Und natürlich die künstliche Stimmerzeugung,

20:09 SPEAKER_03: also Text to speech.

20:10 SPEAKER_03: Das ist schon eine weite Reise von den Anfängen so wie Audrey.

20:14 SPEAKER_00: Ja, super cool. Man kriegt gar nicht mit,

20:16 SPEAKER_00: dass die überhaupt nicht wussten, was wir dem geben als Podcast. Die beiden Stimmen klingt total echt. Klar, ein bisschen amerikanisch,

20:23 SPEAKER_00: aber dennoch,

20:24 SPEAKER_00: was auch spannend ist, es gibt jetzt ein Modus, wo ich auch in NotebookLM

20:28 SPEAKER_00: als 3. Person reinkommen kann und sogar mit den beiden, die da den Podcast haben, interagieren kann, also mal Nachfragen stellen kann. Haben wir jetzt nicht gezeigt, aber ist auf jeden Fall eine Sache, die ihr unbedingt mal ausprobieren müsst. Und was spannend ist, dass am Anfang hatten die noch son,

20:42 SPEAKER_01: eigentlich ist es kein Fehler und es ist schon fast irgendwie menschlich,

20:46 SPEAKER_01: dass als dieses Feature neu rausgebracht wurde und wenn Du regelmäßig diese Sprecher

20:52 SPEAKER_01: unterbrochen

20:53 SPEAKER_01: hast, dann wurden die richtig patzig teilweise, dass sie unterbrochen wurden. Okay. Und das ist nicht so, irgendwie da rein programmiert haben, dass die KI jetzt patzig wird, aber wahrscheinlich, weil die KI in den Trainingsdaten gelernt hat, dass es unhöflich ist, wenn man jemand ins Wort fällt und hat dann irgendwie so reagiert. Das ist eigentlich auch eine ganz spannende,

21:10 SPEAKER_01: spannendes

21:11 SPEAKER_01: Entwicklung quasi. Es ist häufiger, glaub ich, sieht man in der KI, wenn wenn neue Sachen entwickelt werden, die KI auf einmal irgendwie komisch

21:19 SPEAKER_01: agiert und verhalten hat, was man eigentlich so gar nicht rein programmiert hat, dann quasi rauszufinden, woran liegt das eigentlich? Und da ist dann eben die Hypothese gewesen, ja, weil die KI halt gelernt hat, dass man Leute nicht unterbrechen. Wenn ich die KI unterbreche, dann ist auch die KI patzig.

21:35 SPEAKER_00: Dann haben wir neben dieser Synthese natürlich das Thema Soundoptimierung

21:38 SPEAKER_00: und Soundbearbeitung.

21:40 SPEAKER_00: Da gibt's ein schönes Tool, das heißt Authonic

21:43 SPEAKER_00: und es gibt Riverside. Fm. Riverside. Fm kennen vielleicht diejenigen, die mit Podcasts viel zu tun haben. Das kann viel mehr, aber hat eben auch diese Soundkomponente.

21:51 SPEAKER_00: Und sicherlich gibt's auch noch einige andere Profitools, die wir jetzt in unserem normalen Anwendung im Unternehmen nicht kennen.

21:58 SPEAKER_00: Aber ja, guckt's euch mal an. Auch spannend, grade wenn ihr Sounds bearbeiten wollt und da das letzte bisschen auch rauskitzeln möchtet.

22:05 SPEAKER_01: Zum Thema KI generierte Musik, da gibt's eigentlich

22:09 SPEAKER_01: 2 große bekannte Spieler,

22:11 SPEAKER_01: die meiner Meinung nach ähnlich gut sind, beide ihre Stärken und Schwächen und

22:15 SPEAKER_01: bringen aber auch ständig neue Features raus und sind relativ vergleichbar. Und zwar ist es einmal UDIO

22:21 SPEAKER_01: und das andere Tool nennt sich Suno.

22:23 SPEAKER_01: Und

22:24 SPEAKER_01: ich empfehl immer allen Leuten, probiert beide aus. Selbst in der kostenlosen Version kommt man da schon relativ falsch und kann viele Songs generieren.

22:32 SPEAKER_01: Und

22:33 SPEAKER_01: generell bei so Songgenerierungsthemen

22:35 SPEAKER_01: macht's einfach Sinn,

22:37 SPEAKER_01: erst mal einige zu sich generieren zu lassen und dann zu entscheiden, welchen Song man am Ende nimmt. Da ist nicht immer gleich der 1. Wurf besonders toll, aber wenn ich mir 10, 20 verschiedene

22:47 SPEAKER_01: Entwürfe

22:48 SPEAKER_01: sozusagen vorspielen lasse, dann find ich auf jeden Fall, was spannend ist. Und grade wenn ich 2 verschiedene Tools nutze, hab ich ja relativ viele

22:55 SPEAKER_01: Optionen, kostenlos Songs zu erstellen. Erst wenn ich irgendwie längere Songs erstellen möchte mit mehreren Strophen, die dann irgendwie 3 Minuten gehen, dann wird das Ganze natürlich kostenpflichtig. Aber auch da sind tatsächlich bei den Tools relativ überschaubar und es macht einfach Spaß.

24:09 SPEAKER_00: Dann hatten wir das Thema Transkription

24:11 SPEAKER_00: und Zusammenfassung.

24:12 SPEAKER_00: Da wollen wir mal 2 Anbieter herausgreifen, die

24:15 SPEAKER_00: die hier aus Deutschland sind oder zumindest teilweise so aus Deutschland. Zum einen TLDV,

24:19 SPEAKER_00: also TLDV.

24:22 SPEAKER_00: Kennt man vielleicht von Tiktok,

24:24 SPEAKER_00: sind auch stark bei LinkedIn unterwegs, cooles kleines Team, super Tool. Und dann gibt's Demodesk. Demodesk ist grad für den Sales Bereich super interessant. DemoDesk kann

24:33 SPEAKER_00: kann viel mehr, aber die haben halt auch so einen kleinen

24:37 SPEAKER_00: Tool, was sozusagen zu Meetings dazu kommt und das, was du vorhin beschrieben hast, nämlich das Meeting zusammenfasst und auch die relevanten Felder in den jeweiligen CRM Systemen direkt befüllt. Genau, natürlich die großen Anbieter jetzt

24:48 SPEAKER_01: Google einfach im Google Meet hat die

24:52 SPEAKER_01: Transcripe Funktion integriert.

24:55 SPEAKER_01: Zoom hat er jetzt auch, glaube ich. Zoom ab einem gewissen Plan zumindest bei Google mit drin und klar, der Copilot

25:00 SPEAKER_01: macht das auch.

25:02 SPEAKER_01: Die

25:03 SPEAKER_01: Vorteile

25:04 SPEAKER_01: von diesen Tools wie jetzt hier, die wieder Demodesk sind, dass ich,

25:09 SPEAKER_01: wenn ich quasi

25:11 SPEAKER_01: Calls mit anderen Leuten habe, die extern sind, dass dann trotzdem ein KI Agent mit reingeht und diesen Call für mich aufnimmt. Denn

25:19 SPEAKER_01: auch wenn dieses Unternehmen dann für sich in ihrer Teams Umgebung den den den Call aufnimmt, hab ich ja sonst kein kein Transkript sozusagen. Und

25:28 SPEAKER_01: diese Tools sind, ich sag mal, systemunabhängig. Es

25:31 SPEAKER_01: Es ist jetzt egal, ob der Call am Ende in' Google Meet stattfindet oder in' Zoom oder in' nem Team in' Teams Umgebung. Ich bekomm trotzdem ein Transkript und kann so weiterarbeiten.

25:41 SPEAKER_00: Und das ist eben ein Vorteil von diesen von diesen unabhängigen Tools. Für die MacCenter unter euch vielleicht noch Granola fällt mir grad noch ein, das ist auch ein Tool, was aber dann nicht im Call erscheint, sondern sozusagen

25:53 SPEAKER_00: über im Hintergrund ist. Ist vielleicht ein bisschen schwierig, weil man sollte immer sagen, wenn man solche Tools nutzt und nicht einfach mitlaufen lassen.

26:01 SPEAKER_01: Genau.

26:02 SPEAKER_01: Dann Voice Spots und Sprachassistenten,

26:04 SPEAKER_01: ja, mit 1 der größten Use Cases, glaube ich, für das ganze Sprach KI Thema.

26:09 SPEAKER_01: Haben wir ja eingangs schon einiges zugesprochen.

26:12 SPEAKER_01: Da ist OpenAI natürlich sehr weit vorne

26:16 SPEAKER_01: und eben selbst, kann es ja selbst ausprobieren, wenn man ChatGPT OpenAI ist die Firma der ChatGPT. Genau, ich will mal hinter ChatGPT.

26:23 SPEAKER_01: Aber wenn ich ChatGPT nutze, habe ich ja auch die die Voice Funktion.

26:27 SPEAKER_01: Und zwar einmal das klassische Whisper,

26:30 SPEAKER_01: spreche rein, also das ist dieses kleine Mikro und dann wird quasi aus meinem gesprochenen Text,

26:37 SPEAKER_01: aus meinem aus meiner Sprache Text erstellt und den kann ich abschicken. Wenn ich nicht möchte, dass die KI zurückspricht,

26:43 SPEAKER_01: Aber dann habe ich ja auch die Voice Funktion, dass ich das rein in der kostenlosen Version eigentlich auch schon so? Die ist mittlerweile, glaube ich, begrenzt auch in der kostenlosen Version mit drin.

26:53 SPEAKER_01: Müsste man aber noch mal nachschauen, kann sich auch jederzeit wieder ändern. Also da macht OpenAI ja sehr viel und ändert oft die Pläne. Oder eben diese Voice Funktion, wenn ich unterwegs bin, wenn ich Auto fahre, wenn ich laufe, dass ich mich eben mit der KI unterhalten kann. Und das Ganze ist auch über eine API ansteuerbar,

27:06 SPEAKER_01: wenn ich quasi diese diese Funktionalität,

27:09 SPEAKER_01: dieses Tool in meiner eigenen Software, für meine eigenen Tools, in meiner eigenen Umgebung

27:13 SPEAKER_01: nutzen möchte.

27:15 SPEAKER_01: Dann gibt's eine Open Source Lösung dafür.

27:18 SPEAKER_01: Da ist eine relativ bekannte

27:19 SPEAKER_01: VAPI, VAPI,

27:22 SPEAKER_01: die man eben dann in die eigenen Systeme anbinden kann, beispielsweise in son N-A-N-Workflow

27:26 SPEAKER_01: oder wie auch immer.

27:28 SPEAKER_01: Wenn ich quasi nicht diese oder wenn ich quasi eine Open Source Lösung nutzen möchte, vielleicht weil auch da jetzt was reingesprochen wird, Daten

27:36 SPEAKER_00: sind und Informationen enthält, die ich vielleicht nicht in die USA schicken möchte, dann ergeben so Open Source Lösungen eigentlich immer Sinn. Und diese ganzen Tools sind auch oft im Hintergrund von anderen Werkzeugen, die ich halt so am Markt kaufen kann. Also wenn ich jetzt irgendwie ein spezifisches Tool kaufe, wo irgend ein Voice Thema mit drin ist, dann setzen die oft auf solchen Anbietern wie OpenAI mit der API oder WAPI

27:59 SPEAKER_00: auch jetzt Cersamy auf. Das ist das, was jetzt als Nächstes kommt. Genau und Cersamy ist

28:03 SPEAKER_01: megaspannend

28:04 SPEAKER_01: und das spielen wir jetzt gleich mal ab. Und zwar

28:07 SPEAKER_01: geht das Ganze aktuell bisher nur auf Englisch, ist aber

28:10 SPEAKER_01: Stand jetzt mit 1 der besten Voice Bots, weil man in der Unterhaltung also wirklich fast nicht mehr merkt, dass man mit' Computer spricht. Ja. Und die kleine Demo probieren wir jetzt einfach mal hier gemeinsam aus.

28:23 SPEAKER_01: Nicht wundern, dass ich jetzt einmal gleich Englisch spreche mit der KI. Liegt einfach daran, dass eben wie gesagt das Tool noch nicht auf Deutsch verfügbar ist oder diese diese Lösung soll aber bald in mehreren Sprachen kommen, auch Deutsch.

28:35 SPEAKER_01: Und wer weiß, wenn man den Podcast in 2, 3, 4, 5 Wochen erst hört, gibt's schon wieder ganz andere Tools. Aber es geht jetzt einfach nur mal darum zu sehen, wie weit diese Tools heute schon sind und nämlich nicht mehr so, wie man das von einigen Anbietern kennt und versucht irgendwie verzweifelt irgendein

28:52 SPEAKER_01: irgendein Kundenproblem zu lösen am Telefon und ausrastet, weil man nicht verstanden wird.

28:57 SPEAKER_00: Das schauen wir uns jetzt mal an, würd ich sagen. Aber der Sprung von unserem Denglisch zu Englisch ist ja nicht so groß. Genau.

31:52 SPEAKER_00: Dankeschön.

31:53 SPEAKER_00: Wie ihr seht,

31:54 SPEAKER_00: es fühlt sich nicht mehr an, als wenn man mit 1

31:57 SPEAKER_00: AI spricht.

31:59 SPEAKER_00: Die Stimme ist ziemlich natürlich.

32:01 SPEAKER_00: Es gibt Pausen, trotzdem ist es recht schnell. Das ist schon echt erstaunlich. Ist noch ein bisschen amerikanisch, finde ich, ist ein bisschen sehr emotional,

32:08 SPEAKER_00: aber wenn das

32:09 SPEAKER_00: auf die jeweiligen landesspezifischen

32:11 SPEAKER_00: Gemüter abgestimmt ist Vollkommen die humorlose,

32:14 SPEAKER_01: langweilige deutsche Vollkommen.

32:18 SPEAKER_01: Genau, aber die eine Kategorie, die sie ja genannt hat am Ende, eben die Barrierefreiheit. Und

32:24 SPEAKER_01: da sind wir auch wieder bei Eleven Labs,

32:27 SPEAKER_01: OpenAI. Und

32:30 SPEAKER_01: da würden wir sagen, das sind so aktuell die Go to Tools.

32:34 SPEAKER_01: Und die letzte

32:36 SPEAKER_00: Haben wir das Thema Internationalisierung,

32:37 SPEAKER_00: Mehrsprachigkeit.

32:39 SPEAKER_00: Auch hier kommt wieder Eleven Labs vor.

32:41 SPEAKER_00: Werden wir vielleicht irgendwann mal nutzen, aus Spaß den Podcast in' anderen Sprache rauszubringen.

32:45 SPEAKER_00: Mal gucken, ob das funktioniert.

32:47 SPEAKER_00: Und auch da ist OpenAI

32:48 SPEAKER_00: sowohl mit der API, also mit der Schnittstelle,

32:51 SPEAKER_00: als auch mit dem Produkt ChatGPT ziemlich weit vorne dran.

32:55 SPEAKER_00: Da kann ich also heute schon in den verschiedensten Sprachen

32:58 SPEAKER_00: Voice,

32:59 SPEAKER_00: Audio

33:00 SPEAKER_00: generieren. Also ihr merkt,

33:03 SPEAKER_00: am Anfang hört sich's son bisschen lustig an, was soll ich mit Sound machen? Was hat der AI damit zu tun? Aber wir glauben, dass es da eine große berufliche Anwendbarkeit gibt in eigentlich verschiedensten

33:12 SPEAKER_00: Unternehmensbereichen,

33:13 SPEAKER_00: sowohl für interne Kommunikation als auch für externe Kommunikation, Marketing, Sales.

33:18 SPEAKER_00: Support.

33:21 SPEAKER_01: Viele Use Cases.

33:23 SPEAKER_01: Lass uns doch noch mal, ich glaub, wir sind jetzt am Ende der Episode.

33:26 SPEAKER_01: Ja. Vielleicht auch einmal hier Maja fragen, ob sie nicht ein paar

33:31 SPEAKER_01: nette

33:31 SPEAKER_01: Worte noch an unsere Hörer hat. Großartig. Und dann

33:36 SPEAKER_01: würde ich sagen, wir gehen noch mal zurück zu ihr und lassen heute mal die Outro von Maja machen und

33:43 SPEAKER_01: an unsere Hörer

33:45 SPEAKER_01: auch am Ende nach der Outro von Maja

33:48 SPEAKER_01: noch hier mit dabei bleiben, dann kommt nämlich noch unser toller KI generierter

33:53 SPEAKER_01: Song über den Cointelligence

33:55 SPEAKER_00: Podcast. Den ihr auch gern sowohl auf Spotify als auch auf YouTube kommentieren dürft und liken sowieso.

34:03 SPEAKER_01: Und jetzt

34:04 SPEAKER_01: kommen wir zu Meyer. Hey Meyer.

34:55 SPEAKER_00: Vielen Dank. Vergesst nicht zu liken und zu kommentieren und wie ihr seht, auch eine AI kommt

34:59 SPEAKER_00: kommt manchmal

35:01 SPEAKER_00: ins Straucheln.

35:03 SPEAKER_04: Cointelligence

35:04 SPEAKER_04: ist eine Produktion von thekey Academy in Zusammenarbeit mit SnipKI.

35:08 SPEAKER_04: Produziert bei Studio Co in Berlin. Produktion und Regie,

35:12 SPEAKER_04: Christina Manuel,

35:14 SPEAKER_04: und

35:15 SPEAKER_04: Ilias Robe.

35:16 SPEAKER_04: Creative Director Lukas Shelter.

35:18 SPEAKER_04: Redaktion und Moderation Benjamin Wüstenhagen und Moritz Heininger.

35:23 SPEAKER_04: Abonniere uns auf Spotify,

35:24 SPEAKER_04: Apple Podcasts oder YouTube.

35:27 SPEAKER_04: Danke fürs Zuhören.