Was es tut
Laden Sie eine Audiodatei hoch (MP3, WAV, M4A, FLAC) oder starten Sie die Aufnahme im Browser. Sie erhalten strukturierte Notizen zurück: Sprecher markiert, Kernpunkte extrahiert, Zeitstempel durchgehend. Kein rohes Transkript.
Läuft im Browser, nichts zu installieren, kein Bot tritt einem Anruf bei. Für Videodateien oder YouTube-Links verwenden Sie den Video-zu-Notizen-Konverter.
Was in den Notizen enthalten ist:
- Sprecher-markierte Abschnitte (bis zu 10 Stimmen)
- Kernpunkte und Aktionspunkte, kein rohes Transkript
- Zeitstempel, die auf das Audio zurückverlinken
- 99 Sprachen, automatisch erkannt
Die Wortfehlerrate liegt bei sauberem Audio bei etwa 2-3 % und bei rauschigen Mehrsprecheraufnahmen bei 8-12 % (vollständige Benchmarks). Eine 60-minütige Aufnahme ist in wenigen Minuten fertig. Dateien sind verschlüsselt und werden niemals zum Trainieren von Modellen verwendet (SOC 2 Typ II).
So funktioniert’s
- Hochladen oder aufnehmen: MP3, WAV, M4A, FLAC, OGG oder Aufnahme im Browser starten.
- KI transkribiert und markiert: Die Sprecher-Diarisierung läuft automatisch. Kernpunkte und Aktionspunkte werden extrahiert.
- Überprüfen und exportieren: PDF, Word, Nur-Text oder Markdown. Zeitstempel bleiben anklickbar.
Der Kontext bleibt auch bei langen Aufnahmen erhalten, sodass ein 2-stündiges Interview kohärent bleibt, anstatt den Überblick darüber zu verlieren, wer spricht.
Audio-Notizen nach Meeting-Plattform einrichten
Jede große Meeting-Plattform speichert Aufnahmen an einem etwas anderen Ort und in einem anderen Format. Die folgende Anleitung zeigt, was im Mai 2026 funktioniert.
Zoom
Nach dem Ende des Anrufs verarbeitet Zoom die Aufnahme für einige Minuten und legt dann eine .m4a-Audiodatei (sowie das .mp4-Video) in Ihrem Zoom-Cloud-Speicher oder im lokalen Ordner Dokumente/Zoom/<Meeting>/ ab. Laden Sie die M4A direkt hoch: Die Sprecher-Diarisierung funktioniert am besten mit Zoom-Audio, da Zoom jeden Teilnehmer in eine eigene Audiospur trennt, wenn lokal mit der Option “Separate Audiodatei für jeden Teilnehmer aufnehmen” aufgezeichnet wird. Das Ergebnis sind strukturierte Notizen mit Aktionspunkten pro Teilnehmer.
Google Meet
Google Meet-Aufnahmen werden im Google Drive des Gastgebers als MP4 gespeichert. Das Audio ist im Video gemuxt, laden Sie also entweder die MP4 direkt hoch oder verwenden Sie zuerst den Audio-Extraktor. Die kostenlose Meet-Stufe beinhaltet keine Cloud-Aufnahme, daher ist eine Aufnahme per Telefon oder Laptop-Mikrofon der Ausweg. Das Ergebnis ist eine nach Themen gruppierte Notiz mit Zeitstempeln, die auf den Moment in der Aufnahme zurückverlinken.
Microsoft Teams
Teams-Aufnahmen landen in OneDrive (1:1-Anrufe) oder auf der Kanal-SharePoint-Site (Kanalbesprechungen) als MP4. Live-Transkripte von Teams können auch als VTT heruntergeladen werden, die Sie für einen schnelleren Durchlauf, der eine erneute Transkription überspringt, einfügen können. Das Ergebnis berücksichtigt Teams-Sprecherbeschriftungen, wenn ein VTT-Transkript zusammen mit dem Audio bereitgestellt wird.
Persönliche Aufnahme
Telefon-Sprachnotizen (iPhone nimmt M4A auf, die meisten Android-Telefone M4A oder AAC), USB-Ansteckmikrofone oder ein dedizierter Handrekorder funktionieren alle. Legen Sie die Datei einfach ab. Bei persönlichen Mehrpersonenaufnahmen verbessert ein 360-Grad-Mikrofon (wie das Logitech BCC950 oder ein Jabra Speak) die Diarisierung spürbar, da jede Stimme mit einer anderen Raumsignatur ankommt. Das Ergebnis ist dasselbe strukturierte Notizformat, das auch für die Remote-Plattformen verwendet wird.
Integrierter Sprachrekorder
Der Browser-Rekorder erfasst Audio ohne separate App. Starten Sie die Aufnahme auf Ihrem Telefon während eines Spaziergangs, auf einem Laptop während einer Vorlesung oder auf einem Desktop für ein Podcast-Interview. Wenn Sie die Aufnahme beenden, verarbeitet die KI sie automatisch.
- Aufnahme im Browser auf jedem Gerät
- Erkennung mehrerer Sprecher
- Durchsuchbare Zeitstempel
- Mobile Aufnahme mit Cloud-Synchronisierung
- Bewältigt Hintergrundgeräusche und überlappende Sprache
Sehen Sie sich echte Notizen einer 32-minütigen Audioaufnahme an
Unten ist ein echtes Beispiel dafür, wie die Notizen von ScreenApp aussehen, wenn die Eingabe Audio ist. Die Quelle war eine 32-minütige Podcast-Aufnahme. Der Notizenersteller erkannte neun verschiedene Themen, unterteilte jedes in 2-3 Stichpunkte und erstellte ein 3-seitiges Dokument, das wie Notizen eines intelligenten Assistenten liest. Keine Transkriptionswand, kein Durchsuchen von 15 Seiten wörtlichem Text, um die wichtigen Momente zu finden.
Notizen können in die Ziele exportiert werden, die Notizenersteller tatsächlich verwenden: Markdown für Notion oder Obsidian, Nur-Text für Slack oder HubSpot, DOCX für Word, wenn Ihr Workflow über Office läuft, oder PDF zur Archivierung. Sprachnotizen, Konferenzaufzeichnungen, Vorlesungsaudio und Podcast-Dateien erzeugen alle Notizen in diesem Format.
Audio zu Notizen vs. andere Apps
- Otter.ai hat einen größeren kostenlosen Tarif, erfordert aber einen Bot in Ihren Meetings und begrenzt kostenlose Dateiimporte auf 3 pro Lebenszeit.
- NoteGPT liefert rohe Transkriptionen - keine Themenzusammenfassungen oder extrahierten Aktionspunkte.
- meetergo erfordert eine Desktop-Installation und hat den kleinsten kostenlosen Tarif.
Wer es nutzt
Studenten nehmen Vorlesungen auf ihrem Telefon auf und erhalten nach dem Unterricht lernbereite Notizen, gruppiert nach Themen mit Zeitstempeln.
Geschäftsleute laden aufgezeichnete Anrufe und Sprachnotizen hoch. Für Live-Zoom-, Teams- oder Meet-Anrufe verwenden Sie den KI-Meeting-Notizenschreiber, kein Bot erforderlich.
Forscher verarbeiten Interviewaufnahmen damit. Sprecherbezeichnungen und zitierbare Zeitstempel beschleunigen die Zitatensuche.
Content-Ersteller und Podcaster verwenden Episoden wieder für Shownotizen, Blogbeiträge und Zitate. Auch gut geeignet für Sprachnotizen und Feldaufnahmen. Wenn Sie nur eine Zusammenfassung und keine vollständigen Notizen benötigen, ist der Audio-Summarizer der eigenständige Summarizer für gekürzte Episodenübersichten, und die Audio-Zusammenfassungs-API übernimmt die programmatische Zusammenfassung eines gesamten Backkatalogs.
Journalisten dokumentieren Interviews und Pressekonferenzen und suchen dann über Aufnahmen hinweg nach Stichwörtern.
Notizen von einer Aufnahme mit überlappenden Sprechern
Das schwierigste Audio für jeden Notizenschreiber ist ein Anruf, bei dem sich Personen gegenseitig ins Wort fallen, und es lohnt sich, Erwartungen zu setzen. Wenn sich zwei Stimmen überlappen, erfasst die Transkription die dominante und verwischt die andere, sodass Notizen aus einer hitzigen Gruppendiskussion weniger zuverlässig sind als Notizen aus einem Meeting, bei dem nacheinander gesprochen wird. Das ist eine Einschränkung des Audios, nicht des Modells; kein Tool trennt echtes Überlappen sauber.
Was hilft, sind Sprecherbezeichnungen, die erfordern, dass jede Person mindestens einmal etwas alleine gesagt hat, damit das System einen Stimmabdruck zum Zuordnen hat. Eine Namensrunde am Anfang zahlt sich über die gesamte Aufnahme aus. Für ein Panel oder eine Debatte sollten Sie erwarten, ein paar Zuordnungen manuell zu korrigieren; bei einem normalen Meeting, bei dem die Personen abwechselnd sprechen, sind die Bezeichnungen meistens richtig.


