Skip to main navigation Skip to search Skip to main content

WhisperNER: Unified Open Named Entity and Speech Recognition

  • Gil Ayache
  • , Menachem Pirchi
  • , Aviv Navon
  • , Aviv Shamsian
  • , Gill Hetz
  • , Joseph Keshet
  • aiOla Research
  • AiOla Research And Technion

Research output: Chapter in Book/Report/Conference proceedingConference contributionpeer-review

Abstract

Integrating named entity recognition (NER) with automatic speech recognition (ASR) can significantly enhance transcription accuracy and enrich its content. We introduce WhisperNER, a novel model that facilitates joint speech transcription and entity recognition. WhisperNER supports opentype NER, enabling recognition of various entities during inference. Building on recent advancements in open NER research, we augment a large synthetic dataset with synthetic speech samples. This approach enables us to train WhisperNER on numerous examples with various NER tags. During training, the model is prompted with NER labels and optimized to produce the transcribed utterance alongside the corresponding tagged entities. For evaluation, we generate synthetic speech for commonly used NER benchmarks and annotate existing ASR datasets with open NER tags. Our experiments show that WhisperNER outperforms natural baselines in both out-of-domain open-type NER and supervised fine-tuning.

Original languageEnglish
Title of host publicationASRU 2025 - 2025 IEEE Automatic Speech Recognition and Understanding Workshop
PublisherInstitute of Electrical and Electronics Engineers Inc.
ISBN (Electronic)9798331544263
DOIs
StatePublished - 2025
Externally publishedYes
Event2025 IEEE Automatic Speech Recognition and Understanding Workshop, ASRU 2025 - Honolulu, United States
Duration: 6 Dec 202510 Dec 2025

Publication series

NameASRU 2025 - 2025 IEEE Automatic Speech Recognition and Understanding Workshop

Conference

Conference2025 IEEE Automatic Speech Recognition and Understanding Workshop, ASRU 2025
Country/TerritoryUnited States
CityHonolulu
Period6/12/2510/12/25

Bibliographical note

Publisher Copyright:
© 2025 IEEE.

Keywords

  • Open NER
  • Speech Recognition

Fingerprint

Dive into the research topics of 'WhisperNER: Unified Open Named Entity and Speech Recognition'. Together they form a unique fingerprint.

Cite this