Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning
Di cosa parla
Hanno costruito un sistema per etichettare automaticamente registrazioni audio focalizzate sui neonati in contesti domestici, affrontando problemi come pochi dati annotati, registrazioni rumorose e differenze tra famiglie. Combina un modello di riconoscimento vocale adattato con un componente leggero che considera il parlante, usa un semplice meccanismo per rendere le predizioni più coerenti nel tempo e separa la “firma” di ogni famiglia per ridurre la distorsione, permettendo l’analisi efficiente di registrazioni giornaliere molto lunghe.
Cosa permette di osservare
Permette di esplorare come far funzionare modelli audio in ambienti domestici reali: come ottenere coerenza nei risultati nel tempo, come limitare la distorsione dovuta a famiglie diverse e come lavorare con pochi dati annotati.
Dalla fonte
Recent advances in model design and self-supervised audio representations have improved speech and audio understanding, yet infant-centered naturalistic recordings remain challenging due to limited labeled data, low signal-to-noise ratio, and cross-family domain shifts. We present a family-conditioned, multi-tier audio tagger that combines a LoRA-finetuned Whisper encoder with a lightweight, target-speaker-aware Transformer for long-context inference and framewise prediction across tiers. To improve temporal coherence, we incorporate a simple sequence-level smoothing loss, and to enhance robustness across households, we introduce a factorized speaker-token design with a shared tier token and a learned family-specific offset, reducing family bias and promoting generalizable representations. Together, these choices enable efficient and effective infant-centered audio tagging of daylong au…