CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation
Di cosa parla
CookVoice è un sistema unico per generare voci umane che combina parlato e canto e separa tre aspetti della voce: il contenuto (ciò che viene detto), l’intonazione e il ritmo (come viene detto) e lo stile (il carattere della voce). L’idea è sostituire molteplici strumenti specialistici con un modello che allinea testo, stile e indicazioni sull’intonazione a piccoli segmenti dell’audio, permettendo sintesi, canto, imitazione, conversione e modifica della voce con maggior controllo e maggiore compattezza rispetto ad approcci tradizionali.
Cosa permette di osservare
Permette di esplorare se un singolo modello può gestire sia parlato sia canto offrendo controllo dettagliato su intonazione, ritmo e stile della voce, e quali scelte sul bilanciamento tra qualità, controllo e semplicità d’uso emergono.
Dalla fonte
Human voice generation has made rapid progress in speech generation, singing voice generation, voice cloning, and voice editing. However, most existing systems are designed for specific tasks and often rely on task-dependent architectures, control signals, or autoregressive decoding, limiting fine-grained controllability and inference efficiency. In this paper, we propose CookVoice, a unified framework for multimodal, multi-style, and multi-task human voice generation. CookVoice decomposes the human voice into three key factors: content, prosody, and style, enabling both speech and singing voice generation within a unified model. To achieve precise and flexible controllability, we design a flexible alignment strategy that maps text, style, and prosody control signals onto the frame-level of spectrogram. This design allows CookVoice to support a wide range of tasks, including text-to-spe…