Publications
Accepted research papers in speech synthesis, voice conversion, neural audio codec, and low-resource spoken language models.
Stabilizing Instruction Supervision for Instruct-TTS via Controllable Diversification and Drift Filtering
Yizhong Geng, Kecan Mao, Qifei Li, Cong Wang, Yingming Gao, Ruimin Wang, Chunfeng Wang, Hao Li, Ya Li†
Proceedings of INTERSPEECH 2026 · 2026
Stabilizes Instruct-TTS supervision by combining controllable instruction diversification, semantic-drift filtering, and attribute-aligned acoustic perturbation.
CLASVS: Continuous-Latent Autoregression for Melody-Preserving Lyric Editing in Singing Voice Synthesis
Yizhong Geng, Tian-Hao Zhang, Chunfeng Wang, Wenxin Fu, Yingming Gao, Ruimin Wang, Zhou Pan, Kun Zhan, Liang Li, Ya Li
arXiv · 2026
Introduces continuous-latent autoregression for editing singing lyrics while preserving the reference melody, timing, singer identity, and expression.
Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models
Yizhong Geng, Yanliang Li, Jinghan Yang, Tianhan Jiang, Boxun An, Ya Li, Xiaoyu Shen†
International Conference on Machine Learning (ICML) · 2026
Studies synthetic data scaling for low-resource spoken language models and proposes self-alignment methods that improve stability and expressivity for Thai and Lao speech generation.
MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation
Yizhong Geng, Wenxin Fu, Kecan Mao, Qifei Li, Yingming Gao, Ruimin Wang, Chunfeng Wang, Hao Li, Ya Li†, Wei Chen†
IEEE International Conference on Multimedia and Expo (ICME) · 2026
Introduces a neural audio codec that embeds melodic structure into discrete representations for high-fidelity and controllable singing voice generation.
HQ-SVC: Towards High-Quality Zero-Shot Singing Voice Conversion in Low-Resource Scenarios
Bingsong Bai, Yizhong Geng, Fengping Wang, Cong Wang, Puyuan Guo, Yingming Gao, Ya Li
Proceedings of the AAAI Conference on Artificial Intelligence · 2026
Presents an efficient zero-shot singing voice conversion system for low-resource scenarios, improving conversion quality and supporting voice super-resolution.
Mel-Refine: A Plug-and-Play Approach to Refine Mel-Spectrogram in Audio Generation
Hongming Guo, Ruibo Fu, Yizhong Geng, Shuchen Shi, Tao Wang, Chunyu Qiang, Ya Li, Zhengqi Wen, Yukun Liu, Xuefei Liu, Chenxing Li
IEEE Automatic Speech Recognition and Understanding Workshop (ASRU) · 2025
A plug-and-play mel-spectrogram refinement approach for improving diffusion-based text-to-audio generation without retraining.
Multi-Loss Learning for Speech Emotion Recognition with Energy-Adaptive Mixup and Frame-Level Attention
Cong Wang, Yizhong Geng, Yuhua Wen, Qifei Li, Yingming Gao, Ruimin Wang, Chunfeng Wang, Hao Li, Ya Li, Wei Chen
CoRR · 2025
Combines energy-adaptive mixup, frame-level attention, and multi-loss learning for robust speech emotion recognition.
EMO-Avatar: An LLM-Agent-Orchestrated Framework for Multimodal Emotional Support in Human Animation
Keqi Chen, Wenxin Fu, Qihang Lu, Zekai Sun, Yizhong Geng, Yi Liu, Puyuan Guo, Yingming Gao, Ya Li
ACM Multimedia · 2025
Explores multimodal emotional support for human animation with LLM-agent orchestration.
EEG-based Voice Conversion: Hearing the Voice of Your Brain
Yizhong Geng, Wenxin Fu, Qihang Lu, Bingsong Bai, Cong Wang, Yingming Gao, Ya Li†
INTERSPEECH · 2025
Proposes the first EEG-based zero-shot voice conversion framework, linking neural activity with speaker-specific voice characteristics for assistive communication and brain-computer interfaces.
LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model
Yirong Sun, Yizhong Geng, Peidong Wei, Yanjun Chen, Jinghan Yang, Rongfei Chen, Wei Zhang, Xiaoyu Shen
CoRR · 2025
An open end-to-end framework, datasets, benchmark, and reference model for reproducible research in large speech-language models.
Scaling Under-Resourced TTS: A Data-Optimized Framework with Advanced Acoustic Modeling for Thai
Yizhong Geng, Jizhuo Xu, Zeyu Liang, Jinghan Yang, Xiaoyi Shi, Xiaoyu Shen†
ACL · 2025
Builds a scalable industrial Thai TTS framework with data construction, phoneme-tone modeling, and acoustic modeling for low-resource speech synthesis.
DetailTTS: Learning Residual Detail Information for Zero-shot Text-to-Speech
Cong Wang, Yichen Han, Yizhong Geng, Yingming Gao, Fengping Wang, Bingsong Bai, Qifei Li, Jinlong Xue, Yayue Deng, Zhengqi Wen, Ya Li
IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) · 2025
Improves zero-shot TTS quality by modeling residual detail information for expressive speech synthesis.