Publications

Accepted research papers in speech synthesis, voice conversion, neural audio codec, and low-resource spoken language models.

Stabilizing Instruction Supervision for Instruct-TTS via Controllable Diversification and Drift Filtering

Yizhong Geng, Kecan Mao, Qifei Li, Cong Wang, Yingming Gao, Ruimin Wang, Chunfeng Wang, Hao Li, Ya Li

Proceedings of INTERSPEECH 2026 · 2026

Stabilizes Instruct-TTS supervision by combining controllable instruction diversification, semantic-drift filtering, and attribute-aligned acoustic perturbation.

CodePDFProjectDemo

CLASVS: Continuous-Latent Autoregression for Melody-Preserving Lyric Editing in Singing Voice Synthesis

Yizhong Geng, Tian-Hao Zhang, Chunfeng Wang, Wenxin Fu, Yingming Gao, Ruimin Wang, Zhou Pan, Kun Zhan, Liang Li, Ya Li

arXiv · 2026

Introduces continuous-latent autoregression for editing singing lyrics while preserving the reference melody, timing, singer identity, and expression.

PDFarXivProjectDemo

Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models

Yizhong Geng, Yanliang Li, Jinghan Yang, Tianhan Jiang, Boxun An, Ya Li, Xiaoyu Shen

International Conference on Machine Learning (ICML) · 2026

Studies synthetic data scaling for low-resource spoken language models and proposes self-alignment methods that improve stability and expressivity for Thai and Lao speech generation.

MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation

Yizhong Geng, Wenxin Fu, Kecan Mao, Qifei Li, Yingming Gao, Ruimin Wang, Chunfeng Wang, Hao Li, Ya Li, Wei Chen

IEEE International Conference on Multimedia and Expo (ICME) · 2026

Introduces a neural audio codec that embeds melodic structure into discrete representations for high-fidelity and controllable singing voice generation.

HQ-SVC: Towards High-Quality Zero-Shot Singing Voice Conversion in Low-Resource Scenarios

Bingsong Bai, Yizhong Geng, Fengping Wang, Cong Wang, Puyuan Guo, Yingming Gao, Ya Li

Proceedings of the AAAI Conference on Artificial Intelligence · 2026

Presents an efficient zero-shot singing voice conversion system for low-resource scenarios, improving conversion quality and supporting voice super-resolution.

PDFProjectHuggingFace

Mel-Refine: A Plug-and-Play Approach to Refine Mel-Spectrogram in Audio Generation

Hongming Guo, Ruibo Fu, Yizhong Geng, Shuchen Shi, Tao Wang, Chunyu Qiang, Ya Li, Zhengqi Wen, Yukun Liu, Xuefei Liu, Chenxing Li

IEEE Automatic Speech Recognition and Understanding Workshop (ASRU) · 2025

A plug-and-play mel-spectrogram refinement approach for improving diffusion-based text-to-audio generation without retraining.

Project

Multi-Loss Learning for Speech Emotion Recognition with Energy-Adaptive Mixup and Frame-Level Attention

Cong Wang, Yizhong Geng, Yuhua Wen, Qifei Li, Yingming Gao, Ruimin Wang, Chunfeng Wang, Hao Li, Ya Li, Wei Chen

CoRR · 2025

Combines energy-adaptive mixup, frame-level attention, and multi-loss learning for robust speech emotion recognition.

Project

EMO-Avatar: An LLM-Agent-Orchestrated Framework for Multimodal Emotional Support in Human Animation

Keqi Chen, Wenxin Fu, Qihang Lu, Zekai Sun, Yizhong Geng, Yi Liu, Puyuan Guo, Yingming Gao, Ya Li

ACM Multimedia · 2025

Explores multimodal emotional support for human animation with LLM-agent orchestration.

Project

EEG-based Voice Conversion: Hearing the Voice of Your Brain

Yizhong Geng, Wenxin Fu, Qihang Lu, Bingsong Bai, Cong Wang, Yingming Gao, Ya Li

INTERSPEECH · 2025

Proposes the first EEG-based zero-shot voice conversion framework, linking neural activity with speaker-specific voice characteristics for assistive communication and brain-computer interfaces.

PDFProject

LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model

Yirong Sun, Yizhong Geng, Peidong Wei, Yanjun Chen, Jinghan Yang, Rongfei Chen, Wei Zhang, Xiaoyu Shen

CoRR · 2025

An open end-to-end framework, datasets, benchmark, and reference model for reproducible research in large speech-language models.

CodeProject

Scaling Under-Resourced TTS: A Data-Optimized Framework with Advanced Acoustic Modeling for Thai

Yizhong Geng, Jizhuo Xu, Zeyu Liang, Jinghan Yang, Xiaoyi Shi, Xiaoyu Shen

ACL · 2025

Builds a scalable industrial Thai TTS framework with data construction, phoneme-tone modeling, and acoustic modeling for low-resource speech synthesis.

PDFProject

DetailTTS: Learning Residual Detail Information for Zero-shot Text-to-Speech

Cong Wang, Yichen Han, Yizhong Geng, Yingming Gao, Fengping Wang, Bingsong Bai, Qifei Li, Jinlong Xue, Yayue Deng, Zhengqi Wen, Ya Li

IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) · 2025

Improves zero-shot TTS quality by modeling residual detail information for expressive speech synthesis.

Project