Multimodal speech quality QA system that turns objective assessment into a natural-language task using audio encoders (AST/Whisper) and a LLaMA-based “quality expert” to predict MOS, dimension-wise scores, and explanations. - View it on GitHub
Star
0
Rank
14405328