Multi-Modal Semantic Expansion with Constrained LLM Reranking for Conversational Music Recommendation· 多模态约束LLM重排序在对话音乐推荐中的应用
We present Team Semiintelligencn's solution for the ACM RecSys 2026 TalkPlayData Challenge, addressing conversational music recommendation through a multi-modal and personalized conversational recommender system. Our submitted system employs a three-stage pipeline: (1) multi-modal retrieval constructing decay-weighted centroids across seven dense embedding spaces - track- and user-level CF-BPR, Qwen3 (metadata, lyrics, attributes), CLAP audio, and SigLIP visual - supplemented by BM25 lexical retrieval and an artist substring-match signal, all fused via weighted Reciprocal Rank Fusion (RRF) with optimized signal weights; (2) lightweight reranking (history filtering, popularity smoothing, and catalog diversity penalization); and (3) persona-diversified response generation using GPT-4o-mini.
多模态约束LLM重排序用于对话音乐推荐的个性化系统
- 核心方法
- 采用三阶段管道:多模态检索(包括七种密集嵌入空间和BM25词法检索)、轻量级重排序(历史过滤、流行度平滑和目录多样性惩罚)、角色多样化响应生成(使用GPT-4o-mini)
- 适合谁读
- 研究者 / 工程师 / 产品经理
- 要解决的问题
- 如何在对话情境下通过多模态信息提升音乐推荐的准确性和个性化程度
- 关键实验
- 未提供
- 主要贡献
- 提出了一种结合多模态信息和个人对话历史的先进音乐推荐方法
- 意义与局限
- 该方法可以显著提高音乐推荐系统的用户体验和推荐质量,但需要大量高质量的多模态数据支持