arXiv: LLM marketing / consumer· Shuze Daniel Liu·· 6 天前AI 评分8
用强化学习训练 LLM 智能体在多产品市场中做销售
Learning to Sell: Reinforcement Learning for Strategic Large Language Model Agents in Multi-Product Markets
AI 导读
研究者提出用可验证奖励强化学习(RLVR)训练 LLM 智能体,使其在多产品议价环境中充当卖家,在信息不对称和沟通轮次受限下动态匹配买家与最有利可图的商品。该框架将问题形式化为部分可观测马尔可夫决策过程,并采用四段式消息协议把自然语言映射为可解析的决策空间。
来源:arXiv: LLM marketing / consumer · arxiv.org