vix.ing
·
top
·
new
·
best
·
stats
·
spec
Martino M. L. Pulici
MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models
2026/07/20 by
Martino M. L. Pulici
,
Cuong Xuan Chu
,
Evgeny Kharlamov
+3
#cs.LG
#cs.AI
#cs.CL
#cs.MA