vix.ing · top · new · best · stats · spec

Martino M. L. Pulici

  1. MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models
    2026/07/20 by Martino M. L. Pulici, Cuong Xuan Chu, Evgeny Kharlamov +3
    #cs.LG #cs.AI #cs.CL #cs.MA