LoRA e RLVR: comparação entre estratégias em vários domínios
Publicado em 3 de janeiro de 2026, o relato compara estratégias práticas de PEFT para RLVR em múltiplos domínios. Nos experimentos descritos, a média de LoRAs especialistas seguida de treinamento contínuo superou o método de gating testado.
Em 3 de janeiro de 2026, o autor relatou experimentos de treinamento por RL em vários domínios e com LoRAs especialistas. Segundo o relato, o treinamento conjunto apresentou interferência. A comparação aborda estratégias práticas de PEFT para RLVR; entre as abordagens testadas, a média dos pesos das LoRAs especialistas, seguida de treinamento contínuo, superou uma abordagem com gate.
O resultado é um achado dos experimentos relatados, não uma conclusão universal sobre métodos de treinamento. Para avaliar seu alcance, consulte a publicação original e verifique nela a configuração experimental, as métricas e os detalhes das abordagens comparadas; o resumo disponível não especifica esses elementos.