Publicação datada de 17 de setembro de 2026 descreve o TinyLoRA e relata ganhos em três benchmarks com treinamento por RL e 13 parâmetros.
Uma publicação datada de 17 de setembro de 2026 apresenta o TinyLoRA, método que substitui a matriz de baixo rank do LoRA por um vetor treinável projetado por um tensor aleatório. A proposta investiga se o ajuste fino baseado em aprendizado por reforço pode reduzir parâmetros e uso de memória dos adapters.
Segundo o texto, o treinamento com GRPO e 13 parâmetros elevou as pontuações do Qwen2.5-7B-Instruct nos benchmarks GSM8K, MATH500 e AIME24. Para conferir os resultados e seus detalhes, consulte a publicação original e verifique a configuração, as métricas e as comparações reportadas; o resumo disponível não informa valores numéricos.