Pular para o conteúdo
Rota Nacional

Radar ·

TinyLoRA testa ajuste com RL usando 13 parâmetros

Publicação datada de 17 de setembro de 2026 descreve o TinyLoRA e relata ganhos em três benchmarks com treinamento por RL e 13 parâmetros.

Uma publicação datada de 17 de setembro de 2026 apresenta o TinyLoRA, método que substitui a matriz de baixo rank do LoRA por um vetor treinável projetado por um tensor aleatório. A proposta investiga se o ajuste fino baseado em aprendizado por reforço pode reduzir parâmetros e uso de memória dos adapters.

Segundo o texto, o treinamento com GRPO e 13 parâmetros elevou as pontuações do Qwen2.5-7B-Instruct nos benchmarks GSM8K, MATH500 e AIME24. Para conferir os resultados e seus detalhes, consulte a publicação original e verifique a configuração, as métricas e as comparações reportadas; o resumo disponível não informa valores numéricos.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis