Pular para o conteúdo
Rota Nacional

Guias ·

Replay buffer de RL com amostragem top-k em SQL

O Replayhouse relata usar uma tabela e SQL para amostragem ponderada top-k em um replay buffer de aprendizagem por reforço, com filtros WHERE e um teste de desempenho em laptop.

O Replayhouse apresenta um replay buffer de aprendizagem por reforço implementado em uma tabela. A amostragem ponderada top-k de Efraimidis-Spirakis é feita em SQL, e filtros WHERE permitem restringir as amostras.

No teste relatado, foram selecionadas 8.192 linhas entre 50 milhões em cerca de 1,1 segundo em um laptop. Esse número descreve aquele teste; não garante o mesmo desempenho em outras máquinas ou cargas.

Para avaliar a abordagem, identifique primeiro os filtros necessários e compare a implementação com o método de amostragem usado hoje. Teste com dados e cargas representativos, verificando tanto o resultado da seleção quanto o tempo de execução.

Se usar IA para estudar ou aplicar a técnica, não envie dados de treino ou registros identificáveis sem autorização. Remova informações pessoais ou use dados sintéticos; confira também se a política da sua organização permite compartilhar o material.

Receber novos artigos

Privacidade, engenharia de IA e segurança no seu e-mail.

Rota Nacional

Leve a privacidade para o seu processo.

30 dias, sem cartão, com quota inicial. Depois, crédito por Pix a partir de R$ 5,00.

Testar grátis