O briefing sobre o Strata relata um motor de inferência local e medições de processamento de prompts feitas pelo autor. Esses números ajudam a formular um teste, mas não são garantia para outra máquina, modelo ou carga.
Meça o caminho completo da sua aplicação: preparo do contexto, tratamento dos dados, espera e geração. Um ganho no motor pode desaparecer quando documentos maiores ou várias sessões chegam ao mesmo tempo. Registre configuração e tamanho das entradas para comparar resultados.
Inclua privacidade no mesmo experimento. Modelo local pode receber dados em excesso, e os programas ao redor podem gravar prompts em arquivos. Reduza o conteúdo ao necessário, restrinja acesso e confira o que fica retido em cada componente.
Use amostras fictícias para comparar resposta, latência e efeito da sanitização. A API da Rota oferece uma camada de política antes da inferência; não instala esse motor na sua máquina nem garante que toda execução oferecida pela plataforma tenha residência nacional.