metodologia
como medimos se uma estratégia funciona.
Toda estratégia parece boa em algum recorte do passado. O trabalho desta plataforma é decidir quando um resultado é evidência e quando é sorte — e recusar o segundo caso, mesmo quando ele é o mais bonito da tela.
A unidade de medida é a célula
Uma célula é um par com um preset: BTCUSDT com o preset wide, por exemplo. Cada célula tem conta própria, histórico próprio e é julgada sozinha. Presets diferentes no mesmo par são experimentos diferentes, e é por isso que a mesma moeda aparece mais de uma vez no ranking.
Julgar par e preset juntos seria confundir duas coisas que podem discordar: um preset pode funcionar em BTCUSDT e falhar em ETHUSDT, e a média dos dois não descreve nenhum.
O resultado é contado em R, não em reais
R é o resultado de uma operação medido em múltiplos do risco dela. Ganhar 2R é ganhar duas vezes o que se arriscava. Contar em R permite comparar operações de tamanhos diferentes, em contas de tamanhos diferentes, sem que a maior domine a conta pela escala em vez de pelo acerto.
Poucas operações são puxadas para o ceticismo
A média bruta de uma célula com quatro operações não descreve a célula, descreve aquelas quatro. Antes de qualquer conclusão, a expectativa observada é encolhida em direção ao que o histórico de replay daquele par e preset já dizia, com peso proporcional à quantidade de evidência própria.
Na prática: com poucas operações a estimativa fica perto do histórico; conforme a célula acumula resultados próprios, ela vai ganhando o direito de discordar dele. Nenhuma célula convence o sistema com um dia bom.
O ranking ordena pelo pior caso, não pela média
O limite inferior é a expectativa encolhida menos 1,645 erro padrão: o pior caso ainda compatível com a evidência acumulada, num intervalo de 95%. É por ele que o ranking ordena.
Ordenar pela média colocaria uma célula com quatro operações de sorte acima de uma com quatrocentas honestas. O limite inferior sobe de dois jeitos — ganhando mais, ou provando o que já se ganha — e nenhum deles é ter sorte uma vez.
O custo da prova
Ao lado de cada célula, a plataforma mostra quantas operações ainda faltam para o limite inferior dela ficar positivo no ritmo atual. Número grande não quer dizer célula ruim: quer dizer célula ainda não provada, e diz exatamente quanto falta.
O tamanho da aposta sai da evidência, não da opinião
Quanto cada célula arrisca por operação é calculado a partir do que ela mesma provou. A fração ótima vem do critério de Kelly, dividida pela metade — Kelly cheio maximiza o crescimento e maximiza também a chance de ruína no caminho — e depois multiplicada pela probabilidade de a vantagem ser positiva.
- Célula pouco provada aposta pouco, sozinha, sem ninguém decidir isso na mão.
- Célula que acumula evidência vai podendo apostar mais, na medida do que provou.
- A posição no ranking nunca entra nessa conta: se a aposta dependesse das células vizinhas, células sem relação ficariam acopladas e o dimensionamento deixaria de ser reproduzível a partir do histórico da própria célula.
O portão de evidência: o silêncio é a parte que funciona
Uma célula só manda alerta depois de fechar um mínimo de operações dela mesma. O histórico de replay não conta para isso — uma célula pode parecer excelente no arquivo e nunca ter dito nada ao vivo.
É esse silêncio que faz o aviso valer alguma coisa. Sessenta e seis células produzem cerca de cem sinais por dia, e quase nenhuma delas ganhou o direito de interromper alguém com um. O que a plataforma segura fica registrado, com o motivo, e aparece na tela de alertas: silêncio sem rastro é indistinguível de defeito.
O mesmo dado produz o mesmo resultado, sempre
O motor é determinístico: reprocessar o mesmo histórico produz exatamente o mesmo fluxo de eventos, evento a evento. Isso é o que permite auditar um sinal até a vela que o originou, e é o que impede que uma mudança silenciosa no código passe despercebida — cada evento guarda a versão das regras e a impressão digital da configuração que o produziu.
A régua vale contra nós também
Esta mesma metodologia já reprovou coisas nossas. Uma busca automática de parâmetros foi testada em dois instrumentos e produziu correlações significativas com sinais opostos — o que prova que ambas eram espúrias, não que uma delas estava certa. A conclusão foi que o gargalo é taxa de amostragem, não algoritmo, e a ideia foi descartada.
Um objetivo de crescimento agressivo que existia no projeto foi submetido a vinte mil simulações e refutado. O estudo continua publicado no repositório, com o número, em vez de ter sido apagado.