metodologia

como medimos se uma estratégia funciona.

Toda estratégia parece boa em algum recorte do passado. O trabalho desta plataforma é decidir quando um resultado é evidência e quando é sorte — e recusar o segundo caso, mesmo quando ele é o mais bonito da tela.

A unidade de medida é a célula

Uma célula é um par com um preset: BTCUSDT com o preset wide, por exemplo. Cada célula tem conta própria, histórico próprio e é julgada sozinha. Presets diferentes no mesmo par são experimentos diferentes, e é por isso que a mesma moeda aparece mais de uma vez no ranking.

Julgar par e preset juntos seria confundir duas coisas que podem discordar: um preset pode funcionar em BTCUSDT e falhar em ETHUSDT, e a média dos dois não descreve nenhum.

O resultado é contado em R, não em reais

R é o resultado de uma operação medido em múltiplos do risco dela. Ganhar 2R é ganhar duas vezes o que se arriscava. Contar em R permite comparar operações de tamanhos diferentes, em contas de tamanhos diferentes, sem que a maior domine a conta pela escala em vez de pelo acerto.

Poucas operações são puxadas para o ceticismo

A média bruta de uma célula com quatro operações não descreve a célula, descreve aquelas quatro. Antes de qualquer conclusão, a expectativa observada é encolhida em direção ao que o histórico de replay daquele par e preset já dizia, com peso proporcional à quantidade de evidência própria.

Na prática: com poucas operações a estimativa fica perto do histórico; conforme a célula acumula resultados próprios, ela vai ganhando o direito de discordar dele. Nenhuma célula convence o sistema com um dia bom.

O ranking ordena pelo pior caso, não pela média

O limite inferior é a expectativa encolhida menos 1,645 erro padrão: o pior caso ainda compatível com a evidência acumulada, num intervalo de 95%. É por ele que o ranking ordena.

Ordenar pela média colocaria uma célula com quatro operações de sorte acima de uma com quatrocentas honestas. O limite inferior sobe de dois jeitos — ganhando mais, ou provando o que já se ganha — e nenhum deles é ter sorte uma vez.

O custo da prova

Ao lado de cada célula, a plataforma mostra quantas operações ainda faltam para o limite inferior dela ficar positivo no ritmo atual. Número grande não quer dizer célula ruim: quer dizer célula ainda não provada, e diz exatamente quanto falta.

O tamanho da aposta sai da evidência, não da opinião

Quanto cada célula arrisca por operação é calculado a partir do que ela mesma provou. A fração ótima vem do critério de Kelly, dividida pela metade — Kelly cheio maximiza o crescimento e maximiza também a chance de ruína no caminho — e depois multiplicada pela probabilidade de a vantagem ser positiva.

  • Célula pouco provada aposta pouco, sozinha, sem ninguém decidir isso na mão.
  • Célula que acumula evidência vai podendo apostar mais, na medida do que provou.
  • A posição no ranking nunca entra nessa conta: se a aposta dependesse das células vizinhas, células sem relação ficariam acopladas e o dimensionamento deixaria de ser reproduzível a partir do histórico da própria célula.

O portão de evidência: o silêncio é a parte que funciona

Uma célula só manda alerta depois de fechar um mínimo de operações dela mesma. O histórico de replay não conta para isso — uma célula pode parecer excelente no arquivo e nunca ter dito nada ao vivo.

É esse silêncio que faz o aviso valer alguma coisa. Sessenta e seis células produzem cerca de cem sinais por dia, e quase nenhuma delas ganhou o direito de interromper alguém com um. O que a plataforma segura fica registrado, com o motivo, e aparece na tela de alertas: silêncio sem rastro é indistinguível de defeito.

O mesmo dado produz o mesmo resultado, sempre

O motor é determinístico: reprocessar o mesmo histórico produz exatamente o mesmo fluxo de eventos, evento a evento. Isso é o que permite auditar um sinal até a vela que o originou, e é o que impede que uma mudança silenciosa no código passe despercebida — cada evento guarda a versão das regras e a impressão digital da configuração que o produziu.

A régua vale contra nós também

Esta mesma metodologia já reprovou coisas nossas. Uma busca automática de parâmetros foi testada em dois instrumentos e produziu correlações significativas com sinais opostos — o que prova que ambas eram espúrias, não que uma delas estava certa. A conclusão foi que o gargalo é taxa de amostragem, não algoritmo, e a ideia foi descartada.

Um objetivo de crescimento agressivo que existia no projeto foi submetido a vinte mil simulações e refutado. O estudo continua publicado no repositório, com o número, em vez de ter sido apagado.