Skip to content

Commit 1ffd388

Browse files
docs: benchmarks reais medidos em 9 datasets + nuance honesta
Mede dNaty real em MNIST, Fashion-MNIST, CIFAR-10 e 6 datasets reais (UCI Adult/Covertype/Wine + 3 social-media). Held-out acc, 6 cores CPU. Verdade honesta: compressao depende de quao superdimensionado e o modelo. Inchado -> -50%+ (MNIST -50%, Fashion -55%, Wine -78%). Ja enxuto -> corte pequeno (Adult -2.7%, Covertype -1.5%), comportamento Pareto correto. MLP-only: CIFAR/RGB trava em 46%, conv NAS e WIP. BENCHMARKS_REAL.md: tabela completa + repro. MARKETING.md: secao 8 com numeros defensaveis e a nuance pra nao overclaim. Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
1 parent 43b0e63 commit 1ffd388

3 files changed

Lines changed: 92 additions & 0 deletions

File tree

BENCHMARKS_REAL.md

Lines changed: 58 additions & 0 deletions
Original file line numberDiff line numberDiff line change
@@ -0,0 +1,58 @@
1+
# dNATY — Benchmarks reais (medidos)
2+
3+
> Todos os números abaixo foram **medidos**, não estimados. Hardware: 6 núcleos de CPU.
4+
> Config padrão: `n_generations=30, n_pop=15, t_local=3`. Acurácia em conjunto de teste
5+
> **separado** (held-out), não no treino. Reproduzível com os scripts em `scripts/`.
6+
> Data da medição: 2026-06.
7+
8+
## Resultados por dataset
9+
10+
| Dataset (real) | Linhas | Features | Classes | init_hidden | Tempo | FLOPs ↓ | Acurácia |
11+
|---|---|---|---|---|---|---|---|
12+
| MNIST | 10.000 | 784 | 10 | [512,256] | 4,1 min | **−50.4%** | 97.0% |
13+
| Fashion-MNIST | 10.000 | 784 | 10 | [512,256] | 4,1 min | **−54.6%** | 86.4% |
14+
| UCI Wine Quality (red) | 1.599 | 11 | 6 | [256,128] | 37 s | **−78.4%** | 63.7% |
15+
| UCI Adult / Census Income | 10.000 | 104 | 2 | [256,128] | 3,6 min | −2.7% | 84.0% |
16+
| UCI Covertype | 10.000 | 54 | 7 | [256,128] | 4,1 min | −1.5% | 78.1% |
17+
| Social Friction (students vs workers) | 400 | 14 | 3 | [128,64] | 13 s | −6.9% | 100% |
18+
| Social Friction v2 | 500 | 16 | 2 | [128,64] | 17 s | −5.4% | 85.0% |
19+
| Indonesian Youth Digital Friction | 1.000 | 2 | 2 | [128,64] | 27 s | −1.5% | 99.5% |
20+
| CIFAR-10 (MLP) | 10.000 | 3.072 | 10 | [512,256] | 13,4 min | −1.2% | 46.4% |
21+
22+
Fontes dos datasets:
23+
- MNIST / Fashion-MNIST / CIFAR-10 — torchvision (datasets reais padrão)
24+
- UCI Adult, Covertype, Wine Quality — UC Irvine ML Repository (download direto, sem auth)
25+
- Social Friction / Indonesian Youth — datasets reais de comportamento em redes sociais (CSV)
26+
27+
## Como ler estes números (honesto)
28+
29+
**A magnitude da compressão depende de quanta capacidade redundante o modelo inicial tem.**
30+
Não é "−50% em qualquer modelo":
31+
32+
- **Modelo superdimensionado para a tarefa → corte grande.**
33+
MNIST (−50%), Fashion-MNIST (−55%), Wine (−78%). O MLP inicial tinha gordura; o NAS achou
34+
uma rede muito menor que mantém a acurácia.
35+
36+
- **Modelo já bem dimensionado → corte pequeno.**
37+
Adult (−2.7%), Covertype (−1.5%). Isso é o comportamento **correto** de uma busca Pareto:
38+
ela não deve inflar nem quebrar um modelo que já é eficiente. "Pouco corte" aqui significa
39+
"seu modelo já estava perto do tamanho certo".
40+
41+
- **Limite real — só MLP hoje.**
42+
CIFAR-10 com MLP trava em ~46% (imagem RGB precisa de convolução). dNaty hoje é forte em
43+
dados MLP-friendly (tabular, imagem simples); busca em espaço de convoluções é trabalho futuro.
44+
45+
## Claim defensável (o que dá pra afirmar sem ser crucificado)
46+
47+
> "O dNaty encontra a menor arquitetura que mantém a acurácia. Em modelos superdimensionados
48+
> isso é um corte de 50%+ de FLOPs (medido: MNIST −50%, Fashion-MNIST −55%, em ~4 min numa CPU
49+
> de 6 núcleos). Em modelos já enxutos ele corta pouco — de propósito. Hoje é MLP-only;
50+
> imagem RGB complexa via conv net é trabalho futuro."
51+
52+
## Reproduzir
53+
54+
```bash
55+
python scripts/real_benchmarks.py # MNIST/Fashion via compress() + tabulares sociais
56+
python scripts/real_benchmarks_uci.py # UCI Adult / Covertype / Wine
57+
python scripts/fetch_real_datasets.py # baixa os UCI (sem auth)
58+
```

MARKETING.md

Lines changed: 19 additions & 0 deletions
Original file line numberDiff line numberDiff line change
@@ -196,6 +196,25 @@ O dashboard hoje cai direto na lista de treinos. Sugestão de primeiro acesso (e
196196
197197
---
198198
199+
## 8. Dados reais para citar (medidos — ver BENCHMARKS_REAL.md)
200+
201+
> Use SÓ estes números em posts/templates. Todos medidos, 6 cores CPU, held-out acc.
202+
203+
**Defensáveis (compressão forte, modelo superdimensionado):**
204+
- MNIST: **50.4% FLOPs**, 97.0% acc, ~4 min
205+
- Fashion-MNIST: **54.6% FLOPs**, 86.4% acc, ~4 min
206+
- UCI Wine Quality: −78.4% FLOPs (modelo enorme demais p/ a tarefa)
207+
208+
**A nuance honesta (sempre incluir quando questionado):**
209+
> "A compressão depende de quão inchado está o modelo. Superdimensionado → −50%+.
210+
> Já enxuto (ex: UCI Adult −2.7%, Covertype −1.5%) → corta pouco, de propósito.
211+
> Hoje é MLP-only; imagem RGB via conv net é trabalho futuro."
212+
213+
**NUNCA** citar "−50% em qualquer modelo" — é falso e te queima. O claim certo é
214+
"acha o tamanho certo": corte grande no inchado, corte pequeno no que já é eficiente.
215+
216+
---
217+
199218
## 7. Checklist de execução
200219
201220
- [x] Landing: seção "How it's different" (vs pruning/quant/distillation/NAS) — **feito**

README.md

Lines changed: 15 additions & 0 deletions
Original file line numberDiff line numberDiff line change
@@ -117,6 +117,21 @@ dNATY achieves **6.9× less catastrophic forgetting** than EWC.
117117

118118
All numbers reproducible: `python scripts/prove_it.py`
119119

120+
### Measured across real datasets
121+
122+
Compression depends on how oversized your model is — dNATY finds the right size, it doesn't force a fixed cut. Measured on CPU (held-out accuracy):
123+
124+
| Dataset | FLOPs ↓ | Accuracy | Note |
125+
|---|---|---|---|
126+
| MNIST | **−50.4%** | 97.0% | oversized MLP → big cut |
127+
| Fashion-MNIST | **−54.6%** | 86.4% | oversized MLP → big cut |
128+
| UCI Wine Quality | −78.4% | 63.7% | extra capacity useless → shrinks hard |
129+
| UCI Adult / Census | −2.7% | 84.0% | already lean → small cut (correct) |
130+
| UCI Covertype | −1.5% | 78.1% | already lean → small cut (correct) |
131+
| CIFAR-10 (MLP) | −1.2% | 46.4% | MLP unfit for RGB — conv NAS is WIP |
132+
133+
Full table, config, and reproduction: [BENCHMARKS_REAL.md](BENCHMARKS_REAL.md).
134+
120135
---
121136

122137
## Real examples

0 commit comments

Comments
 (0)