Capacidade máxima não é eficiência máxima.
Capacity-Optimal Codes Are Not Energy-Optimal: The Synaptic Efficiency Coefficient as an Architectural Prior for Language Models. Paulo Câmara, LUA Vision, São Paulo.
A IA de hoje melhora ficando maior.
Cada salto de tamanho custa mais energia, mais chips e mais data center. Este trabalho defende outro eixo, que o cérebro usa há muito tempo: não guardar mais, e sim escolher melhor o que guardar.
Isso interessa a quem paga a conta de IA, a quem precisa rodar IA no próprio servidor, e a um país como o Brasil, que não vai ganhar a corrida do tamanho.
Dois ótimos diferentes.
O código com maior capacidade não é o mais eficiente quando a energia entra na conta. Otimizar um não aproxima do outro.
A IA de hoje otimiza o primeiro e deixa o segundo para depois do treino. A essa altura a arquitetura já foi escolhida pela função objetivo errada.
Longe do piso.
O mínimo físico para apagar um bit é 3 × 10⁻²¹ J. Uma sinapse química gasta cerca de 10⁴ ATP por bit, perto de 10⁻¹⁵ J. Sinal graduado e spike gastam de 10⁶ a 10⁷ ATP por bit, entre 10⁻¹³ e 10⁻¹² J (Laughlin et al., 1998).
O melhor sistema que a natureza produziu opera de cinco a oito ordens de grandeza acima do limite. O espaço de projeto não se esgotou.
O custo que não caiu.
FlashAttention derrubou a memória da atenção de O(n²) para O(n). A conta de operações continua quadrática. Tornou o custo tolerável, não menor.
SEC = α · β · γ
Poda, potenciação e consolidação, em sequência, sobre populações aninhadas de sinapses. Cada estágio age sobre o que o anterior deixou.
Produto, não soma.
Se um estágio zera, o resultado tem que zerar. A soma não respeita isso.
Com vinte por cento de ganho em cada termo, o produto dá 1,728 e a soma dá 1,6.
Mesmo substrato, filtro diferente.
Para α, a densidade de espinhos dendríticos em BA21 (Tang et al., 2014): da infância à adolescência, o grupo controle perde 45% e o grupo com TEA perde 16%.
Para β e γ, o modelo de valproato (Markram e Markram, 2010): LTP dobrada e memória de medo resistente à extinção. O desenvolvimento atípico separa estágios que no caso típico andam juntos.
O que derrubaria o coeficiente.
Proponho medir acurácia por joule. Se a ligação entre cada termo e a decisão de arquitetura não sobreviver a essa medida, o coeficiente cai. O paper declara essas condições.
Como citar.
Câmara, P. (2026). Capacity-Optimal Codes Are Not Energy-Optimal: The Synaptic Efficiency Coefficient as an Architectural Prior for Language Models (Versão 1.1). LUA Vision Tecnologia. https://doi.org/10.5281/zenodo.22881788
@misc{camara2026sec,
author = {C{\^a}mara, Paulo},
title = {Capacity-Optimal Codes Are Not Energy-Optimal: The Synaptic
Efficiency Coefficient as an Architectural Prior for
Language Models},
year = {2026},
version = {1.1},
publisher = {LUA Vision Tecnologia},
doi = {10.5281/zenodo.22881788},
url = {https://doi.org/10.5281/zenodo.22881788}
}