LUA VISION

Capacidade máxima não é eficiência máxima.

Capacity-Optimal Codes Are Not Energy-Optimal: The Synaptic Efficiency Coefficient as an Architectural Prior for Language Models. Paulo Câmara, LUA Vision, São Paulo.

A IA de hoje melhora ficando maior.

Cada salto de tamanho custa mais energia, mais chips e mais data center. Este trabalho defende outro eixo, que o cérebro usa há muito tempo: não guardar mais, e sim escolher melhor o que guardar.

Isso interessa a quem paga a conta de IA, a quem precisa rodar IA no próprio servidor, e a um país como o Brasil, que não vai ganhar a corrida do tamanho.

Dois ótimos diferentes.

O código com maior capacidade não é o mais eficiente quando a energia entra na conta. Otimizar um não aproxima do outro.

A IA de hoje otimiza o primeiro e deixa o segundo para depois do treino. A essa altura a arquitetura já foi escolhida pela função objetivo errada.

Longe do piso.

O mínimo físico para apagar um bit é 3 × 10⁻²¹ J. Uma sinapse química gasta cerca de 10⁴ ATP por bit, perto de 10⁻¹⁵ J. Sinal graduado e spike gastam de 10⁶ a 10⁷ ATP por bit, entre 10⁻¹³ e 10⁻¹² J (Laughlin et al., 1998).

O melhor sistema que a natureza produziu opera de cinco a oito ordens de grandeza acima do limite. O espaço de projeto não se esgotou.

O custo que não caiu.

FlashAttention derrubou a memória da atenção de O(n²) para O(n). A conta de operações continua quadrática. Tornou o custo tolerável, não menor.

SEC = α · β · γ

Poda, potenciação e consolidação, em sequência, sobre populações aninhadas de sinapses. Cada estágio age sobre o que o anterior deixou.

Produto, não soma.

Se um estágio zera, o resultado tem que zerar. A soma não respeita isso.

Com vinte por cento de ganho em cada termo, o produto dá 1,728 e a soma dá 1,6.

Mesmo substrato, filtro diferente.

Para α, a densidade de espinhos dendríticos em BA21 (Tang et al., 2014): da infância à adolescência, o grupo controle perde 45% e o grupo com TEA perde 16%.

Para β e γ, o modelo de valproato (Markram e Markram, 2010): LTP dobrada e memória de medo resistente à extinção. O desenvolvimento atípico separa estágios que no caso típico andam juntos.

O que derrubaria o coeficiente.

Proponho medir acurácia por joule. Se a ligação entre cada termo e a decisão de arquitetura não sobreviver a essa medida, o coeficiente cai. O paper declara essas condições.

Como citar.

Câmara, P. (2026). Capacity-Optimal Codes Are Not Energy-Optimal: The Synaptic Efficiency Coefficient as an Architectural Prior for Language Models (Versão 1.1). LUA Vision Tecnologia. https://doi.org/10.5281/zenodo.22881788

@misc{camara2026sec,
  author    = {C{\^a}mara, Paulo},
  title     = {Capacity-Optimal Codes Are Not Energy-Optimal: The Synaptic
               Efficiency Coefficient as an Architectural Prior for
               Language Models},
  year      = {2026},
  version   = {1.1},
  publisher = {LUA Vision Tecnologia},
  doi       = {10.5281/zenodo.22881788},
  url       = {https://doi.org/10.5281/zenodo.22881788}
}