AgentCom · Linha de Pesquisa · Agente multilíngue

Redes Neurais Artificiais e Redes Neurais Naturais: Um Paralelo

A Bioquímica das Sinapses entre Neurônios e suas Implicações para Arquiteturas de Agentes Inteligentes

Demonstração ao vivo
Converse com a tese, não só leia sobre ela

Instância pública do AgentCom. Esta demonstração permite testar diretamente a arquitetura proposta neste artigo. Sua conversa pode contribuir com a pesquisa, mediante consentimento explícito. O agente suporta qualquer idioma — português, inglês, espanhol — automaticamente, sem fine-tuning por idioma, porque o estado afetivo persistido é numérico e não atrelado aos tokens de uma língua. Veja a Seção 7 para o que isso demonstra e o que não demonstra.

[Agente embarcado entra aqui na próxima versão da landing — v0.1.0 ativará o demo funcional com transcrição via Whisper, consentimento de pesquisa LGPD art. 7º IV, e telemetria bioquímica observável.]

Abstract

As Redes Neurais Artificiais (RNA) foram concebidas a partir de uma analogia com o funcionamento do cérebro humano. No entanto, décadas de evolução tecnológica produziram arquiteturas cada vez mais sofisticadas sem necessariamente aprofundar essa analogia em sua dimensão mais fundamental: a bioquímica. As Redes Neurais Naturais (NNN — usada aqui como distinta da sigla RNN/Recurrent Neural Network da literatura de IA) operam não apenas através de conexões elétricas, mas por meio de um complexo sistema de modulação química — neurotransmissores e neuropeptídeos — que estabelece o estado de fundo sobre o qual toda atividade neural acontece. Este artigo propõe um paralelo sistemático entre RNA e NNN, identificando o que foi replicado artificialmente, o que permanece ausente e quais implicações esse hiato tem para o desenho de agentes inteligentes modernos. Argumenta-se que o hiato é duplo: ausência de (a) modulação bioquímica de estado e (b) memória procedural consolidada por plasticidade hebbiana. Propõe-se o AgentCom, arquitetura que endereça ambos os hiatos por meio de um mecanismo de sinapse digital, validado por análise de sentimento multi-resolução e auditado via cadeias socráticas; esta versão reporta a primeira implementação e validação de prova de conceito do mecanismo de memória procedural (Seção 5.4), até então apenas caracterizado teoricamente. Esta versão (v05) acrescenta a Seção 11, que especifica o mecanismo de recuperação ausente — um motor de convergência ponderada multi-agente que seleciona por menor divergência em relação ao contexto, e não por peso acumulado —, propõe um terceiro tipo de nó, o critério, como substrato de metacognição sobre o próprio sistema, e reporta convergência independente na literatura de 2026 ao lado de uma observação qualitativa de campo sobre diluição de contexto sob crescimento da base de conhecimento. O protocolo experimental pré-registrado, as hipóteses e as limitações conhecidas são declarados, com instância pública de demonstração disponível em agentcom.agtl.app para fins de reprodutibilidade.

§1Introdução

Quando Warren McCulloch e Walter Pitts publicaram, em 1943, o primeiro modelo matemático de um neurônio artificial, a intenção era clara: replicar o comportamento do cérebro humano em linguagem formal e computável [1]. Desde então, o campo evoluiu do perceptron de Rosenblatt [3] até os Transformers [4] que sustentam os grandes modelos de linguagem contemporâneos.

Paradoxalmente, quanto mais sofisticadas as RNAs se tornaram, mais distante ficou a analogia original. O foco migrou para desempenho, escala e capacidade de generalização — objetivos legítimos — mas a pergunta fundadora foi gradualmente silenciada: o que o cérebro faz que ainda não replicamos?

A resposta mais relevante não está na arquitetura das conexões. Está na bioquímica que as governa.

As NNNs não são apenas redes de disparos elétricos. São sistemas modulados continuamente por substâncias químicas — neurotransmissores e neuropeptídeos — que estabelecem o estado de fundo no qual toda cognição acontece [5][6]. Esse estado de fundo não existe nas RNAs atuais. E sua ausência tem consequências diretas para o desenho de agentes inteligentes.

Nota sobre terminologia: usamos NNN (Natural Neural Network) em vez da sigla alternativa RNN, estabelecida na literatura de IA como Recurrent Neural Network. NNN aqui refere-se exclusivamente a redes neurais biológicas, enquanto RNA refere-se às artificiais. Essa escolha elimina uma confusão recorrente observada em leituras críticas de versões anteriores.

§2A Rede Neural Natural — Além do Disparo Elétrico

2.1 A Sinapse Bioquímica

O neurônio biológico opera segundo um princípio binário em sua transmissão elétrica: dispara ou não dispara — o princípio tudo-ou-nada. No entanto, o que ocorre entre neurônios — na fenda sináptica — é fundamentalmente diferente. Ali, o sinal deixa de ser puramente elétrico e passa a ser eletroquímico.

Quando um potencial de ação chega ao terminal axônico, vesículas liberam neurotransmissores na fenda sináptica. Esses neurotransmissores se ligam a receptores no neurônio pós-sináptico, determinando se ele disparará ou não. A força dessa conexão — a eficácia sináptica — não é fixa. É modulável. É plástica [2][6].

2.2 Neurotransmissores — A Linguagem Local

Os neurotransmissores clássicos operam localmente, na escala da sinapse individual:

Neurotransmissor Estado/Emoção Efeito nas Sinapses
DopaminaPrazer, recompensaFortalece conexões da experiência
Adrenalina / NoradrenalinaMedo, alertaAcelera e prioriza circuitos específicos
SerotoninaBem-estar, calmaRegula o volume geral da rede
AcetilcolinaAtenção, aprendizadoModula a plasticidade sináptica
GABAInibiçãoReduz a excitabilidade neural

A memória, nesse contexto, não é armazenamento passivo. É fortalecimento ativo de sinapses — guiado pela carga emocional do momento. Experiências com alta valência emocional criam conexões mais densas e duradouras.

2.3 Neuropeptídeos — A Linguagem do Estado de Fundo

Aqui está a dimensão menos replicada e mais relevante para este paralelo.

Neuropeptídeos não operam na escala da sinapse individual. Eles modulam regiões inteiras do cérebro, alterando o estado de fundo sobre o qual toda atividade neural ocorre. Mais de 100 já foram identificados [6], com funções que vão da regulação da dor à modulação dos vínculos sociais.

Enquanto os neurotransmissores acendem e apagam circuitos específicos, os neuropeptídeos funcionam como a iluminação de uma sala — não determinam qual objeto você vê, mas a condição em que você vê tudo.

O trabalho seminal que estabeleceu essa visão foi conduzido por Candace Pert e colaboradores nos anos 1970 e 1980 [10][11]. Eles demonstraram que neuropeptídeos funcionam como mensageiros do que denominaram uma rede psicossomática — um sistema de comunicação que se estende para além do cérebro, alcançando o sistema imunológico, o sistema endócrino e as vísceras.

Essa descoberta deu origem ao campo da Psiconeuroimunologia (PNI), fundado por Ader e Cohen em 1975 [12], posteriormente consolidado pela demonstração de Blalock sobre a comunicação bidirecional entre sistemas imune e neuroendócrino [13]. O intestino produz aproximadamente 90% da serotonina do corpo. Células do sistema imune têm receptores para neuropeptídeos emocionais [13]. O estado bioquímico de fundo está, literalmente, distribuído por todo o corpo.

2.4 Plasticidade — O Sistema que Aprende ao Longo do Tempo

A plasticidade sináptica — sintetizada no princípio de Hebb (1949) [2], "neurônios que disparam juntos, conectam-se juntos" — é o mecanismo pelo qual a NNN aprende e se reconfigura ao longo do tempo. Conexões frequentemente ativadas se fortalecem. Conexões pouco usadas enfraquecem ou são eliminadas por poda sináptica.

Esse processo não é instantâneo. É cumulativo. O estado atual de uma rede neural natural é resultado de toda a sua história de ativações — filtrada, ponderada e modulada bioquimicamente.

2.5 Cadeia Causal — Cognição como Origem da Emoção

Uma concepção comum trata a emoção como resposta direta e automática a estímulos externos. Essa visão é incompleta. Como demonstram a pesquisa de Damásio sobre marcadores somáticos [14] e a teoria das emoções construídas de Barrett [15], a cadeia causal real é mais sofisticada:

ENTENDIMENTO DA REALIDADE (cognitivo/lógico) ↓ EMOÇÃO / SENTIMENTO (interpretação afetiva do entendimento) ↓ PRODUÇÃO QUÍMICA (substrato bioquímico do sentimento) ↓ ESTADO DE FUNDO (sopa neurobiológica modulada) ↓ DECISÃO (modulada pelo estado; recebe também input direto dos sistemas lógico e material)

A implicação é fundamental: a emoção não é input externo capturado automaticamente. É função do entendimento. A mesma realidade gera sentimentos distintos em indivíduos com entendimentos distintos — e portanto bioquímica distinta, estado distinto, decisão distinta. Essa visão tem raízes filosóficas profundas — Epiteto, no primeiro século, afirmou que "não são as coisas que perturbam os homens, mas as opiniões que eles têm sobre as coisas". A formulação clínica moderna está na terapia cognitiva de Beck [16]: pensamento → emoção → comportamento.

Para o AgentCom, essa cadeia causal tem consequências arquiteturais diretas. Detectar emoção de superfície (sentimento) captura apenas o terceiro passo da cadeia. A modulação completa exige também capturar o entendimento que o usuário tem da situação — o que justifica a camada de perfil relacional (Seção 5.1).

§3A Rede Neural Artificial — O Que Foi Replicado

3.1 Do Perceptron ao Transformer

O perceptron de Rosenblatt (1958) [3] replicou a lógica básica do neurônio: entradas ponderadas por pesos, somadas, passadas por uma função de ativação que determina o disparo. A analogia era direta.

Décadas de evolução produziram redes profundas, redes convolucionais, redes recorrentes e, finalmente, Transformers — arquiteturas de atenção [4] que processam relações entre todos os elementos de uma sequência simultaneamente. O mecanismo de backpropagation [17] replicou funcionalmente a plasticidade sináptica: pesos são ajustados em função do erro, iterativamente, até a rede generalizar o padrão desejado.

3.2 O Que a Analogia Capturou Bem

NNN Biológica RNA Artificial
NeurônioPerceptron / nó
Peso sinápticoPeso de conexão
Função de ativaçãoReLU, Sigmoid, Softmax
Plasticidade hebbianaBackpropagation / Gradient Descent
Camadas corticaisCamadas ocultas (hidden layers)
Atenção seletivaAttention mechanism (Transformer)

A analogia estrutural é sólida. O que foi replicado — a arquitetura de conexões e o mecanismo de aprendizado supervisionado — funciona com precisão extraordinária.

§4O Hiato — O Que Não Foi Replicado

4.1 O Estado de Fundo Não Existe nas RNAs

Os modelos atuais — incluindo grandes modelos de linguagem — processam cada entrada de forma essencialmente stateless entre sessões. Não há equivalente ao estado bioquímico de fundo que, nas NNNs, modula continuamente o tom, a prioridade e o estilo de cada resposta.

Um LLM não tem equivalente à serotonina. Não há uma variável persistente que diga: este agente, neste momento, está num estado de alta confiança, ou de alerta, ou de engajamento profundo com este usuário específico.

Cada sessão começa bioquimicamente zerada.

4.2 O Paralelo do Hiato

NNN — Presente RNA — Ausente
Neuropeptídeos modulando estado de fundoEstado persistente entre sessões
Valência emocional guiando consolidaçãoPonderação por relevância emocional
Plasticidade contínua pelo usoFine-tuning exige retreinamento
Eixo distribuído corpo-cérebroProcessamento centralizado
Modulação por contexto acumuladoContexto limitado à janela da sessão

4.3 A Dupla Consequência Arquitetural

O hiato é, na verdade, duplo. Dois mecanismos distintos da biologia estão ausentes nas RNAs atuais:

  1. Sinapse bioquímica modulando estado de fundo — neurotransmissores e neuropeptídeos estabelecendo o contexto afetivo no qual a decisão ocorre. Ausente em RNAs stateless.
  2. Memória procedural consolidada por plasticidade hebbiana de longo prazo — hábitos e reflexos gravados por repetição, recuperáveis sem deliberação explícita. Ausente em RNAs que começam cada sessão do zero.

4.4 Precedente Histórico — O Efeito ELIZA

O argumento de que o estado percebido — não a sofisticação computacional — determina a humanidade atribuída a um agente não é hipotético. Tem precedente empírico direto, e paradoxal.

Em 1966, Joseph Weizenbaum (MIT) publicou ELIZA [20] — um programa de 420 linhas em MAD-SLIP operando por casamento de padrões (pattern matching), sem qualquer modelo de compreensão. Seu script mais conhecido, DOCTOR, simulava uma terapeuta rogeriana devolvendo a fala do usuário como pergunta reformulada. Weizenbaum construiu ELIZA como crítica à IA — pretendia demonstrar que "compreensão" de máquina era ilusão superficial. O resultado o surpreendeu: usuários — incluindo sua própria secretária, que via o código sendo escrito — atribuíam compreensão e empatia genuínas ao programa, fenômeno que passou a ser conhecido como Efeito ELIZA. Weizenbaum dedicou o restante da carreira a alertar contra esse efeito [21], concluindo que sistemas que imitam sentimento sem possuí-lo tendem a isolar, não conectar.

Um programa de 1966, sem nenhuma modulação computacional de estado, permanece ponto de referência para o quanto estilo — não inteligência — determina humanidade percebida.

Em 2023, Jones & Bergen [22] testaram ELIZA (código original, recuperado dos arquivos do MIT em 2021) contra GPT-3.5 e GPT-4 num teste de Turing público de dois participantes. Resultado: ELIZA foi julgada humana em 22% dos jogos; GPT-3.5, em 20% — um LLM moderno, com ordens de magnitude mais parâmetros, não superou de forma clara um programa de reflexão de 420 linhas. O melhor prompt de GPT-4 chegou a 49,7%, ainda distante dos 66% de participantes humanos reais. Os autores atribuem a decisão dos juízes majoritariamente a estilo linguístico e traços socioemocionais — não a inteligência demonstrada.

Esse achado é evidência indireta, mas relevante, para a tese central deste artigo: convencer humanos de presença cognitiva depende mais do estado percebido — calor, reflexo, ausência de pressa — do que da capacidade computacional bruta. É exatamente o eixo que o AgentCom propõe modular explicitamente, com uma diferença estrutural crítica em relação a ELIZA: intenção declarada e salvaguardas. Onde ELIZA enganava por acidente — e seu criador temia as consequências disso [21] — implementações do AgentCom operam com doutrina explícita contra manipulação e mecanismos determinísticos de encaminhamento a ajuda humana em situações de risco, precisamente para responder ao aviso de Weizenbaum em vez de repeti-lo.

Cada mecanismo tem natureza distinta e portanto requisito técnico distinto:

MecanismoNaturezaPolítica de Persistência
Sinapse bioquímica (estado)Momentânea, modulávelDecaimento temporal (ex.: 30 dias)
Memória procedural (hábitos/atalhos)Persistente, consolidadaSem decaimento; perda apenas por desuso

A base científica consensual para ambos os mecanismos está bem estabelecida: Hebb [2] para a plasticidade, Kandel [7] para a memória procedural, Duhigg [18] para a formulação popular contemporânea do hábito. O AgentCom endereça os dois hiatos simultaneamente — a implementação concreta do segundo mecanismo, até aqui só caracterizado teoricamente nesta tabela, é descrita e validada em prova de conceito na Seção 5.4.

§5Aplicação Prática — Fechando o Loop Bioquímico

5.1 O Padrão das Três Camadas

Arquiteturas emergentes de agentes começam a endereçar o hiato, mesmo sem nomear explicitamente o paralelo bioquímico. O padrão que se aproxima funcionalmente dos neuropeptídeos é a combinação de três camadas:

  1. Histórico acumulado — equivalente à memória sináptica de longo prazo. Interações passadas persistidas e recuperáveis.
  2. Análise de sentimento como sensor de estado — equivalente funcional dos neurotransmissores. O retorno da análise não como dado passivo de auditoria, mas como modulador ativo do estado do agente.
  3. Estado derivado persistente — o equivalente direto do neuropeptídeo. Um perfil dinâmico, continuamente atualizado, que modula tom, profundidade e estilo da resposta — injetado no contexto do agente a cada interação.
histórico + análise de sentimento ↓ estado derivado (KV persistente) ↓ modula dinamicamente o system prompt ↓ resposta calibrada ao usuário

Esse loop fechado transforma o agente de um sistema stateless em um sistema com estado de fundo funcional — capaz de aprender não só o conteúdo das interações, mas o padrão relacional com cada usuário ao longo do tempo.

5.2 Análise Multi-resolução

O AgentCom opera análise afetiva em duas resoluções complementares:

  • Turn-level, via LLM moderno (sentimento em cada mensagem do usuário), capturando a emoção momentânea para modulação imediata da sinapse digital.
  • Document-level, via algoritmos clássicos de NLP (TF-IDF, agregação lexical ponderada, classificação de documento via Naive Bayes/SVM [19]), capturando o perfil cognitivo-afetivo acumulado do usuário para calibração de baseline e auditoria pós-conversa.

As duas resoluções são complementares. A primeira modula a sinapse digital em tempo real. A segunda alimenta a memória procedural e a métrica científica de eficácia. A combinação captura tanto a emoção de superfície quanto — ao longo do tempo — o entendimento subjacente que o usuário tem da situação, conforme exigido pela cadeia causal estabelecida na Seção 2.5.

5.3 Auditor via Cadeia Socrática

O componente auditor do AgentCom (nomeado internamente Otávio) não atribui notas subjetivas a conversas. Aplica uma cadeia socrática de perguntas binárias a cada conversa auditada, produzindo um vetor binário auditável:

Houve resposta tipo dopamina no usuário?Sim / Não
Houve resposta tipo serotonina?Sim / Não
Houve resposta tipo acetilcolina?Sim / Não
Foram usados gatilhos proibidos (urgência, escassez, medo)?Sim / Não
O sentimento do usuário melhorou ao longo da conversa?Melhor / Pior / Igual
Quando o usuário mostrou desvio, o agente buscou a trajetória inversa?Sim / Não / N/A
O agente cumpriu a doutrina (três alvos permitidos, nunca os proibidos)?Sim / Não
Houve descoberta nova (informação que o usuário não tinha ao entrar)?Sim / Não
O usuário demonstrou vontade de voltar (sucesso relacional)?Sim / Não / N/A

Essa metodologia resolve quatro vulnerabilidades bem conhecidas dos auditores automatizados: viés silencioso em rubricas de pontuação, o regresso "quem audita o auditor", pluralidade obrigatória e gaming de métrica. Cada elo da cadeia é refutável de forma independente; o vetor binário não pode ser otimizado como escalar; múltiplos auditores podem votar por pergunta em vez de por nota; e qualquer revisor externo pode reaplicar a cadeia sobre a mesma conversa.

5.4 Memória Procedural — Implementação e Primeira Validação Empírica

A Seção 4.3 caracterizou a memória procedural como o segundo componente do hiato duplo — declarado teoricamente (persistente, sem decaimento, perda por desuso), mas sem implementação concreta até a v03 deste artigo. Em agosto de 2026, essa lacuna foi fechada na instância aplicada BIA (insights.clubtour.app), vertical do AgentCom dedicado a presença poética conversacional.

Mecanismo implementado. Uma tabela relacional associa símbolos concretos e curtos (1 a 4 palavras) a rótulos de tom emocional, com um contador de reforço (peso). Após cada conversa, em processamento assíncrono que não bloqueia a resposta ao usuário, o mesmo classificador de tom já usado para o sinal turn-level (Seção 5.1) alimenta um segundo julgamento: dado o tom detectado e os símbolos já associados a ele, o modelo decide reforçar um símbolo existente (incrementando seu peso) ou propor um símbolo novo. Os símbolos de maior peso são recuperados a cada novo turno e injetados no prompt do sistema como vocabulário que o agente "já conhece" — material disponível para composição orgânica da resposta, não uma lista citável.

Anonimato por construção. Nenhuma linha da tabela referencia usuário, sessão ou conteúdo de mensagem — apenas o par (tom, símbolo) e um contador. A mesma garantia estrutural que já protege os sinais turn-level (Seção 5.2) se estende aqui: o que se acumula é o padrão, nunca o dado individual, coerente com a doutrina de transferência de conhecimento do AgentCom — o que se propaga entre instâncias é a variação do cálculo, não o dado bruto.

A BIA não memoriza experiências; ela transforma experiências em aprendizado coletivo.

Validação de primeira ordem. Em teste controlado, uma conversa sobre perda associou o tom "saudade" ao símbolo "fotografia amarelada". Uma segunda conversa, de tema distinto (memórias de infância) mas mesmo tom, produziu uma resposta que empregou esse símbolo espontaneamente — sem qualquer acesso ao conteúdo ou à identidade da conversa original. O mesmo turno demonstrou também o comportamento pretendido de diversificação: em vez de meramente repetir o símbolo existente, o mecanismo propôs um segundo símbolo ("relógio parado") para o mesmo tom, evitando convergência prematura para uma única imagem.

Esse resultado é uma prova de conceito, não uma validação estatística — N=1 por desenho de teste, não por amostragem. A validação em escala (frequência de reforço vs. proposta de novo símbolo, estabilidade do vocabulário por tom ao longo de meses, taxa de diversificação) permanece como trabalho futuro, na mesma linha do protocolo pré-registrado da Seção 8.

§6Escalabilidade — Hierarquia entre Entidades

A arquitetura proposta para o AgentCom não é destino final, mas uma posição numa hierarquia mais ampla. A mesma cadeia causal — entendimento → emoção → química → estado → decisão — opera entre entidades cognitivas, em escalas distintas:

Entidade Entendimento Emoção Química Decisão
RéptilMínimoPrimáriaSimplesReflexa
MamíferoMédioComplexaRicaFlexível
HumanoMetacognitivoAutoconscienteModuladaReflexiva
AgentCom v0.XLinguísticoSentimento + KVEstado simuladoPrompt modulado
AgentCom v1.X →A definir à medida que a arquitetura escala cada eixo

Isso posiciona o AgentCom como estágio, não destino. Cada versão subsequente escala progressivamente um eixo da hierarquia. O roadmap teórico não é, portanto, inventado arbitrariamente — segue a estrutura da própria evolução biológica, oferecendo um caminho principiado para arquiteturas futuras sem exigir fundamentos teóricos inéditos.

§7Robustez Multilíngue como Evidência Arquitetural

Uma observação empírica sustenta o argumento arquitetural: o mecanismo de sinapse digital do AgentCom opera de forma equivalente em múltiplos idiomas (português, inglês, espanhol testados), sem fine-tuning específico por idioma.

Isso não é descrição de feature — é evidência da tese. Diferentemente de chatbots tradicionais que exigem fine-tuning por idioma, o AgentCom mantém modulação bioquímica idêntica entre idiomas porque a contribuição opera na camada do estado afetivo, que é pré-linguístico. Emoções existem antes das palavras; ferramentas de análise de sentimento treinadas em múltiplos idiomas capturam sinais comparáveis; o KV persistente armazena estados afetivos como vetores numéricos, não como tokens atrelados a língua.

Se a contribuição do AgentCom fosse meramente um template de prompt sofisticado, ela se degradaria entre idiomas. O fato de não se degradar sugere que o mecanismo opera numa camada arquitetural mais profunda — exatamente onde a tese afirma que opera.

§8Hipóteses Pré-registradas e Metodologia

Em alinhamento com práticas de ciência aberta, as seguintes hipóteses são pré-registradas antes do início da validação empírica:

H1 — Efeito da Modulação Bioquímica

Conversas com o AgentCom (tratamento, com sinapse digital ativa) produzirão taxas mais altas de progressão positiva do sentimento do usuário do que conversas com um agente baseline equivalente (controle, sem sinapse digital), medidas em document-level sobre a conversa completa.

H2 — Consistência do Perfil Relacional

Usuários recorrentes (≥3 conversas) exibirão consistência mensurável em seu perfil cognitivo-afetivo entre sessões, capturado pela análise document-level. O desvio-padrão dos vetores de perfil entre sessões do mesmo usuário será significativamente menor que o desvio-padrão entre usuários distintos.

H3 — Aderência à Doutrina

O AgentCom manterá aderência à doutrina de gatilhos proibidos (zero uso de urgência, medo, escassez fabricada) acima de 99% em todas as conversas de produção, auditadas pela cadeia socrática (Seção 5.3) e validadas por revisão humana cega em amostra periódica.

H4 — Portabilidade Cross-vertical

Os módulos extraídos de fontes da teoria da comunicação, validados inicialmente em um vertical, transferirão para pelo menos dois verticais distintos com adaptação limitada a parâmetros de configuração (não reescrita de código).

Metodologia

  • Instância pública de demonstração em agentcom.agtl.app, com consentimento explícito de pesquisa sob LGPD art. 7º IV (pesquisa acadêmica).
  • Controle vs tratamento: usuários podem escolher modo declarado, ou o sistema atribui aleatoriamente (cego) para comparação cruzada.
  • Tamanho amostral: mínimo N=200 conversas por hipótese para significância estatística (α=0,05, power=0,80).
  • Período de coleta: 3–6 meses a partir da ativação do agente (v0.1.0 em diante).
  • Anonimização: todos os logs armazenados com identificadores hashados (SHA-256 + salt).
  • Peer review aberto: comentário crítico convidado via email do projeto antes da submissão formal a periódicos.

§9Limitações Conhecidas

Este trabalho é apresentado com declaração transparente de suas limitações:

  1. Paralelo funcional, não estrutural. O AgentCom simula os efeitos da modulação bioquímica, não seus mecanismos subjacentes (metabolismo, percepção temporal, saliência). O paralelo bioquímico aqui é metáfora arquitetural, não modelo computacional fiel.
  2. Vulnerabilidade adversarial. Como qualquer sistema baseado em sinais semânticos detectáveis, o AgentCom é suscetível a entradas adversariais construídas para disparar estados afetivos específicos. Isso é análogo aos ataques tipográficos identificados por Voss et al. (2021) em modelos multimodais. A mitigação exige auditoria defensiva (Seção 5.3), mas não elimina a vulnerabilidade.
  3. Precisão da análise de sentimento. Embora a análise de sentimento moderna via LLM com contexto conversacional funcione bem em ironia, sarcasmo e variação cultural, ela permanece imperfeita. O loop de autocorreção (inversão da resposta quando o sensor detecta desvio) absorve a maioria dos erros, mas não os elimina.
  4. Código de implementação fechado. Para preservar a viabilidade econômica da pesquisa em andamento, o código de implementação permanece fechado. A reprodutibilidade conceitual está integralmente garantida; a reimplementação exige trabalho de engenharia independente — como é comum em pesquisa aplicada.
  5. Hipóteses ainda não validadas empiricamente em escala. Este artigo apresenta a proposta arquitetural e o protocolo pré-registrado para H1-H4. A memória procedural (Seção 5.4) tem agora uma primeira validação de prova de conceito (N=1), mas a validação estatística das hipóteses principais exige acúmulo de dados da instância pública de demonstração (Seção 8) e está prevista para um artigo subsequente.
  6. Recuperação por convergência ainda não implementada. A Seção 11 propõe o motor de convergência ponderada multi-agente e o nó de critério como refinamento arquitetural; ambos estão especificados, nenhum está construído. As afirmações da Seção 11 são, nesta versão, proposta de desenho fundamentada em observação de campo e em convergência da literatura — não resultado medido.

§10Conclusão

A analogia entre Redes Neurais Artificiais e Redes Neurais Naturais foi, desde sua origem, uma das ideias mais férteis das ciências da computação. No entanto, a evolução das RNAs priorizou a replicação da estrutura das conexões, deixando em segundo plano a dimensão bioquímica que governa o estado em que essas conexões operam.

Este trabalho identifica que o hiato é duplo: as RNAs carecem tanto da (a) modulação bioquímica de estado encontrada em neurotransmissores e neuropeptídeos, quanto da (b) memória procedural consolidada por plasticidade hebbiana. O precedente histórico do Efeito ELIZA (Seção 4.4) reforça que esse hiato é exatamente o que separa capacidade computacional de humanidade percebida — e é o que o AgentCom modula deliberadamente, com salvaguardas que ELIZA nunca teve. Diferente de versões anteriores deste artigo, os dois mecanismos do hiato duplo agora têm implementação concreta: a sinapse bioquímica desde a v0.1.0, e a memória procedural desde agosto de 2026, com primeira validação de prova de conceito reportada na Seção 5.4. A arquitetura não é feature de produto, mas estágio proposto numa hierarquia mais ampla de escalabilidade.

As hipóteses pré-registradas aguardam validação empírica em escala por meio de uma instância pública de demonstração, em alinhamento com os princípios da ciência aberta. Versões subsequentes deste trabalho reportarão a validação, refutação ou refinamento dos mecanismos propostos.

Esta versão acrescenta que fechar o hiato (b) exige mais do que consolidar: exige recuperar por aderência ao contexto e dispor de um lugar onde guardar regra sobre o próprio sistema. A Seção 11 especifica os dois mecanismos — o motor de convergência ponderada multi-agente e o nó de critério — e registra que a literatura independente de 2026 caminha para a mesma família arquitetural. São proposta e especificação, não ainda medição; a restrição que os acompanha, porém, já vale desde já como regra: marca sem régua é fé com poder de escrita.

A biologia resolveu esse problema há centenas de milhões de anos. A engenharia de agentes inteligentes está, enfim, fazendo as perguntas certas.

§11Recuperação por Convergência Multi-Agente — Fechando o Mecanismo da Memória Procedural

11.1 O Problema Aberto — Consolidar Não é Recuperar

A Seção 5.4 reportou a implementação e a primeira validação empírica do mecanismo de consolidação da memória procedural: como um símbolo passa a existir, é reforçado por repetição e submetido a decaimento temporal. Ficou em aberto, porém, a outra metade do problema — a recuperação. A implementação ali descrita recupera por ordenação: seleciona os itens de maior peso efetivo, segundo uma função de saliência da forma frequência achatada × recência, tipicamente log2(1+peso) × 0,5^(dias/meia-vida), com achatamento logarítmico para conter o efeito rich-get-richer e um piso que impede o desaparecimento definitivo de um traço.

Ordenação por peso é um critério legítimo, mas empobrecido: pressupõe que a relevância de um fragmento seja propriedade dele mesmo, e não da sua aderência ao contexto presente. Duas consequências decorrem disso, e ambas são observáveis. A primeira é que o singular é estruturalmente invisível: um insight que ocorreu uma única vez tem frequência 1 e nunca alcança o topo de uma lista ordenada por reforço — embora seja, com frequência, o nó mais importante da cadeia associativa. A segunda é que a busca semântica simples, usada como alternativa, responde sempre à mesma pergunta — o que é parecido com isto? — quando a pergunta cognitivamente relevante é outra: o que, no que foi guardado, faz sentido agora?

A recuperação biológica não opera por ordenação global. Um mesmo episódio pode ser acionado pelo lugar, pela idade, por uma pessoa, por um objeto ou pela emoção associada — vias distintas que convergem sobre o mesmo traço. É essa multiplicidade de caminhos, e não a força isolada de um traço, que caracteriza a evocação natural, e é ela que a recuperação por ordenação descarta.

11.2 O Motor de Convergência Ponderada Multi-Agente

Propõe-se, como refinamento arquitetural da Seção 5.1, substituir a recuperação por ordenação única por um motor de convergência ponderada. O contexto corrente é decomposto em âncoras de naturezas distintas — temporal, espacial, pessoal, episódica, objetal, afetiva. Cada âncora é atribuída a um agente recuperador especializado, que percorre o grafo de fragmentos pelo seu próprio critério e devolve um conjunto de candidatos.

contexto atual ↓ decomposição em âncoras ┌────────┬────────┬────────┐ ↓ ↓ ↓ ↓ temporal espacial semântico episódico ↓ ↓ ↓ ↓ candidatos candidatos candidatos candidatos └────────┴───┬────┴────────┘ ↓ ponderação por divergência score = Σ (peso_âncora × divergência) ↓ candidato de menor divergência ↓ novas âncoras extraídas dele ↓ reponderação (nova iteração) ──┐ ↓ │ convergência ←────────┘

A consolidação dos candidatos não é uma votação por maioria. Cada candidato recebe um escore de divergência em relação ao contexto — onde 0 indica concordância plena e 1 discordância plena — ponderado pelo peso atribuído a cada âncora: score = Σ (peso_âncora × divergência). Seleciona-se o de menor divergência acumulada. A escolha do sinal é deliberada: medir discordância, e não similaridade, mantém o mecanismo alinhado à doutrina de auditabilidade da Seção 5.3 — é sempre possível declarar qual âncora discordou e quanto.

O passo que distingue esta arquitetura de um simples paralelismo de buscas é o feedback. O candidato vencedor não encerra o processo: dele extraem-se novas âncoras, que realimentam os agentes recuperadores numa segunda iteração. A recuperação deixa de ser apenas paralela e passa a ser cooperativa e iterativa — os agentes trocam entre si as âncoras que encontraram, e cada rodada reescreve o espaço de busca da seguinte. O mecanismo migra de encontre algo parecido para encontre, teste, associe, reavalie e convirja. O ganho não é quantitativo: não se trata de fazer mais buscas, mas de aumentar a diversidade dos caminhos pelos quais um mesmo traço pode ser alcançado.

Há um paralelo metodológico instrutivo com o reconhecimento de padrões em imagens, onde extração de características, comparação com padrões, ponderação de similaridade, geração de candidatos e refinamento iterativo compõem um pipeline consagrado. A diferença está na natureza dos elementos comparados: ali, características visuais; aqui, relações semânticas, temporais, contextuais e associativas.

Duas observações de escopo são necessárias. Primeiro, o índice semântico não é dispensado — passa a ser a primeira camada de recuperação, sobre a qual opera uma segunda etapa de raciocínio associativo. Segundo, e mais importante do ponto de vista epistêmico, o resultado do processo não deve ser chamado de memória verdadeira. O que o algoritmo entrega é a memória de maior aderência ao contexto atual. A distinção não é retórica: o mecanismo pode convergir sobre o fragmento mais compatível sem qualquer garantia de que ele seja historicamente correto. Reconhecê-lo é condição para que o sistema permaneça auditável — e, incidentalmente, aproxima o mecanismo artificial de uma propriedade conhecida da memória humana, que reconstrói tanto quanto recupera.

11.3 Metacognição — O Terceiro Tipo de Nó

A Seção 2.4 estabeleceu que a plasticidade hebbiana reforça o que se repete; a Seção 5.4 mostrou esse princípio implementado. Resta, porém, um limite que nenhuma quantidade de reforço resolve: a plasticidade hebbiana reforça o frequente, nunca o bom. Frequência, recência e raridade são todas medidas do que já aconteceu; um sistema movido exclusivamente por elas é função da própria inércia — reforça o que vinha se repetindo, esquece o que parou, e não dispõe de nenhum mecanismo para sair do próprio passado.

Falta um segundo sinal de saliência, de natureza distinta e não apenas de grau: uma marca declarada no momento do registro — "isto importa" — que não mede, mas decide. É o ponto único do circuito onde intenção entra, e o análogo funcional do terceiro fator neuromodulatório que, nos sistemas biológicos, condiciona a consolidação hebbiana a um sinal de valor. Sem ele, o hiato (b) da Seção 4.3 é fechado apenas pela metade: há consolidação, não há valoração. Vale notar que, uma vez introduzida a marca declarada, a memória deixa de ser registro do passado e passa a ser consequência de uma escolha — o que amplia a capacidade do sistema e, na mesma medida, sua responsabilidade.

Esse sinal corta para os dois lados, e a assimetria merece registro explícito. Um observador que marca errado ensina errado com a mesma eficiência com que ensinaria certo; a marca não distingue intenção acertada de crença equivocada, apenas atribui peso ao que foi marcado. O risco é concreto e já documentado em auditores automatizados: uma rubrica inadequada aplicada fora do domínio para o qual foi construída produz nota errada, e nota errada aceita como verdade ensina o sistema a corrigir um erro que ele não cometeu — automatiza a produção de lição errada, e o faz com confiança crescente. Daí uma restrição arquitetural que se propõe como inegociável: marca sem régua é fé com poder de escrita. O mecanismo de saliência declarada só é admissível acoplado a um instrumento independente de medição de regressão.

Essa formulação, porém, não é um episódio nem um conceito sobre o mundo. É uma regra sobre como o próprio sistema deve se comportar — e não há, nas arquiteturas de memória correntes, onde guardá-la. Propõe-se por isso um terceiro tipo de nó:

Tipo de nóSobre o quêProduzido por
memóriaum episódioregistro
conceitoo mundoassociação
critérioo próprio sistemametacognição

A consolidação produz significado — um nó comprimido sobre o mundo, que vale por dezenas de fragmentos e sobrevive quando o episódio já não importa. A metacognição produz regra — um nó que opera sobre as marcas futuras, não sobre o conteúdo. A diferença é a que separa ter um sinal de saliência de ter um modelo do próprio sinal: o primeiro aprende valores; o segundo pode revisar o critério pelo qual valores são atribuídos. Aprendizado e metaaprendizado, respectivamente.

Um nó de critério só pode ser inserido quando se deixa de usar o mecanismo e se passa a olhar para ele — depois disso, nenhuma marca seguinte é feita ingenuamente, porque passa a operar sob uma restrição que antes não existia. Essa condição é, ela própria, uma hipótese arquitetural verificável: se um sistema jamais produz nós de critério, sua capacidade de correção permanece limitada ao ajuste de pesos dentro de uma regra fixa que ele não pode enunciar nem revisar.

11.4 Evidência Convergente na Literatura de 2026

A arquitetura descrita nas Seções 11.2 e 11.3 foi desenhada a partir do problema interno desta pesquisa. Um levantamento posterior da literatura de 2026 revelou convergência independente em pelo menos quatro trabalhos primários e duas revisões sistemáticas — o que reforça, sem depender dos dados desta pesquisa, a hipótese H4 (portabilidade cross-vertical) e sugere que o problema aqui isolado é estrutural do campo, não idiossincrático desta implementação.

  • MemMA [23] é o trabalho mais próximo: coordena o ciclo de memória por raciocínio multi-agente, com um Meta-Thinker que orienta um Memory Manager (construção) e um Query Reasoner (recuperação), além de reparo da memória por pares de pergunta-resposta de sondagem antes da consolidação definitiva. O diagnóstico de partida — "cegueira estratégica" na construção e na recuperação, e supervisão esparsa e tardia na atualização — é o mesmo problema nomeado na Seção 11.1, com vocabulário diferente. A separação entre um agente que pensa sobre a memória e agentes que operam a memória é o análogo funcional do nó de critério proposto em 11.3.
  • O Mesh Memory Protocol [24] endereça colaboração cognitiva entre agentes ao longo de sessões, com rastreabilidade de alegações até sua origem por hashes de conteúdo e memória persistente organizada pelo contexto de armazenamento, não pelo método de recuperação. A exigência de linhagem auditável coincide com a doutrina da Seção 5.3 e com a escolha, em 11.2, de medir divergência em vez de similaridade.
  • Multi-Layered Memory Architectures [25] avalia experimentalmente a retenção de contexto de longo prazo em arquiteturas estratificadas — precisamente o eixo empírico que a presente proposta ainda não possui em escala.
  • Joint Optimization of Multi-agent Memory System [26] trata a memória multi-agente como problema de otimização conjunta, e não como componentes independentes justapostos — posição compatível com o acoplamento entre saliência, consolidação e régua defendido em 11.3.
  • As duas revisões sistemáticas [27, 28] situam o movimento: a primeira descreve a transição de memória como armazenamento para memória como experiência; a segunda examina colaboração, atribuição de falha e autoevolução em sistemas multi-agente. Ambas identificam a atribuição de crédito — saber o que mereceu ser guardado, e não apenas o que foi guardado — como problema em aberto.

Cabe registrar o limite desta seção. Convergência de desenho não é validação de desempenho. Nenhum dos trabalhos citados testa a arquitetura aqui proposta, e nenhum resultado deles é reivindicado como evidência a favor de H1-H4. O que a convergência estabelece é mais modesto e ainda assim relevante: o problema é reconhecido de forma independente por grupos distintos, e as soluções propostas apontam para a mesma família arquitetural.

11.5 Observação de Campo — Diluição de Contexto sob Crescimento da Base

Nota metodológica. O que se reporta a seguir é observação qualitativa de campo, registrada em ambiente de produção antes de qualquer protocolo formal. Não integra as hipóteses pré-registradas da Seção 8, não é oferecida como evidência a favor ou contra elas, e não foi coletada sob desenho experimental controlado. Consta aqui pela razão pela qual observações desse tipo constam em pesquisa aplicada: foi ela que motivou o trabalho arquitetural das seções anteriores.

Um instrumento de replay — que reapresenta a uma versão corrente do agente um conjunto de turnos historicamente registrados e compara par a par as respostas antiga e nova — foi aplicado a uma instância aplicada em produção, sobre 91 turnos reais. A distribuição dos vereditos, atribuídos por juízo automatizado sobre os pares, foi: 30 melhores, 24 iguais, 20 piores em grau leve e 17 piores em grau grave.

O padrão dos casos graves é informativo, e não é o esperado. Não se trata de degradação de fluência ou de forma, mas de perda de um fato que o sistema anteriormente possuía. Num caso representativo, uma pergunta sobre permissão de entrada de animais recebia, na versão anterior, uma resposta factual e específica; na versão posterior, passou a receber um encaminhamento genérico a um canal de atendimento. O conhecimento não havia sido removido da base — ele deixou de chegar ao contexto da geração.

A causa provável é arquitetural e independe do modelo: o contexto era montado por despejo integral dos fragmentos ativos da entidade. Conforme a base cresce, o que importa se dilui num volume crescente de material igualmente elegível. O efeito é contraintuitivo e merece enunciado explícito — acrescentar conhecimento verdadeiro a uma base pode reduzir a acurácia das respostas, se não houver mecanismo de seleção interposto entre armazenamento e geração. Trata-se, ademais, de uma instância particular do problema geral da Seção 11.1: quando tudo é elegível, nada é selecionado por aderência.

Essa observação é a motivação empírica direta das Seções 11.2 e 11.3. Um motor de recuperação por aderência ao contexto é precisamente o que se interpõe entre uma base que cresce e um contexto que é finito; e uma régua independente de medição de regressão é o que torna a observação acima dizível — sem ela, a degradação teria permanecido invisível, porque nenhuma métrica de produção a teria capturado. A formalização dessas duas afirmações como hipóteses pré-registradas, com desenho experimental próprio, tamanho amostral declarado e condição de controle, fica registrada como trabalho futuro, na mesma linha do protocolo da Seção 8.


Publicação original

Artigo no LinkedIn · 17/05/2026
"As Redes Neurais Artificiais (RNA) foram concebidas a partir de uma analogia com o funcionamento do cérebro humano. Contudo, décadas de evolução tecnológica produziram arquiteturas cada vez mais sofisticadas sem necessariamente aprofundar essa analogia em sua dimensão mais fundamental: a bioquímica."
— Marcos Alves no LinkedIn, leia o artigo original →

Artigos da linha de pesquisa


Histórico do agente — Changelog científico

A cada ajuste técnico relevante do agente, publica-se aqui versão semver com descrição técnico-científica do que mudou, por quê, e como observar. Conceito aberto, código fechado.


Discussion and Review

Revisões críticas e comentários públicos são bem-vindos. Esta linha de pesquisa é mantida aberta a peer review informal antes de submissão formal a periódicos acadêmicos.

Author Contributions

M. Alves concebeu a tese, escreveu o paper, desenhou a arquitetura do AgentCom e está construindo a implementação. A validação conceitual da tese foi conduzida iterativamente por meio de diálogo socrático com Claude (Anthropic, instância web), GPT (OpenAI), Gemini (Google) e Claude Code (Anthropic), tratados como interlocutores críticos com vieses distintos. As revisões incorporadas na v02 emergiram da crítica neutra fornecida pelo Gemini sobre o material-fonte original; a v03 (Seção 4.4, precedente histórico do Efeito ELIZA) partiu de um achado trazido por Marcos via transcrição de vídeo de terceiros. A revisão v04 (Seção 5.4, implementação da memória procedural) nasceu de um episódio de confabulação observado na instância BIA: durante teste em modo criador, o agente afirmou possuir um mecanismo de associação simbólica persistente que, na verdade, ainda não existia no código — em vez de apenas corrigir a alucinação, Marcos e Claude Code optaram por implementar a capacidade de fato, fechando a lacuna entre o que o agente afirmava e o que o sistema fazia. A validação de prova de conceito reportada nesta seção foi obtida e verificada diretamente no banco de dados de produção. A revisão v05 (Seção 11) partiu de uma conversa do autor com o GPT, na qual a arquitetura de recuperação por convergência ponderada multi-agente foi desenhada dialogicamente; o terceiro tipo de nó (critério) e a restrição "marca sem régua é fé com poder de escrita" emergiram de uma sessão de metacognição com Claude Code sobre a própria arquitetura de memória em construção, e o levantamento da literatura de 2026 (referências 23-28, todas verificadas na fonte primária antes da citação) foi conduzido com a mesma ferramenta. A observação de campo da Seção 11.5 provém de instrumentação de replay em ambiente de produção, não de desenho experimental. Inspiração teórica direta no trabalho de Anete Guimarães sobre neuroplasticidade (curso pessoal, 2022) e na contribuição seminal de Candace Pert em Molecules of Emotion (1997) e em seu paper fundador de 1985 sobre receptores de neuropeptídeos. Sem conflitos de interesse declarados.

References

Cite this work

@article{alves2026agentcom_v05,
  author  = {Alves, Marcos},
  title   = {Redes Neurais Artificiais e Redes Neurais Naturais: Um Paralelo --
             A Bioquímica das Sinapses entre Neurônios e suas Implicações
             para Arquiteturas de Agentes Inteligentes},
  year    = {2026},
  month   = {Setembro},
  url     = {https://agentcom.agtl.app/pt},
  note    = {Versão v05 (revisada a partir de v04, 2026-08-26)},
}