Pular para o conteúdo

Memória de agentes de IA: construir em casa ou usar uma plataforma?

O que é preciso para construir a memória dos agentes de IA com Redis, PostgreSQL e pgvector, quando isso compensa e quando uma plataforma faz mais sentido.

Time Niadra

Arquitetura7 min de leitura

Construir a memória dos agentes de IA em casa compensa em quatro casos: um canal só, um fornecedor de agentes só, um time de dados dedicado ou um requisito que nenhuma plataforma cumpre. Com Redis, PostgreSQL e pgvector, o protótipo sai rápido, porque guardar e buscar mensagens é a parte fácil. O trabalho que nunca termina é o resto: identidade entre canais, permissões, auditoria, apagamento e operação 24 horas. Com vários canais e fornecedores, compliance pesado ou pressa, uma plataforma neutra faz mais sentido.

O que é preciso construir, além de Redis e pgvector?

A arquitetura típica tem Redis para as mensagens recentes, PostgreSQL com pgvector para o histórico, uma fila e um serviço próprio. Para servir agentes de vários fornecedores, o serviço precisa de nove peças:

  1. O registro guarda cada mensagem, na ordem em que aconteceu, sem duplicar os reenvios do fornecedor.
  2. A identidade junta telefone, e-mail, CPF e login do app num cliente só. Ela também percebe quando um número muda de dono.
  3. A extração tira fatos, promessas e pendências de cada conversa. Ela recusa fato sem mensagem de origem.
  4. O contexto sai sob medida para cada canal, no tamanho e na ordem que o cache do provedor aproveita.
  5. A busca devolve cada resultado do histórico com data, canal e desfecho.
  6. As permissões seguem a finalidade de cada agente e o fornecedor dele.
  7. A auditoria registra cada leitura à prova de alteração.
  8. Os direitos do titular pedem um apagamento em tudo o que derivou do dado.
  9. A operação exige plantão 24 horas, alertas e troca de modelos.

Quanto disso é protótipo, e quanto é trabalho que nunca termina?

O protótipo cobre três peças num canal só: registro, contexto e busca. Na demonstração, o agente parece lembrar de tudo.

Até essas três escondem armadilhas. Com índice aproximado (HNSW), o pgvector filtra depois de varrer o índice: na configuração padrão, se o filtro casa com 10% das linhas, voltam em média 4 resultados (pgvector). Filtrada por um cliente entre milhões, a busca tende a voltar quase vazia. A mesma documentação indica começar por um índice na coluna do filtro.

O resto nunca termina. Um canal novo traz um identificador novo. Uma união errada de perfis precisa ser desfeita sem perder histórico. Os modelos mudam as regras: na Anthropic, o mínimo que o cache aproveita passou de 4.096 tokens no Claude Opus 4.5 para 512 no Claude Opus 5 (documentação). Cada troca de modelo também pede nova avaliação da extração. E alguém atende o alerta de madrugada: o livro Site Reliability Engineering, do Google, calcula em oito engenheiros o mínimo para um plantão 24 horas num único local.

Quando construir em casa é a escolha certa?

Construir em casa é a escolha certa em quatro situações.

  • Um canal só. O cliente chega sempre pelo mesmo identificador, e a identidade entre canais sai da lista.
  • Um fornecedor só. A memória desse fornecedor já enxerga todas as conversas, e o que faltar cabe num serviço pequeno.
  • Um time de dados dedicado. Com gente para operar, avaliar a extração e responder à revisão de segurança, construir dá controle total. Isso conta mais quando a memória é parte do produto.
  • Um requisito que nenhuma plataforma cumpre. Se o dado precisa ficar em servidores operados pelo próprio time, uma plataforma totalmente gerenciada não atende. A Niadra não atende esse caso, porque opera toda a infraestrutura, inclusive no ambiente dedicado do plano Regulado.

A tecnologia não é o obstáculo. A OpenAI atende 800 milhões de usuários do ChatGPT com um único servidor primário de PostgreSQL e cerca de 50 réplicas de leitura (OpenAI). O que pesa é o trabalho.

Quando uma plataforma neutra faz mais sentido?

Uma plataforma neutra faz mais sentido em três situações.

  • Vários canais e fornecedores. A memória de cada fornecedor fica presa nele. Uma memória construída em casa resolve isso, porque pertence à empresa. O custo aparece na integração: cada fornecedor precisa de SDK, API, credencial própria e permissões por finalidade. Em casa, a empresa escreve e mantém tudo isso.
  • Compliance pesado. A revisão de segurança pede cada padrão pelo nome, com evidência. Até a cifra campo a campo vira projeto: a documentação do pgcrypto pede confiança no administrador do banco e recomenda cifrar na aplicação quando isso não é possível (PostgreSQL). Cifrar na aplicação exige uma chave por empresa, guardada em HSM.
  • Pressa. Na plataforma, as nove peças já existem. A integração cabe no agente que você já tem.

Como as duas opções se comparam, critério a critério?

Construir em casa vence em controle e em onde o dado fica. A plataforma vence em prazo, operação e evidência para a revisão de segurança.

Critério Construir em casa Usar uma plataforma neutra
Primeiro resultado Protótipo rápido num canal Três chamadas no agente que você já tem
Identidade entre canais Você escreve cada regra Pronta, com nível de confiança
Contexto por canal Nova medição a cada modelo Em camadas, do que menos muda ao que mais muda
Busca no histórico Índice, filtros e permissões por sua conta Pelo SDK, pela API HTTP ou por MCP
Permissões e auditoria Projeto próprio Por finalidade e fornecedor, com cada leitura registrada
Apagamento Você rastreia o que derivou Com comprovante
Operação 24 horas Plantão próprio Da plataforma
Controle Total Dentro do que a plataforma oferece
Onde o dado fica Onde você decidir, até em servidores seus Na região que você escolher
Custo Infraestrutura, modelo e time Por uso (na Niadra, por conversa)
Saída Nada a migrar Exportação (na Niadra, em formato aberto)

Como decidir entre construir e usar uma plataforma?

Quatro perguntas separam os dois casos.

  1. Quantos canais e fornecedores vão ler a mesma memória?
  2. Que evidência a revisão de segurança vai pedir?
  3. Quem opera o sistema de madrugada?
  4. A memória é o produto da empresa ou a infraestrutura dele?

Com um canal, um fornecedor e memória como produto, construa. Com vários canais, vários fornecedores e memória como infraestrutura, use uma plataforma. Nas respostas mistas, decidem a segunda e a terceira, porque evidência e plantão viram custo fixo.

Teste com um caso real. Às 14h02, a Marina avisa no WhatsApp que o técnico não apareceu, e o agente do fornecedor A responde. Às 14h05, ela contesta a fatura de agosto pelo app. Às 14h07, ela liga, e quem atende é o agente de voz do fornecedor B. O protótipo passa se esse agente souber das duas coisas antes do alô. Quando ela citar o crédito da outra vez, o agente precisa achar no histórico o registro de 12/03, com os R$ 40.

Como a Niadra resolve

A Niadra é a memória compartilhada dos agentes de IA de uma empresa, em todos os canais e fornecedores. As nove peças da lista fazem parte do serviço, e a Niadra opera toda a infraestrutura, 24 horas por dia. Do seu lado, fica o SDK, em Python ou TypeScript, com três chamadas: context() antes de responder, search() durante a conversa e track() depois de responder.

O context() entrega o contexto em menos de 100 ms, com a origem de cada fato. O search() também funciona pela API HTTP e por MCP, com qualquer LLM. Os dados ficam cifrados com AES-256-GCM em repouso e TLS 1.3 em trânsito, com chave exclusiva por empresa em HSM FIPS 140-3 nível 3. Cada leitura entra numa auditoria encadeada por SHA-256. O preço é por conversa, de US$ 5 a 15 a cada mil (Preço). O plano Regulado tem ambiente dedicado, operado pela Niadra (Enterprise).

Perguntas frequentes

Dá para construir a memória dos agentes só com Redis e pgvector?

Dá para construir o protótipo. O Redis guarda as mensagens recentes. O PostgreSQL com pgvector guarda o histórico e busca por semelhança. Faltam identidade entre canais, permissões por finalidade, auditoria e apagamento, que a revisão de segurança cobra.

Quanto custa manter a memória dos agentes em casa?

A conta soma a infraestrutura, o modelo que extrai fatos de cada conversa e o time que opera tudo. Só o plantão 24 horas pede no mínimo oito engenheiros num único local, pela conta do livro Site Reliability Engineering, do Google. Na Niadra, o preço é por conversa, de US$ 5 a 15 a cada mil.

Posso começar numa plataforma e construir em casa depois?

Pode, se a plataforma exportar tudo em formato aberto e não controlar o seu agente. É assim que a Niadra funciona: o agente ganha três chamadas, sem trocar prompt, modelo nem fornecedor. Para sair, você importa a exportação no seu sistema e aponta as três chamadas para ele.

O próximo agente já pode chegar sabendo.

Conte o que você está construindo. Quem responde é quem escreve o código.