Memória de agentes de IA: construir em casa ou usar uma plataforma?
O que é preciso para construir a memória dos agentes de IA com Redis, PostgreSQL e pgvector, quando isso compensa e quando uma plataforma faz mais sentido.
Arquitetura7 min de leitura
Construir a memória dos agentes de IA em casa compensa em quatro casos: um canal só, um fornecedor de agentes só, um time de dados dedicado ou um requisito que nenhuma plataforma cumpre. Com Redis, PostgreSQL e pgvector, o protótipo sai rápido, porque guardar e buscar mensagens é a parte fácil. O trabalho que nunca termina é o resto: identidade entre canais, permissões, auditoria, apagamento e operação 24 horas. Com vários canais e fornecedores, compliance pesado ou pressa, uma plataforma neutra faz mais sentido.
O que é preciso construir, além de Redis e pgvector?
A arquitetura típica tem Redis para as mensagens recentes, PostgreSQL com pgvector para o histórico, uma fila e um serviço próprio. Para servir agentes de vários fornecedores, o serviço precisa de nove peças:
- O registro guarda cada mensagem, na ordem em que aconteceu, sem duplicar os reenvios do fornecedor.
- A identidade junta telefone, e-mail, CPF e login do app num cliente só. Ela também percebe quando um número muda de dono.
- A extração tira fatos, promessas e pendências de cada conversa. Ela recusa fato sem mensagem de origem.
- O contexto sai sob medida para cada canal, no tamanho e na ordem que o cache do provedor aproveita.
- A busca devolve cada resultado do histórico com data, canal e desfecho.
- As permissões seguem a finalidade de cada agente e o fornecedor dele.
- A auditoria registra cada leitura à prova de alteração.
- Os direitos do titular pedem um apagamento em tudo o que derivou do dado.
- A operação exige plantão 24 horas, alertas e troca de modelos.
Quanto disso é protótipo, e quanto é trabalho que nunca termina?
O protótipo cobre três peças num canal só: registro, contexto e busca. Na demonstração, o agente parece lembrar de tudo.
Até essas três escondem armadilhas. Com índice aproximado (HNSW), o pgvector filtra depois de varrer o índice: na configuração padrão, se o filtro casa com 10% das linhas, voltam em média 4 resultados (pgvector). Filtrada por um cliente entre milhões, a busca tende a voltar quase vazia. A mesma documentação indica começar por um índice na coluna do filtro.
O resto nunca termina. Um canal novo traz um identificador novo. Uma união errada de perfis precisa ser desfeita sem perder histórico. Os modelos mudam as regras: na Anthropic, o mínimo que o cache aproveita passou de 4.096 tokens no Claude Opus 4.5 para 512 no Claude Opus 5 (documentação). Cada troca de modelo também pede nova avaliação da extração. E alguém atende o alerta de madrugada: o livro Site Reliability Engineering, do Google, calcula em oito engenheiros o mínimo para um plantão 24 horas num único local.
Quando construir em casa é a escolha certa?
Construir em casa é a escolha certa em quatro situações.
- Um canal só. O cliente chega sempre pelo mesmo identificador, e a identidade entre canais sai da lista.
- Um fornecedor só. A memória desse fornecedor já enxerga todas as conversas, e o que faltar cabe num serviço pequeno.
- Um time de dados dedicado. Com gente para operar, avaliar a extração e responder à revisão de segurança, construir dá controle total. Isso conta mais quando a memória é parte do produto.
- Um requisito que nenhuma plataforma cumpre. Se o dado precisa ficar em servidores operados pelo próprio time, uma plataforma totalmente gerenciada não atende. A Niadra não atende esse caso, porque opera toda a infraestrutura, inclusive no ambiente dedicado do plano Regulado.
A tecnologia não é o obstáculo. A OpenAI atende 800 milhões de usuários do ChatGPT com um único servidor primário de PostgreSQL e cerca de 50 réplicas de leitura (OpenAI). O que pesa é o trabalho.
Quando uma plataforma neutra faz mais sentido?
Uma plataforma neutra faz mais sentido em três situações.
- Vários canais e fornecedores. A memória de cada fornecedor fica presa nele. Uma memória construída em casa resolve isso, porque pertence à empresa. O custo aparece na integração: cada fornecedor precisa de SDK, API, credencial própria e permissões por finalidade. Em casa, a empresa escreve e mantém tudo isso.
- Compliance pesado. A revisão de segurança pede cada padrão pelo nome, com evidência. Até a cifra campo a campo vira projeto: a documentação do pgcrypto pede confiança no administrador do banco e recomenda cifrar na aplicação quando isso não é possível (PostgreSQL). Cifrar na aplicação exige uma chave por empresa, guardada em HSM.
- Pressa. Na plataforma, as nove peças já existem. A integração cabe no agente que você já tem.
Como as duas opções se comparam, critério a critério?
Construir em casa vence em controle e em onde o dado fica. A plataforma vence em prazo, operação e evidência para a revisão de segurança.
| Critério | Construir em casa | Usar uma plataforma neutra |
|---|---|---|
| Primeiro resultado | Protótipo rápido num canal | Três chamadas no agente que você já tem |
| Identidade entre canais | Você escreve cada regra | Pronta, com nível de confiança |
| Contexto por canal | Nova medição a cada modelo | Em camadas, do que menos muda ao que mais muda |
| Busca no histórico | Índice, filtros e permissões por sua conta | Pelo SDK, pela API HTTP ou por MCP |
| Permissões e auditoria | Projeto próprio | Por finalidade e fornecedor, com cada leitura registrada |
| Apagamento | Você rastreia o que derivou | Com comprovante |
| Operação 24 horas | Plantão próprio | Da plataforma |
| Controle | Total | Dentro do que a plataforma oferece |
| Onde o dado fica | Onde você decidir, até em servidores seus | Na região que você escolher |
| Custo | Infraestrutura, modelo e time | Por uso (na Niadra, por conversa) |
| Saída | Nada a migrar | Exportação (na Niadra, em formato aberto) |
Como decidir entre construir e usar uma plataforma?
Quatro perguntas separam os dois casos.
- Quantos canais e fornecedores vão ler a mesma memória?
- Que evidência a revisão de segurança vai pedir?
- Quem opera o sistema de madrugada?
- A memória é o produto da empresa ou a infraestrutura dele?
Com um canal, um fornecedor e memória como produto, construa. Com vários canais, vários fornecedores e memória como infraestrutura, use uma plataforma. Nas respostas mistas, decidem a segunda e a terceira, porque evidência e plantão viram custo fixo.
Teste com um caso real. Às 14h02, a Marina avisa no WhatsApp que o técnico não apareceu, e o agente do fornecedor A responde. Às 14h05, ela contesta a fatura de agosto pelo app. Às 14h07, ela liga, e quem atende é o agente de voz do fornecedor B. O protótipo passa se esse agente souber das duas coisas antes do alô. Quando ela citar o crédito da outra vez, o agente precisa achar no histórico o registro de 12/03, com os R$ 40.
Como a Niadra resolve
A Niadra é a memória compartilhada dos agentes de IA de uma empresa, em todos os canais e fornecedores. As nove peças da lista fazem parte do serviço, e a Niadra opera toda a infraestrutura, 24 horas por dia. Do seu lado, fica o SDK, em Python ou TypeScript, com três chamadas: context() antes de responder, search() durante a conversa e track() depois de responder.
O context() entrega o contexto em menos de 100 ms, com a origem de cada fato. O search() também funciona pela API HTTP e por MCP, com qualquer LLM. Os dados ficam cifrados com AES-256-GCM em repouso e TLS 1.3 em trânsito, com chave exclusiva por empresa em HSM FIPS 140-3 nível 3. Cada leitura entra numa auditoria encadeada por SHA-256. O preço é por conversa, de US$ 5 a 15 a cada mil (Preço). O plano Regulado tem ambiente dedicado, operado pela Niadra (Enterprise).
Perguntas frequentes
Dá para construir a memória dos agentes só com Redis e pgvector?
Dá para construir o protótipo. O Redis guarda as mensagens recentes. O PostgreSQL com pgvector guarda o histórico e busca por semelhança. Faltam identidade entre canais, permissões por finalidade, auditoria e apagamento, que a revisão de segurança cobra.
Quanto custa manter a memória dos agentes em casa?
A conta soma a infraestrutura, o modelo que extrai fatos de cada conversa e o time que opera tudo. Só o plantão 24 horas pede no mínimo oito engenheiros num único local, pela conta do livro Site Reliability Engineering, do Google. Na Niadra, o preço é por conversa, de US$ 5 a 15 a cada mil.
Posso começar numa plataforma e construir em casa depois?
Pode, se a plataforma exportar tudo em formato aberto e não controlar o seu agente. É assim que a Niadra funciona: o agente ganha três chamadas, sem trocar prompt, modelo nem fornecedor. Para sair, você importa a exportação no seu sistema e aponta as três chamadas para ele.