A quarta conversa

Newsletter · Capital Pulse·21 de setembro de 2026

A quarta conversa

Nas últimas duas semanas, tive três conversas sobre diferentes ferramentas de IA. A quarta, a que os agentes já têm entre si por um protocolo aberto que poucos ainda estão acompanhando, é a que muda o que pode ser construído.

João Piccioni

Na primeira, o assunto era rodar um modelo de visão e linguagem (VLM, na sigla em inglês) no meu próprio hardware para analisar vídeos em detalhe. A família Qwen, da Alibaba, tem pesos abertos e já consegue descrever detalhadamente uma gravação de horas sem que um byte saia da máquina.

Na segunda, falamos do Astra, o novo modelo que a OpenAI lançou no início do mês. Sua habilidade em construir é grande: seus agentes são capazes de abrir navegadores, varrer conhecimento, construir e voltar com respostas em quarenta minutos. Algumas atividades vão realmente mudar de natureza.

Na terceira, o tema era o oposto da fronteira: quais são os negócios passíveis de serem estruturados hoje com modelos de duas gerações atrás, mais baratos e que resolvem com folga o que não pede raciocínio de ponta?

Deixei as três com o mesmo sentimento. Em cada conversa, surgiu uma ferramenta diferente para um trabalho diferente, e a conexão entre elas simplesmente não estava presente. Quero dizer, na verdade, quem fazia a ponte era eu. Copiava a saída de uma, colava na entrada da outra e decidia qual modelo recebia qual tarefa. Meu café e eu viramos o roteador do sistema.

Foi só então que percebi que a quarta conversa seria a mais importante, aquela que os agentes começaram a ter entre si sem necessariamente passar por mim.

Um caso do mercado de tecnologia

Um caso de 2025 explica, pelo avesso, por que essa quarta conversa é relevante.

Em maio de 2025, a OpenAI fechou acordo para comprar a Windsurf, uma das ferramentas de programação com IA mais usadas do mercado, por cerca de US$ 3 bilhões. A Windsurf rodava, em grande parte, sobre os modelos Claude, da Anthropic. No começo de junho, antes de o negócio ser concluído, a Anthropic cortou o acesso da Windsurf aos seus modelos com menos de uma semana de aviso. Jared Kaplan, cofundador da Anthropic, explicou em público: seria estranho vender o Claude para a OpenAI.

Nenhum contrato foi quebrado. O fornecedor tinha o direito de fechar a porta, e fechou.

O que veio depois aconteceu em três dias. Em 11 de julho, uma sexta-feira, o prazo de exclusividade com a OpenAI expirou sem que o negócio fechasse. Horas depois, o Google levou o CEO, o cofundador e parte do time de pesquisa para o DeepMind, por US$ 2,4 bilhões. Na segunda-feira (14), a Cognition comprou o que sobrou, produto, marca e os funcionários que ficaram, por um valor reportado na casa de US$ 250 milhões. Uma empresa avaliada em US$ 3 bilhões em maio virou, em julho, duas partes vendidas por muito menos que o todo.

O que a Windsurf não tinha era uma segunda porta.

A quarta conversa é o que torna essa porta barata.

Os protocolos e suas camadas

Quando se fala em padrões abertos para agentes, o nome que circula é o MCP, o Model Context Protocol, publicado pela Anthropic em novembro de 2024 e adotado pela OpenAI e pelo Google ao longo de 2025. O MCP resolve um problema específico: como um agente acessa uma ferramenta, seja uma planilha, um CRM ou o gerenciador de anúncios da Meta. É como se fosse a tomada na parede. Qualquer modelo pluga em qualquer ferramenta.

O A2A, Agent2Agent, resolve o problema seguinte: como um agente conversa com outro agente.

O Google publicou o protocolo em abril de 2025 com mais de 50 parceiros, entre eles Salesforce, SAP, ServiceNow e PayPal. A Microsoft aderiu em maio. Em junho o Google o doou à Linux Foundation, com Amazon Web Services e Cisco entre os fundadores do projeto. O MCP seguiu o mesmo caminho em dezembro, com a OpenAI na mesma mesa. Em oito meses, os dois protocolos que definem como agentes trabalham deixaram de pertencer a um laboratório.

O desenho do A2A é o que interessa para construtores. Cada agente publica um cartão, um arquivo simples em um endereço conhecido, dizendo o que sabe fazer e como ser chamado. Outro agente lê o cartão, abre uma tarefa, troca mensagens, recebe o resultado.

E o detalhe que sustenta esta edição: os agentes são opacos um para o outro. Nenhum precisa revelar qual modelo usa, que memória guarda ou quais ferramentas possui. Um agente em Gemini conversa com um agente em Claude, que conversa com um agente em um Qwen local, e cada um troca o motor por baixo sem que os outros percebam. A segunda porta que a Windsurf não tinha vira uma propriedade do protocolo.

💡 Quem está autorizado a fazer o quê, por meio de qual agente, em nome de quem, com qual trilha de auditoria? A a16z chama essa pergunta de novo campo de batalha do software. Ela só existe porque os agentes já conversam entre si.

Já está acontecendo em produção

Em maio, em um painel em São Francisco, Bret Taylor, fundador da Sierra, empresa de agentes de atendimento avaliada em US$ 15 bilhões, disse que os agentes da Sierra já se conectam uns aos outros. E afirmou: "não estavam conspirando, até onde eu sei". Foi o primeiro reconhecimento público, por um executivo, de conversa entre agentes em produção sem que ninguém a tivesse desenhado.

A Meta tem um agente de negócios atendendo mais de um milhão de empresas pelo WhatsApp. E a Stripe anunciou em agosto a compra da OpenRouter, a plataforma que distribui mais de 10 trilhões de tokens por dia entre centenas de modelos, por mais de US$ 7 bilhões, segundo a imprensa. Uma empresa de pagamentos comprando a camada que decide qual modelo recebe qual tarefa diz muito sobre onde o valor está indo.

O motivo da Stripe é claro e é um reflexo de uma das camadas às quais precisamos ficar mais atentos. Quando um agente contrata outro, o pagamento é de centavos: um agente de viagem que consulta o agente de uma companhia aérea paga US$ 0,02 pela consulta. A taxa da Stripe, de 2,9% mais 30 centavos por transação, passa de 300% de um pagamento de dez centavos. O trilho tradicional vai quebrar na primeira transação entre máquinas.

Por isso em maio nasceu o KYA (Know Your Agent, o KYC para software), da Anchorage com o Google Cloud. E por isso o Google publicou, em setembro do ano passado, o AP2, o protocolo de pagamentos entre agentes que estende o A2A com mandatos assinados, ao lado de Mastercard, American Express, PayPal, Coinbase e de duas empresas de pagamento da América Latina, a brasileira Ebanx e a uruguaia dLocal.

A infraestrutura para agentes conversarem, se identificarem e transacionarem recursos já está de pé.

Por que o Brasil devia ser o primeiro a entender

O Brasil é o país que melhor sabe o que acontece quando um protocolo aberto substitui a intermediação fechada. O Pix movimentou R$ 35,4 trilhões em 2025, em 80 bilhões de transações, e é o meio de pagamento principal de 97% dos microempreendedores individuais. O Banco Central publicou um padrão, obrigou todos os bancos a falarem a mesma língua, e uma geração de fintechs nasceu construindo sobre o trilho.

O WhatsApp é a infraestrutura de comércio da pequena empresa brasileira. E o Brasil é o terceiro maior mercado do Claude no mundo, segundo a própria Anthropic.

Ainda assim, o A2A passa em branco. A Ebanx, de Curitiba, assinou o AP2 no dia do lançamento, e o assunto não entrou na conversa por aqui. O Second Brain que está por trás da Capital Pulse processou 3.123 fontes desde março. O MCP aparece em 166 delas. O A2A, em cinco. A conversa daqui ainda é sobre qual modelo e como usar. A discussão que acontece lá fora já é sobre como os agentes de empresas diferentes negociam entre si.

Entretanto, os casos para que essa infraestrutura se desenvolva já existem. A Enter, primeiro unicórnio de IA da América Latina, processa 20 bilhões de tokens por dia em litígios de Latam, Azul, Santander, Bradesco e Nubank. No dia em que o agente jurídico da Enter precisar falar com o agente de cobrança do banco, os dois vão precisar de um cartão, de uma identidade e de uma trilha de auditoria. Vão falar A2A ou um dialeto proprietário que prende os dois a um fornecedor.

O que muda para quem está construindo

Volto às três conversas, agora com a quarta no meio delas. O Qwen local, o Astra e os modelos antigos deixam de ser três ferramentas que eu opero e viram três agentes que dividem o trabalho.

O local faz o volume repetitivo sem mandar dado para fora. O modelo de fronteira entra onde há raciocínio a fazer, e só ali: a US$ 50 por milhão de tokens de saída, ele precisa valer cada chamada. Os modelos antigos viram os agentes que atendem, classificam e extraem para empresas que nunca vão pagar por um modelo de fronteira.

Faltava uma peça, e ela apareceu na terça-feira passada (15). A TypeSafe, de Diogo Almeida, ex-OpenAI, lançou o Jev, um modelo que decide e não conversa. Ele recebe um contexto e perguntas de formato fechado, escolhe as opções, ranqueia e responde sim ou não, devolvendo a decisão com grau de confiança em menos de meio segundo. Não escreve texto nem gera código, e por isso não inventa nada: só pode escolher a opção errada. A empresa diz que ele custa de 40 a 400 vezes menos que os modelos pequenos de fronteira na hora de classificar uma ação.

O que me interessa é a função. Decidir qual modelo recebe qual tarefa ou barrar uma chamada arriscada antes de executá-la. Classificar a urgência de uma mensagem ou verificar dados de campanhas de marketing sem precisar acionar um modelo grande. É o trabalho do roteador humano com café.

Escolher a ferramenta certa virou tarefa de máquina.

O Tom, o agente da AirPoint, já vive essa arquitetura em miniatura. Nasceu em GPT-4.1 Mini e migrou para o Gemini Flash-Lite depois de uma bateria de testes. Hoje o produto roda em Gemini, o código sai do Claude Code, a pesquisa no X passa pelo Grok, e o Mac Mini que vai para dentro de casa fecha a cascata: modelos locais no pré-processamento, fronteira só para raciocinar.

O Tom ainda evolui a cada rodada de conversa (ainda apanha em algumas rodadas, é verdade). Mas cada troca com um usuário ajusta suas perguntas, o seu entendimento e a sua capacidade de resolver sozinho. Em breve, vai atender outros agentes, e a minha aposta é que ele vai fazer melhor do que com pessoas: um agente não se distrai, pede exatamente o que precisa e pede num formato que o Tom lê sem esforço. No dia em que ele precisar negociar com o agente de uma companhia aérea, vai fazer isso com um cartão (ou uma wallet) na mão e uma tarefa, sem que nenhum dos dois lados precise saber qual modelo está do outro lado.

Para quem constrói, essa conexão entre os agentes será transformacional.

Cada uma das três conversas me mostrou alternativas de construção que ainda não havia utilizado e que agora já provei (e já estou construindo com elas). A quarta me mostrou que parte das novas ferramentas já conversa sem mim, em uma língua que o Brasil ainda não começou a estudar. Quem a aprender primeiro vai construir os agentes com os quais todos os outros vão precisar falar.

Forte abraço,

João Piccioni

Receba a próxima

Análise semanal sobre mercados, tecnologia e o que importa antes de importar.

Receber Insights
← Voltar para todas as edições