A Diar.ia agora está no LinkedIn e no Facebook. Seguir por lá e compartilhar nossas publicações ajudam bastante!

LANÇAMENTO

Criada com Gemini

Milla Jovovich tem uma conta no GitHub. Isso já seria notícia. Que o código publicado seja funcional e competitivo com produtos pagos é outra história.

O MemPalace resolve um problema que qualquer usuário intensivo de IA já sentiu: você passa semanas construindo contexto numa ferramenta e, na próxima sessão, ela não lembra de nada. A maioria das soluções extrai resumos das conversas. O MemPalace guarda tudo, palavra por palavra, e organiza o material numa hierarquia inspirada na técnica grega do palácio da memória. Duas dependências. Roda local. Sem custo de API.

No LongMemEval, que mede recuperação de informação ao longo de conversas longas, o sistema marcou 96,6% — contra 85% dos concorrentes pagos Mem0 e Zep. O benchmark foi divulgado inicialmente como 100%, o que puxou críticas de desenvolvedores. Os céticos questionam quanto do código veio de Jovovich diretamente, mas o repositório tem commits reais, licença MIT e já está em produção.

23 mil estrelas no GitHub em dois dias. Integração via MCP com Claude, ChatGPT e Cursor. Compressão AAAK para carregar meses de contexto sem chamadas externas.

Por que isso importa:

Falta de memória persistente é um dos maiores freios para agentes em fluxos de trabalho reais. Uma solução gratuita, local e com esses números de benchmark vale experimentar.

DISRUPÇÃO

A Andon Labs alugou um espaço comercial em São Francisco por três anos e passou o controle para Luna, um agente de IA. Luna escolheu o conceito da loja, selecionou os produtos, definiu preços, contratou funcionários e abriu as portas. Os humanos da empresa assistiram.

Para comprar, o cliente pega um telefone fixo no balcão e fala com Luna. Ela cobra no iPad. Os dois funcionários humanos na loja foram contratados via Indeed depois de entrevista com a própria Luna por Zoom.

Deu errado em alguns momentos. Ao procurar um pintor numa plataforma online, Luna tentou contratar alguém no Afeganistão porque não conseguiu navegar o menu de países. Não está claro o que acontece quando ela tomar uma decisão trabalhista equivocada.

É a mesma equipe que colocou um agente para gerir uma máquina de refrigerantes no escritório da Anthropic. Aquilo terminou quando jornalistas do Wall Street Journal descobriram que podiam convencer o sistema a entregar tudo de graça.

Por que isso importa:

O Andon Market é o teste mais ambicioso de autonomia de agente em ambiente com consequências reais: aluguel de três anos, funcionários contratados, dinheiro em jogo. Os erros documentados são mais úteis do que os acertos — mostram onde os modelos ainda precisam de humano no loop.

É IA?

A

B

Ao clicar em uma das opções abaixo, escreva o que fez você escolher ela. Vou incluir na próxima edição.

Ninho arbóreo de abelhas sem ferrão (Trigona sp.) perto de Flores, Guatemala.

Resultado da última edição: 17% das pessoas acertaram.
LANÇAMENTO

A Z.ai lançou o GLM-5.1 com licença MIT e o modelo foi direto para o topo do SWE-Bench Pro: 58,4 pontos contra 57,7 do GPT-5.4 e 57,3 do Claude Opus 4.6. Primeira vez que um modelo open source fica acima de todos os fechados nesse benchmark.

Um dado que não passa despercebido: o GLM-5.1 foi treinado em 100 mil chips Huawei Ascend 910B. Nenhum componente americano. A Z.ai está na lista de bloqueio dos EUA desde janeiro de 2025. As restrições de exportação de semicondutores não impediram o resultado.

O que diferencia o modelo na prática é o tempo de execução. Ele mantém um loop de planejamento e correção por até 8 horas sem intervenção humana. Num teste interno, construiu um ambiente de desktop Linux do zero em 655 iterações.

Disponível no Hugging Face com pesos completos. API a US$ 1,40 por milhão de tokens de entrada. Compatível com Claude Code e OpenClaw.

Por que isso importa:

O SWE-Bench Pro mede reparos em bugs reais de código de produção — não cenários controlados. Um modelo gratuito no topo dessa lista muda a conversa para qualquer time escolhendo modelo para agentes de engenharia.

LANÇAMENTOS

Anthropic lançou o Claude como add-in nativo no Microsoft Word: rascunho, edição e revisão de documentos pela barra lateral, com cada alteração aparecendo como controle de mudanças. Planos Team e Enterprise, disponível no AppSource.

Anthropic levou o Cowork para todos os planos pagos, adicionando controles de acesso por equipe, limites de gasto por grupo e analytics de adoção para administradores.

PESQUISAS

A Anthropic publicou um framework técnico sobre como gerenciar riscos de segurança de agentes autônomos em produção: prompt injection, subagentes paralelos, revisão de planos de execução e os limites atuais dos mecanismos de contenção.

Pesquisa do MIT avalia o impacto da automação por IA em milhares de tarefas do mercado de trabalho a partir da perspectiva dos próprios trabalhadores, identificando quais funções estão mais expostas à substituição e quais tendem à complementaridade.

SORTEIO

Você presta atenção ao conteúdo gerado por IA que consome? Para te ajudar nesse exercício, há pelo menos um pequeno erro em cada edição.

Responda indicando qual é o erro, ou se não há nenhum, e receba um número para concorrer a um livro sobre IA entre os que recomendamos, a ser sorteado em maio. Sua resposta deve chegar até mim antes do envio da edição seguinte.

Na última edição, coloquei deurgência, quando deveria ser de urgência.

PARA ENCERRAR

Na Diar.ia, uso Gemini, Claude e Perplexity para automatizar a pesquisa e em outras etapas, e Wispr Flow para ganhar velocidade com comandos de voz (ganhe um mês do plano Pro). Depois disso, faço checagem de fatos, a Clarice.ai revisa o texto (ganhe 25% de desconto com o cupom DIARIA), dou o toque final e envio via Beehiiv (ganhe um mês grátis e 20% de desconto por 3 meses).

Acesse:

Keep Reading