Enable javascript in your browser for better experience. Need to know to enable it? Go here.
  • Tools

    Adopt Trial Assess Caution Adopt Trial Assess Caution
  • New
  • Moved in/out
  • No change

Tools

Adopt ?

  • 66. Axe-core

    Axe-core is an open-source accessibility testing tool that detects issues in websites and other HTML-based applications. It checks pages for compliance with standards such as WCAG — including conformance levels A, AA and AAA — and flags common accessibility best practices. Since first appearing in the Radar in Trial in 2021, several of our teams have adopted Axe-core with clients. Accessibility is increasingly a mandatory quality attribute. In Europe, for example, regulations such as the European Accessibility Act require organizations to ensure their digital services meet accessibility requirements. Axe-core fits well within modern development workflows by enabling automated checks in CI pipelines. This helps teams prevent regressions, maintain compliance and receive early feedback during development, ensuring accessibility is part of the feedback loop, particularly as AI-assisted and agentic coding tools are more widely adopted.

  • 67. Claude Code

    Anthropic's Claude Code is an agentic AI coding tool for planning and executing complex multi-step workflows. We’re moving Claude Code to Adopt because teams inside and outside Thoughtworks now use it day-to-day in production software delivery, where it's widely treated as a benchmark for capability and usability. The CLI agent landscape has expanded quickly with tools such as OpenAI's Codex CLI, Google's Gemini CLI, OpenCode and pi, but Claude Code remains the preferred option for many teams. Its use now extends beyond code authoring into broader workflow execution, including specifications, stories, configuration, infrastructure, documentation and markdown-defined business processes. Claude Code continues to introduce features that other tools follow, such as skills, subagents, remote control and agentic team workflows.

    Teams adopting Claude Code should pair it with disciplined operating practices. Agentic coding shifts developer effort from manual implementation toward specifying intent, constraints and review boundaries. This can accelerate delivery, but it also increases the risk of complacency with AI-generated code, which can make systems harder to maintain and evolve for both people and agents. We're seeing growing attention to harness engineering as a way to implement context engineering (topic-aware, scope-driven context selection) and curated shared instructions to make agentic workflows more reliable.

  • 68. Cursor

    Cursor is among the most widely adopted coding agents we see today, consistently appearing alongside Claude Code as a default choice for our delivery teams. It has matured into a comprehensive agentic environment with features such as plan mode, hooks and subagents. While terminal-based agents remain popular, many of our developers find that supervising an agent within an IDE provides a richer experience for reviewing and refining plans before execution. The adoption of the Agent Client Protocol has further lowered barriers for the large Jetbrains user base, making Cursor's capabilities accessible within those IDEs.

    We particularly value the ability to inspect individual agent steps or roll back to earlier stages when a plan deviates. By leveraging Agent Skills, teams can package reusable instructions to help standardize how agents interact with complex codebases. While productivity gains are evident, agentic autonomy still requires rigorous automated testing and human oversight to catch subtle regressions.

  • 69. Kafbat UI

    Kafbat UI is a free, open-source web UI for monitoring and managing Apache Kafka clusters. We've found it especially useful when teams need to inspect payloads that are otherwise hard to read during day-to-day debugging. In our experience, teams often get stuck when debugging encrypted messages, and Kafbat UI's support for built-in and pluggable SerDes provides a practical way to apply decryption or custom decoding so messages become readable again. Compared with one-off debug scripts, it offers faster feedback and a better operational experience for developers and support teams. We recommend Kafbat UI for Kafka-heavy environments where secure message inspection and efficient troubleshooting should be standard practice.

  • 70. mise

    Since our last assessment, mise has evolved from a high-performance alternative to asdf into a default frontend for the development environment. We’re moving it to Adopt because it consolidates three fragmented concerns — tool and language versioning, environment variable management and task execution — into a single high-performance, Rust-based tool, configured through a declarative mise.toml file. mise is easy to set up and works well with CI/CD pipelines. It also adds a layer of supply chain security through integration with Cosign and GitHub Artifact Attestations, which is often missing from other version managers.

    For teams looking to standardize their developer environment setup, mise has become our recommended default. In polyglot environments with multiple microservices, this is especially useful when codebases adopt new language versions at the same time. Best of all, mise also works with existing language-specific tooling, so teams do not need to migrate all at once.

Trial ?

  • 71. cargo-mutants

    cargo-mutants is a mutation testing tool for Rust that helps our teams move beyond simple code coverage metrics. By automatically injecting small, intentional bugs — such as swapping operators or returning default values — it verifies whether existing tests actually catch regressions. We’ve found its zero-configuration approach particularly effective; unlike previous tools, it requires no changes to the source tree. For our teams new to Rust, it provides a useful feedback loop, identifying missing edge cases and improving the reliability of unit and integration tests.

    This tool is a specialized implementation of mutation testing, which we’re also trialing in other ecosystems. The primary cost is increased test execution time, as each mutant requires an incremental build. To manage this, we recommend targeting specific modules during local development or running full suites asynchronously in CI. While teams may occasionally need to filter out logically equivalent mutants, the resulting increase in testing confidence outweighs the additional noise.

  • 72. Claude Code plugin marketplace

    Previously, sharing custom commands, specialized agents, MCP servers and skills was a manual process that relied on developers to copy and paste instructions from Confluence or other external sources. This often led to version drift, with team members using outdated project instructions. Our teams are now leveraging the Claude Code plugin marketplace to distribute shared commands, prompts and skills using a Git-based distribution model. By hosting internal team marketplaces on GitHub or similar platforms, organizations can distribute these artifacts more securely and consistently. Developers can then sync the AI-driven workflows and tools directly into their local environments via the CLI. Other coding agents such as Cursor also support a team plugin marketplace, enabling a more streamlined and governed way to share these artifacts.

  • 73. Dev Containers

    Dev Containers provide a standardized way to define reproducible, containerized development environments using a devcontainer.json configuration file. Originally designed to give teams consistent development setups, Dev Containers have found a compelling new use case as sandboxed execution environments for coding agents. Running an AI coding agent inside a Dev Container isolates it from the host file system, credentials and network, allowing teams to grant agents broad permissions without risking the host machine. The open specification is supported natively by VS Code and VS Code–based tools such as Cursor. DevPod extends devcontainer support to any editor or terminal workflow via SSH. Dev Containers take an ephemeral-by-default approach (i.e., the container rebuilds from the configuration on each launch) which provides a clean security boundary at the cost of reinstalling tools and dependencies. For teams that need persistent state or checkpoint and restore capabilities, alternatives such as Sprites take a different approach. Dev Containers also offer supply chain security benefits beyond agent sandboxing. By defining the toolchain in a declarative configuration, teams reduce exposure to compromised packages and unexpected dependencies on developer machines.

  • 74. Figma Make

    We previously blipped self-serve UI prototyping with GenAI and this technique is now widely adopted by development teams, including product managers and designers, to generate user-testable, high-fidelity prototypes. Figma Make is a strong option for building such prototypes because it leverages actual components and layers from a design system, making the results closely resemble production applications. Figma Make uses a bespoke AI model trained on high-quality design patterns. Our teams are using it to create new design screens, enhance existing ones and build shareable prototypes to gather rapid user feedback.

  • 75. OpenAI Codex

    OpenAI Codex has evolved into a standalone agentic coding tool, available via a dedicated macOS app and CLI. It's designed for autonomous task delegation: given a prompt, it plans, implements and iterates across files with minimal intervention. Our teams have found it effective as a high-velocity drafting tool, particularly for greenfield tasks and repetitive implementation work. However, its tendency to suggest logically sound but functionally outdated library patterns means that automated testing and human review are essential. As with other agentic tools in this Radar, the risk of accumulating subtle technical debt is real and proportional to the level of autonomy teams grant it.

  • 76. Typst

    Typst is a markup-based typesetting system positioned as a modern successor to LaTeX for programmatic document generation. It combines high-quality typography with a simpler syntax and a significantly faster compilation pipeline, compiling even very large documents in a fraction of the time required by traditional LaTeX toolchains. Typst offers clearer error messages and built-in scripting capabilities such as conditionals and loops. It can also load structured data from JSON or CSV, making it well suited to automated document generation.

    Our teams have used Typst to generate statements and reports for banking and financial services customers where documents must be produced at scale with consistent formatting. The open-source compiler can be self-hosted, and its growing ecosystem includes community-contributed packages. Typst is more approachable than LaTeX while delivering comparable typographic quality.

Assess ?

  • 77. Agent Scan

    O Agent Scan é um scanner de segurança para ecossistemas de agentes que identifica componentes locais, incluindo servidores MCP e skills, e sinaliza riscos como injeção de prompt, "tool poisoning", "toxic flows", segredos hardcoded e tratamento inseguro de credenciais. Ele aborda uma lacuna emergente na visibilidade da cadeia de suprimentos de agentes e oferece uma forma prática de inventariar e testar superfícies expostas por agentes, em rápida expansão. No entanto, a adoção deve ser criteriosa. Isso ocorre por vários motivos: as varreduras exigem o compartilhamento de metadados de componentes com as APIs da Snyk, e tanto a qualidade dos sinais gerados quanto as taxas de falsos positivos precisam ser validadas no seu ambiente. É importante que os times confirmem o valor operacional do Agent Scan antes de torná-lo parte de gates obrigatórios no processo de entrega.

  • 78. Beads

    O Beads é um issue tracker baseado em Git, projetado como uma camada de memória persistente para agentes de codificação. Em vez de depender de planos em Markdown ad hoc, ele oferece aos agentes um grafo de tarefas estruturado com relações de dependência/bloqueio, detecção de tarefas prontas para execução e coordenação compatível com branches para trabalhos de longo prazo em várias sessões. Ele é construído sobre o Dolt, um banco de dados SQL com controle de versão integrado que oferece suporte a branches, merge, diffs e clonagem de tabelas de forma semelhante a um repositório Git. O Beads representa uma nova categoria de ferramentas de memória de projeto e de rastreamento de tarefas nativas de agentes. Outros projetos pioneiros neste espaço incluem o ticket e o tracer. Diferente dos sistemas de tickets tradicionais, como GitHub Issues e Jira, o Beads e ferramentas similares viabilizam novos workflows para coordenar a execução autônoma de múltiplos agentes, incluindo agentes que atribuem tarefas uns aos outros.

  • 79. Bloom

    O Bloom é uma ferramenta da Anthropic para pessoas pesquisadoras de segurança em IA avaliarem o comportamento de LLMs. Ele investiga comportamentos como a bajulação e a autopreservação. Em comparação com benchmarks estáticos, ele usa uma configuração inicial que define os comportamentos alvo e os parâmetros de avaliação para gerar dinamicamente conversas de teste diversificadas e, em seguida, avaliar os resultados. Essa abordagem para avaliação comportamental automatizada é necessária para acompanhar o ritmo dos lançamentos de modelos, permitindo que times de pesquisa externos conduzam avaliações. O Petri é uma ferramenta complementar que identifica quais comportamentos surgem para um determinado modelo, enquanto o Bloom identifica em quais cenários e com que frequência esses comportamentos ocorrem, formando juntos um conjunto de avaliação mais completo. Uma preocupação é que o Bloom requer um modelo professor (ou avaliador) que avalia um determinado modelo aluno. Modelos professores podem ter pontos cegos e vieses, portanto, usar múltiplos avaliadores pode reduzir o viés nos resultados. Times de pesquisa em segurança de IA devem avaliar o Bloom como um complemento aos benchmarks estáticos para avaliar comportamentos emergentes de modelos.

  • 80. CDK Terrain

    O CDK Terrain (CDKTN) é um fork mantido pela comunidade do Cloud Development Kit for Terraform (CDKTF), que a HashiCorp descontinuou e arquivou em dezembro de 2025. O CDK Terrain retoma de onde o CDKTF parou, permitindo que os times definam infraestrutura usando TypeScript, Python ou Go e a provisionem por meio do Terraform ou OpenTofu. Para times que já investiram no CDKTF, o CDK Terrain oferece um caminho de migração que preserva o código e os workflows existentes, em vez de forçar uma migração para o HCL ou Pulumi. O projeto tem lançamentos mensais e passou a oferecer suporte de primeira classe ao OpenTofu. No entanto, forks mantidos pela comunidade de projetos abandonados por fornecedores trazem riscos inerentes quanto ao suporte de longo prazo, e a abordagem do CDKTF nunca alcançou ampla adoção. A HashiCorp citou a falta de product-market fit ao descontinuá-lo. Os times que usam CDKTF atualmente devem avaliar o CDK Terrain como uma opção de continuidade, mas também ponderar se este é o momento certo para migrar para uma abordagem com suporte mais amplo.

  • 81. CodeScene

    Nós colocamos no Radar a análise social de código lá em 2017, mas com o aumento da adoção de agentes de programação, estamos vendo um interesse renovado, particularmente em ferramentas como o CodeScene. O CodeScene é uma ferramenta de análise comportamental de código que identifica a dívida técnica combinando métricas de complexidade de código com o histórico do controle de versão. Diferente da análise estática tradicional, ela destaca "hotspots" para ajudar os times a priorizar a refatoração com base na atividade real de desenvolvimento e no impacto nos negócios. O CodeScene agora fornece orientações para o design de código amigável à IA. Nossos times estão descobrindo que a qualidade do código se tornou ainda mais importante, pois os agentes de programação podem modificar o código muito mais rapidamente do que as pessoas desenvolvedoras humanas. A métrica CodeHealth do CodeScene fornece um guardrail útil ao identificar áreas onde o código é complexo demais para os LLMs refatorarem com segurança sem um alto risco de alucinações. Recomendamos que os times avaliem o CodeScene como um guardrail para a adoção de agentes de programação. Sua métrica CodeHealth destaca alvos seguros de refatoração e sinaliza áreas que exigem remediação antes que os agentes sejam aplicados.

  • 82. ConfIT

    O ConfIT é uma biblioteca para definir testes de API de integração e de componente de forma declarativa em JSON, em vez de escrever fluxos de teste de forma imperativa no código. Estamos vendo um interesse crescente nessa abordagem, pois grandes suítes de testes frequentemente acumulam boilerplate em torno de clientes HTTP, configuração de requisições e asserções. O desenvolvimento assistido por IA reforça ainda mais essa tendência, tornando as definições de teste estruturadas mais fáceis de gerar e manter do que o código procedural verboso. Com base na experiência em clientes e em nossa avaliação, uma camada declarativa pode reduzir a duplicação entre testes de integração e de componentes, melhorar a legibilidade e tornar a intenção do teste mais fácil de evoluir entre os times. No entanto, o próprio ConfIT parece ter uma adoção limitada da comunidade e um ecossistema pequeno, tornando mais difícil recomendá-lo amplamente apesar desses benefícios. Acreditamos que vale a pena avaliar o ConfIT para times .NET que exploram testes de API orientados a especificações. Os times devem, no entanto, validar sua capacidade de manutenção a longo prazo, adequação ao ecossistema e as concessões operacionais antes de adotá-lo mais amplamente.

  • 83. Entire CLI

    A Entire CLI se conecta aos workflows do Git para capturar sessões de agentes de programação de IA — incluindo transcrições, prompts, chamadas de ferramentas, arquivos modificados e uso de tokens — como metadados pesquisáveis armazenados em uma branch dedicada do repositório. Ela suporta o Claude Code, Gemini CLI, OpenCode, Cursor, Factory AI Droid e GitHub Copilot CLI. À medida que os agentes de IA se tornam os principais contribuidores das bases de código, os times enfrentam uma lacuna crescente entre o que o Git rastreia e o que realmente acontece durante uma sessão de programação. A Entire CLI resolve isso registrando sessões completas junto com os commits, criando uma trilha de auditoria da atividade do agente sem poluir o histórico da branch principal. Seu sistema de checkpoint também permite uma recuperação prática: os times podem retroceder para um estado funcional, quando um agente sai dos trilhos, e retomar de qualquer checkpoint. Embora a ferramenta ainda seja muito nova e o ecossistema para rastreabilidade de sessões de agentes ainda esteja se formando, os times com requisitos de conformidade ou auditoria relacionados a código gerado por IA podem achar a captura de sessão nativa do Git uma solução ideal.

  • 84. Git-AI

    O Git AI é uma extensão do Git de código aberto que rastreia código gerado por IA em seus repositórios, vinculando cada linha escrita por IA ao agente, modelo e prompts que a geraram. O Git AI usa checkpoints e hooks para rastrear mudanças incrementais no código entre o início e o fim de um commit. Cada checkpoint contém um diff entre o estado atual e o checkpoint anterior, marcado como sendo de autoria de IA ou humana. Essa abordagem é mais precisa do que métodos focados em rastrear a autoria de código de IA pela contagem de linhas de código no momento da inserção. O Git AI usa um padrão aberto (open standard) para rastrear código gerado por IA usando o Git Notes. Embora o ecossistema de agentes suportados ainda esteja amadurecendo, acreditamos que vale a pena avaliar o Git AI para times que buscam reter a capacidade de manutenção a longo prazo e a responsabilidade em um fluxo de trabalho baseado em agentes. Tanto humanos quanto agentes de IA podem consultar a intenção original e as decisões arquiteturais por trás de um bloco de código específico via skill /ask, referenciando a sessão arquivada do agente.

  • 85. Google Antigravity

    O Google Antigravity é um fork independente do VS Code, construído com tecnologia licenciada do Windsurf e lançado em prévia pública junto com o Gemini 3 em novembro de 2025. O Antigravity centraliza a IDE em torno da orquestração de múltiplos agentes: um gerenciador de agentes executa vários agentes em paralelo nas tarefas, um navegador Chromium integrado permite que os agentes interajam diretamente com UIs ativas, e um sistema de skills armazena instruções reutilizáveis de agentes no repositório. O gerenciador de agentes atua mais como um painel de "Mission Control" do que apenas uma barra lateral de chat padrão, mudando fundamentalmente o papel da pessoa desenvolvedora de escrever código linha por linha para orquestrar múltiplos fluxos de trabalho autônomos. As pessoas desenvolvedoras ainda podem entrar no editor para assumir o controle com um humano no ciclo (HITL) quando necessário. O Antigravity se integra ao Google Cloud e ao Firebase por meio do Model Context Protocol e suporta o desenvolvimento de agentes via Agent Development Kit. Estamos colocando o Antigravity em Avalie porque ele continua em prévia pública sem data para disponibilidade geral (GA), e sua postura de segurança e prontidão corporativa ainda estão em evolução. O modelo de execução com múltiplos agentes e o acesso autônomo ao navegador sinalizam para onde as IDEs baseadas em agentes estão indo.

  • 86. Google Mainframe Assessment Tool

    A Google Mainframe Assessment Tool ajuda as organizações a fazer engenharia reversa de aplicações que rodam em mainframes, analisando um portfólio inteiro ou sistemas individuais. Em sua essência, ela depende de parsers determinísticos de linguagem para mapear fluxos de chamadas e dependências de dados em bases de código, criando uma visão estrutural de como as aplicações interagem. A partir dessa base, os recursos de IA generativa oferecem resumos, documentação, geração de casos de teste e sugestões de modernização. Essa abordagem se alinha a um padrão mais amplo de usar GenAI para entender bases de código legadas, onde insights sólidos sobre o sistema formam a base para o uso eficaz da IA. Embora a ferramenta ainda não ofereça suporte a todas as principais stacks de tecnologia de mainframe, ela está evoluindo rapidamente. Nossos times a consideraram útil em projetos com clientes focados em descoberta e modernização de aplicações de mainframe.

  • 87. OpenCode

    O OpenCode rapidamente se tornou um dos agentes de programação de código aberto mais proeminentes, com uma experiência robusta e focada no terminal. Um de seus pontos mais fortes é a flexibilidade de modelos: ele suporta modelos de fronteira hospedados, endpoints auto-hospedados e modelos locais. Isso torna o OpenCode atrativo para controle de custos, personalização e ambientes restritos, incluindo configurações isoladas (air-gapped). Isso também significa que as pessoas usuárias precisam ter clareza sobre o licenciamento e os termos do provedor ao usar assinaturas ou APIs. O modelo de extensões do OpenCode é outro grande atrativo, dando suporte a plugins e integrações MCP para workflows, ferramentas e guardrails específicos do time. Muitas pessoas usuárias adicionam o Oh My OpenCode, uma estrutura (harness) opcional, mas popular, que fornece uma configuração mais rígida (opinionated), completa e pronta para uso (batteries-included), com times de agentes coordenados e padrões de orquestração mais ricos.

  • 88. OpenSpec

    À medida que as capacidades dos agentes de programação de IA evoluem, as pessoas desenvolvedoras enfrentam cada vez mais desafios com a previsibilidade e a capacidade de manutenção quando os requisitos e o contexto vivem apenas em históricos efêmeros de chat. Para resolver isso, estamos vendo o surgimento de ferramentas de desenvolvimento orientado a especificações (SDD). O OpenSpec é um framework SDD de código aberto que introduz uma camada leve de especificação, garantindo que as pessoas desenvolvedoras humanas e os agentes de IA se alinhem sobre o que construir antes que o código seja gerado. O que diferencia o OpenSpec é o seu workflow fluido e mínimo, que muitas vezes é reduzido a três etapas: propor -> aplicar -> arquivar. Muitos frameworks SDD (por exemplo, GitHub Spec Kit) ou workflows de Skills de agentes (por exemplo, Superpowers) são mais adequados para projetos greenfield do que brownfield. Gostamos particularmente do foco do OpenSpec nos deltas de especificação em vez de definir uma especificação completa antecipadamente, o que o torna muito adequado para sistemas existentes. Diferente de alternativas mais pesadas que impõem workflows mais rígidos (como o BMAD) ou que exigem integrações de IDE específicas de fornecedores (como o Kiro), o OpenSpec é iterativo e agnóstico em relação a ferramentas. Para times que buscam introduzir estrutura e previsibilidade no desenvolvimento assistido por IA sem adotar um processo pesado, o OpenSpec é um framework amigável para pessoas desenvolvedoras que vale a pena avaliar. Enquanto isso, à medida que os modelos e os agentes de programação continuam a se tornar mais poderosos, também recomendamos que os times continuem a monitorar e revisitar as capacidades nativas e a reavaliar a necessidade de ferramentas de SDD.

  • 89. PageIndex

    O PageIndex é uma ferramenta que constrói um índice hierárquico de um documento para pipelines de RAG baseados em raciocínio e sem vetores, em vez de depender da recuperação tradicional baseada em embeddings. Em vez de dividir um documento em vetores, o que pode perder informações estruturais e fornecer visibilidade limitada sobre por que os resultados foram recuperados, o PageIndex constrói um índice de sumário que um LLM percorre passo a passo para recuperar o conteúdo relevante. Isso produz um rastro explícito de raciocínio que explica por que uma seção específica foi selecionada, semelhante a como um ser humano escaneia os títulos e se aprofunda em seções específicas. Alguns de nossos times descobriram que essa abordagem funciona bem para documentos em que o significado depende fortemente da estrutura e não da semântica, como relatórios financeiros com dados numéricos, documentos legais com artigos de referência cruzada e documentos clínicos ou científicos complexos. No entanto, essa abordagem traz concessões. Por exemplo, como a inferência do LLM faz parte do processo de recuperação, ela pode introduzir latência e custos significativos, especialmente para documentos grandes.

  • 90. Pencil

    O Pencil é uma ferramenta de canvas de design que se integra com IDEs e agentes de programação, como o Cursor e o Claude Code. De modo diferente do Figma, que atualmente oferece apenas acesso de leitura, o Pencil executa um servidor MCP local bidirecional que dá acesso tanto de leitura quanto de escrita para manipular o canvas diretamente. Ele também fornece capacidades de design-to-code (design para código) de forma semelhante a ferramentas como o Figma Make e o Builder.io, mas adota uma abordagem mais centrada nas pessoas desenvolvedoras, com arquivos de design armazenados no repositório em um formato JSON aberto chamado .pen, tornando os assets de design versionáveis junto com o código. Essa abordagem pode ajudar a preencher a lacuna na transição de design para desenvolvimento ao se integrar com ferramentas familiares para as pessoas desenvolvedoras. Para design systems complexos e de grande escala, o Figma continua sendo o padrão para colaboração entre diferentes papéis. No entanto, vale a pena considerar o Pencil para times sem profissionais de design dedicados ou para times com pessoas desenvolvedoras que possuem fortes habilidades de design.

  • 91. Pi

    O Pi é um agente de programação de terminal minimalista e de código aberto, escrito em TypeScript. Nós o vemos como algo atraente para pessoas curiosas e experimentadoras, em vez de um padrão corporativo mainstream. O pi é uma estrutura enxuta que é mais personalizável do que um agente completo como o OpenCode. Também é mais fácil de adaptar do que construir um novo agente com um framework baseado em agentes, como ADK, LangGraph ou Mastra. O projeto ainda está em fase inicial e é liderado principalmente por pessoas mantenedoras, apesar da forte tração e de atualizações frequentes. Trate o pi como um building block voltado para pessoas engenheiras, e não como uma plataforma corporativa completa com todos os guardrails e suporte.

  • 92. Qwen 3 TTS

    O Qwen 3 TTS é um modelo de conversão de texto em fala de código aberto que fecha grande parte da lacuna de qualidade em relação às ofertas comerciais, ao mesmo tempo em que oferece maior controle para as pessoas desenvolvedoras do que muitas APIs pagas. Ele oferece suporte a múltiplos idiomas, pode clonar vozes a partir de amostras curtas (aproximadamente 10 a 15 segundos) e permite o fine-tuning pós-treinamento para vozes específicas de um domínio ou personagem, tornando-o uma opção atraente para times que precisam de fala específica da marca ou controle on-premises. Ainda é um lançamento recente, e os times devem validar a estabilidade, os controles de segurança, a adequação do licenciamento e a maturidade operacional antes de adotá-lo para workloads de voz críticos em produção.

  • 93. SGLang

    O SGLang é um framework de serviço de alto desempenho que reduz o overhead de computação da inferência de LLMs por meio de um co-design de sua linguagem de programação de frontend e runtime de backend. Ele introduz o RadixAttention, uma técnica de gerenciamento de memória que armazena em cache e reutiliza de forma agressiva os estados KV (chave-valor) entre prompts. Essa abordagem entrega melhorias significativas de desempenho em relação a motores de serviço padrão, como o vLLM, em cenários com alta sobreposição de prefixos. Para times que constroem agentes autônomos complexos, que dependem de prompts de sistema longos ou usam extensivamente few-shot prompting com exemplos compartilhados, o SGLang pode fornecer ganhos substanciais em latência e eficiência.

  • 94. ty

    À medida que o Python continua a crescer em popularidade, especialmente no espaço de IA e ciência de dados, ter um sistema de tipos forte torna-se cada vez mais valioso. O ty é um verificador de tipos e servidor de linguagem Python extremamente rápido, escrito em Rust. Ele faz parte do ecossistema Astral, que também inclui ferramentas como o uv e o ruff. O ty fornece feedback rápido e se integra bem a editores comuns, como o Visual Studio Code, entre outros. Em nossa experiência, o uso do ty junto com outras ferramentas da Astral simplifica o desenvolvimento em Python em escala nas grandes organizações. Conforme a programação baseada em agentes se torna mais comum, ter um verificador de tipos determinístico com um ciclo de feedback rápido ajuda a detectar erros cedo e reduz o esforço de revisão de código em erros simples.

  • 95. Warp

    Desde a última vez que incluímos o Warp no Radar, ele evoluiu muito além de sua descrição de "terminal com recursos de IA". Seus pontos fortes centrais permanecem — saída de comandos baseada em blocos, sugestões impulsionadas por IA e recursos de notebook —, mas o Warp se expandiu para um território tradicionalmente ocupado por IDEs. Ele agora pode renderizar Markdown, exibir uma árvore de arquivos e abrir arquivos diretamente no terminal, suportando um workflow completo de desenvolvimento baseado em agentes em diferentes painéis: um agente de programação como o Claude Code em um, um shell no outro e a visualização de arquivos do workspace em um terceiro painel. Uma vantagem prática que observamos é que o Warp lida com a saída de texto de alta taxa de transferência produzida por agentes de programação modernos melhor do que os terminais tradicionais, onde a velocidade de renderização e a legibilidade podem se tornar gargalos. O Warp também adicionou um assistente de programação integrado, embora isso não tenha sido amplamente avaliado em nossos times. O Warp lançou recentemente o Oz, uma plataforma de orquestração para agentes em nuvem que se integra ao terminal. Este blip foca no próprio terminal. Times que preferem um terminal leve e combinável e desejam trazer suas próprias ferramentas de IA podem achar o Ghostty uma opção melhor; ele adota uma abordagem deliberadamente minimalista em contraste com a filosofia completa (batteries-included) do Warp. O ritmo de novos recursos e as ambições de plataforma mais amplas do Warp tornam a implementação da Avaliação (Trial) prematura até que o produto se estabilize e ganhamos mais experiência de campo com suas capacidades mais recentes.

  • 96. WuppieFuzz

    O WuppieFuzz é um fuzzer de código aberto para APIs REST que usa uma definição OpenAPI para gerar solicitações válidas, modifica-as para explorar os casos extremos (edge cases) e se baseia no feedback de cobertura do servidor para priorizar entradas que alcançam novos caminhos de execução. Isso é importante porque a maioria dos times ainda depende de testes de integração e de contrato baseados em exemplos, que raramente investigam entradas inesperadas, sequências de solicitação incomuns ou caminhos propensos a falhas, mesmo que as APIs sejam frequentemente a principal superfície de integração de sistemas modernos. Com base em nossa avaliação inicial, o WuppieFuzz parece um complemento promissor para esses testes, porque pode descobrir problemas como exceções não tratadas, lacunas de autorização, vazamentos de dados sensíveis, erros do lado do servidor e falhas de lógica que os testes roteirizados podem deixar passar. Os times ainda precisam avaliar como ele se encaixa na CI, o overhead de runtime que ele introduz e quão úteis são seus resultados na prática. Por essa razão, acreditamos que vale a pena avaliar o WuppieFuzz para times que constroem APIs REST críticas ou expostas externamente.

Caution ?

  • 97. OpenClaw

    O OpenClaw é um projeto de código aberto na categoria que sua criadora chama de "assistente de IA hiper-pessoal". As pessoas usuárias hospedam sua própria instância, a mantém continuamente disponível por meio de canais de mensagens como WhatsApp ou iMessage e, em seguida, permitem que ela execute tarefas por meio de ferramentas conectadas. Com memória persistente de conversas, preferências e hábitos, o OpenClaw cria uma experiência pessoal persistente que parece materialmente diferente das interfaces de chat de GenAI ou agentes de programação típicos. O modelo é claramente atraente e já inspirou seguidores como o Claude Cowork. Nós colocamos o OpenClaw em Reflita porque o modelo exige concessões (trade-offs) de segurança substanciais. Quanto mais acesso você concede a ele — ao calendário, e-mail, arquivos e comunicações — mais útil ele se torna, e mais ele concentra permissões exatamente no padrão sobre o qual alertamos em análise de fluxo tóxico para IA. Esse risco não é exclusivo do OpenClaw; ele se aplica a outras implementações do mesmo padrão, incluindo ofertas de fornecedores estabelecidos. Nós publicamos conselhos para times sobre o OpenClaw e ambientes de execução em sandbox, e alternativas como NanoClaw ou ZeroClaw podem reduzir o raio de impacto. No entanto, o padrão de assistente hiper-pessoal por si só continua ávido por permissões e sendo de alto risco.

Unable to find something you expected to see?

 

Each edition of the Radar features blips reflecting what we came across during the previous six months. We might have covered what you are looking for on a previous Radar already. We sometimes cull things just because there are too many to talk about. A blip might also be missing because the Radar reflects our experience, it is not based on a comprehensive market analysis.

Download the PDF

 

 

 

English |  Português

Sign up for the Technology Radar newsletter

 

 

Subscribe now

Visit our archive to read previous volumes