Anthropic detalha avanços na correção de vícios de escrita do Claude
Aprofundamento CEVIU
Aprofundamento
A melhoria na escrita do Claude Opus 5.5, conforme noticiado pela Anthropic, é um case interessante para quem lida com dados e modelos de IA. A avaliação externa do Arize detalha uma metodologia robusta para aferir a qualidade textual, superando a subjetividade e a métrica rasa. Tudo começa com a construção de um dataset fixo de tarefas de escrita, garantindo que qualquer mudança observada venha do modelo, não da entrada. Para evitar vazamento de estilo, os briefs de pesquisa, por exemplo, foram criados como fragmentos de bullet points.
O processo segue para a anotação manual, que aqui focou em 'movimentos retóricos' em vez de listas de palavras banidas. Termos como 'a interação importa' ou 'merece um momento' (classificados como salience flags) eram mais prevalentes que os clichês isolados. Essa granularidade na anotação, que se tornou o 'ground truth', permitiu construir um avaliador tipo 'span judge' (que identifica trechos problemáticos), usando um modelo externo (GPT-6-Luna) para evitar que o Claude avaliasse a si mesmo. Esse rigor metodológico, incluindo a normalização por comprimento e a iteração do prompt do avaliador baseada nos resultados, é o que realmente valida os 99,6% de queda nos travessões e os 50% de redução em outros maneirismos estilísticos.
O que mudou
Em 23 de setembro de 2026, o CEVIU News noticiou o lançamento do Claude Opus 5.5, destacando sua eficiência, otimização de custos e performance aprimorada. Naquele momento, as melhorias de escrita foram anunciadas pela Anthropic de forma mais genérica, sem o detalhamento dos avanços obtidos. A notícia atual, com base na avaliação do Arize, preenche essa lacuna, mostrando de forma concreta e mensurável o que era uma promessa de lançamento: a significativa redução dos 'Claudismos', como o uso excessivo de travessões e frases com maneirismos.
Além disso, em 29 de setembro de 2026, o CEVIU News publicou sobre a importância da Anthropic otimizar as avaliações de IA com 'Automação sem Autoengano'. A notícia de agora demonstra a aplicação prática dessa filosofia. Enquanto a cobertura anterior focava nos princípios do design de avaliações, este novo relatório detalha um estudo de caso real de como uma metodologia de avaliação granular, focada em anotações precisas de 'movimentos retóricos' (em vez de frases banidas), foi implementada para refinar a geração de texto de um modelo de IA.
Por que isso importa
Para engenheiros de dados e especialistas em MLOps, a metodologia empregada na correção dos 'Claudismos' é uma mina de ouro. Ela sublinha a importância de criar pipelines de avaliação que vão além de métricas superficiais, utilizando anotações detalhadas como verdade fundamental para o treinamento e ajuste de modelos de IA. A abordagem demonstra como é possível traduzir feedback qualitativo (como 'escrita muito robótica') em métricas quantificáveis, permitindo refinamentos iterativos e baseados em evidências.
Isso significa que podemos construir modelos de linguagem mais confiáveis e com saídas mais consistentes, adaptadas a requisitos específicos de estilo e tom. Para o mercado, modelos com escrita natural e livre de maneirismos reduzem a necessidade de edição pós-geração, otimizam processos de conteúdo e fortalecem a comunicação de marca, elevando o padrão de qualidade das interações com IA em diversas aplicações.
Linha do tempo
Anthropic detalha problemas de qualidade no Claude e medidas de prevenção.
Anthropic publica atualização sobre relatórios de qualidade de código do Claude Code.
Anthropic otimiza drasticamente engenharia de contexto no Claude 5.
Anthropic lança Claude Opus 5.5 com foco em otimização de custos e performance.
Anthropic eleva o patamar com Claude Opus 5.5: mais eficiente e acessível.
Anthropic aborda a otimização de avaliações de IA no Claude.
Anthropic detalha avanços na correção de vícios de escrita do Claude Opus 5.5.
Perguntas frequentes
O que são 'Claudismos' e por que a Anthropic tentou corrigi-los?
Claudismos são maneirismos estilísticos recorrentes na escrita gerada pelo Claude, como o uso excessivo de travessões ou frases que 'dizem' que algo é importante em vez de 'mostrar'. A Anthropic buscou corrigi-los para tornar a escrita do Claude mais natural e menos 'robótica', respondendo a um feedback comum dos usuários da versão Opus 5.
Como a melhoria na escrita do Claude Opus 5.5 foi avaliada externamente?
A avaliação externa, realizada pelo Arize, usou uma metodologia que incluiu a criação de um dataset fixo de tarefas de escrita, anotação manual de 'movimentos retóricos' em trechos específicos, e a construção de um avaliador granular ('span judge') que usa um modelo externo (GPT-6-Luna) para identificar e quantificar esses maneirismos. Não foi uma avaliação subjetiva ou baseada apenas em 'listas de palavras banidas'.
Qual foi a redução nos 'Claudismos' com o lançamento do Opus 5.5?
Os dados da avaliação externa indicam uma redução impressionante de 99,6% no uso excessivo de travessões. Além disso, outros maneirismos estilísticos, os chamados 'Claudismos', tiveram uma queda de aproximadamente 50% em comparação com a versão Opus 5. O Opus 5.5 ainda não está 'perfeito', mas as melhorias são significativas.
O que significa 'span judge' no contexto desta avaliação?
Um 'span judge' é um tipo de avaliador de IA que não apenas atribui uma pontuação geral a um texto, mas identifica e retorna trechos específicos (spans) que correspondem a um critério problemático. Isso permite uma análise muito mais granular e precisa dos 'Claudismos', possibilitando identificar exatamente onde e como o modelo está falhando ou melhorando.
Fontes
- arize.comfonte original
- Categoria
- CEVIU Dados
- Publicado
- 01 de outubro de 2026
- Editoria
- CEVIU Dados

