CEVIU Logo

CEVIU News

As melhores notícias de tecnologia, curadas diariamente para quem vive tech.

819 notícias encontradas

O stack interno de treinamento de IA da SpaceX faz uso intensivo de paralelismo de pipeline, mapeando-o exatamente para 220 mil GB300s com NICs de 800G, buscando a máxima proximidade com o bare metal. Essa abordagem pode resultar em uma melhoria de velocidade superior a uma ordem de magnitude. O próximo objetivo da SpaceX é desenvolver o stack de inference em C para RL de alta velocidade simultânea em um grande bloco de GB300s.

Asuka Zheng argumenta que o pânico de "estamos ficando sem dados de treinamento" ignora a real dinâmica do mercado de dados, citando seu próprio projeto de substituição de SRE que treinou dois modelos de mundo até estagnar porque trajetórias de incidentes de longo horizonte, de ponta a ponta, desde a primeira anomalia até a resolução completa, não existiam como um dataset.

Manter a rede inteira na memória de uma só vez é o motivo pelo qual o treinamento de IA está atingindo um limite de recursos. A Sakana Labs encontrou uma nova maneira de dividir a rede em blocos e treiná-los independentemente. O truque foi tratar o forward pass da rede como um modelo diffusion que remove ruído de um sinal. Isso reduz drasticamente a memória necessária para treinar modelos profundos.

Modelos de IA agora utilizam mais contexto para compreender bases de código, o que resulta em redução de custos, já que os tokens de entrada e os de leitura de cache são mais baratos do que os tokens de saída. Essa abordagem orientada pelo contexto melhora a calibração do código, aumentando a produtividade do desenvolvedor e as taxas de sobrevivência de diffs.

Jarred Sumner utilizou os workflows dinâmicos do Claude para reescrever o Bun de Zig para Rust, alcançando 99,8% de sucesso nos testes com 750.000 linhas de Rust em apenas 11 dias. Os workflows dinâmicos permitem que o Claude divida tarefas complexas em subtarefas, com agentes executando-as em paralelo até que os resultados convirjam para uma solução eficiente e precisa.

O Agent Judge aprimora as avaliações para agentes de IA em produção com contexto estendido, focando em busca, verificação e adaptação. Ele aborda as deficiências dos avaliadores baseados em LLMs, gerenciando trajetórias complexas, verificando ações estatais contra sistemas e atualizando métricas com base em feedback real. Testes mostram que o Agent Judge, especialmente com métricas refinadas, supera avaliadores LLM tradicionais em precisão e consistência, particularmente em cenários desafiadores.

A SpaceX assinou um importante acordo de compute com a Anthropic este mês, avaliado em bilhões de dólares mensais. No entanto, Elon Musk minimizou recentemente o acordo, afirmando que a SpaceX não se comprometeu a alugar seu compute por anos, embora isso possa acontecer. Na verdade, o contrato é de 180 dias com uma cláusula de cancelamento mútuo de 90 dias após esse período. O prazo curto foi um pedido da SpaceX, que pode querer reaver o compute em algum momento. A declaração de Musk contradiz diretamente o registro S-1 da SpaceX, que apresenta o acordo como um contrato de três anos.

O OpenClaw demonstrou o potencial dos agentes de IA autônomos, mas falhou em produção devido à gestão de contexto, não-determinismo, tooling deficiente e limitações dos modelos. Sistemas totalmente autônomos são frágeis , com casos de uso no mundo real dependendo de workflows estruturados e etapas de LLM, em vez de autonomia pura. A próxima onda se move para "agent harnesses" verticais que empacotam contexto específico de domínio, confiabilidade e infraestrutura em produtos utilizáveis.

Pesquisadores alcançaram 10x mais eficiência de dados com o NanoGPT Slowrun , um benchmark para algoritmos de modelagem de linguagem em um cenário de compute infinito, em poucas semanas. A eficiência de dados é crucial porque o poder computacional cresce muito mais rápido que a disponibilidade de dados . A inteligência será eventualmente limitada pelos dados, e não pelo compute . Este resultado de eficiência de dados permite aos pesquisadores melhorar o desempenho dos modelos escalando com poder computacional em vez de escalar com dados.

A Perplexity lançou o Perplexity Health nos EUA , marcando sua entrada no competitivo mercado de IA para saúde do consumidor. O serviço se diferencia por um hub personalizável e agentes de IA especializados, como assistentes de nutrição e sono. Sua estratégia espelha a de seu segmento financeiro, integrando dados reais de usuários e alavancando a IA para oferecer insights personalizados .