Voltar
FIG. 01Where generality and specialization sit in the two inference stacks. MLX-LM describes the model as composable MLX array operations, which MLX schedules through reusable kernels. Lily instead places the model structure, phase-specific execution plans, and kernel selection in a single Rust runtime built around Qwen and Apple silicon.

Apple Impulsiona IA On-Device com Novo Motor Lily para LLMs em Apple Silicon

Aprofundamento CEVIU

Aprofundamento

A Apple deu um passo importante para a inteligência artificial embarcada com o lançamento do motor Lily, uma solução projetada para otimizar a execução de Large Language Models (LLMs) diretamente nos dispositivos com Apple Silicon. Este avanço aproveita a arquitetura de memória unificada e o hardware especializado da Apple, como o Neural Engine dos chips M5 Max, para acelerar o processamento de forma significativa. O Lily foi desenvolvido especificamente para o modelo Qwen3.6-35B-A3B, que usa roteamento MoE esparso e camadas Gated DeltaNet, mostrando a capacidade da Apple de alinhar software e hardware para performance.

A principal inovação do Lily está em sua especialização. Enquanto a biblioteca MLX-LM, do projeto ml-explore, oferece uma abordagem mais genérica para executar LLMs no Apple Silicon, o Lily foca em otimizações aprofundadas para um modelo específico. Isso inclui o uso de kernels Metal customizados e um runtime em Rust para gerenciar o processo de inferência, bypassando frameworks como PyTorch e MLX na execução. O resultado é uma performance superior em throughput de prefill e decode, essenciais para uma experiência fluida com IA local. A iniciativa mostra a estratégia da Apple de maximizar a IA on-device, tema recorrente em nossa cobertura, como nos artigos sobre os novos Macs e chips M5 e M6.

O que mudou

Até agora, a execução de LLMs em Apple Silicon frequentemente utilizava frameworks de propósito geral como o MLX-LM, um componente do pacote ml-explore para o framework MLX. A introdução do Lily, por sua vez, representa uma evolução clara para otimizações específicas de modelo. O Lily não é um substituto geral, mas uma solução hiper-otimizada para o Qwen3.6-35B-A3B, superando o MLX-LM em até 1,35x no throughput de decode e 1,23x no prefill. Isso demonstra uma transição de soluções mais abrangentes para engines personalizadas, extraindo o máximo do hardware.

Essa especialização se alinha a uma tendência de otimização detalhada para a família Qwen, como já vimos na cobertura do CEVIU News em agosto de 2026, quando a OrcaRouter otimizou o Qwen3.8-27B-Uncensored para Apple Silicon. O Lily leva isso um passo além, com uma engine nativa da Apple que se integra ainda mais profundamente ao hardware, focando em eficiência energética e de memória, algo vital para a inferência on-device que a Apple tem priorizado com seus chips M5 e M6, conforme noticiamos em março e agosto de 2026.

Por que isso importa

A introdução do motor Lily e suas otimizações para o Qwen3.6-35B-A3B é um marco para a estratégia de IA on-device da Apple. Ela valida o investimento contínuo da empresa em chips Apple Silicon, como os M5 e M6, projetados para entregar performance robusta para cargas de trabalho de IA. Uma inferência de LLM mais rápida e eficiente localmente significa maior privacidade, menor latência e a capacidade de usar recursos de IA mesmo sem conexão com a internet, melhorando a experiência do usuário.

Para desenvolvedores, a promessa de que o Lily será open-source significa mais ferramentas para criar aplicações de IA poderosas e responsivas nos dispositivos da Apple. A superação do MLX-LM em performance, mesmo que para um modelo específico, estabelece um novo padrão para o que é possível com a IA on-device, incentivando otimizações ainda mais profundas e a exploração de novas arquiteturas de modelos que se beneficiem desse tipo de engenharia de software e hardware combinada.

Repositório oficial: ml-explore/mlx-lm

Linha do tempo

  1. Apple Apresenta MacBook Pro com Inovadores Chips M5 Pro e M5 Max

  2. OrcaRouter Otimiza Modelo de IA Qwen3.8-27B-Uncensored para Apple Silicon

  3. Comunidade Apple Silicon Detalha Otimização de Inferência de IA

  4. Apple impulsiona inferência de IA local com novos Mac Studio e Mac mini

  5. Apple eleva poder de processamento com chips M6 e M5 Ultra focados em IA local

  6. Apple Lança Chips M6 e M5 Ultra: Um Salto Revolucionário em Performance e Capacidade de IA

  7. Apple Impulsiona IA On-Device com Novo Motor Lily para LLMs em Apple Silicon

Perguntas frequentes

O que é o motor Lily da Apple?

Lily é um novo motor de inferência local desenvolvido pela Apple para otimizar a execução de Large Language Models (LLMs) em dispositivos equipados com Apple Silicon. Ele foi criado especificamente para o modelo Qwen3.6-35B-A3B, aproveitando ao máximo a arquitetura de hardware da empresa para maior velocidade e eficiência.

Como o Lily se compara ao MLX-LM?

O Lily demonstrou ser mais eficiente que o MLX-LM, uma biblioteca do projeto ml-explore, especialmente em throughput de prefill e decode. Enquanto o MLX-LM é uma solução mais geral para LLMs no Apple Silicon, o Lily é uma engine customizada e especializada para o modelo Qwen3.6-35B-A3B, o que lhe permite extrair performance superior.

Quais são os principais avanços técnicos do Lily?

O Lily utiliza kernels Metal customizados e um runtime em Rust para gerenciar a inferência, evitando o uso de frameworks mais amplos como PyTorch e MLX durante a execução. Ele implementa otimizações específicas para o modelo Qwen3.6-35B-A3B, como o reuso de pesos, a manutenção do roteamento de experts na GPU e o gerenciamento eficiente da memória unificada do Apple Silicon.

Por que a Apple está focando em IA on-device?

O foco da Apple em IA on-device, com chips como M5 e M6 e engines como o Lily, visa proporcionar benefícios como maior privacidade, visto que os dados não saem do aparelho. Além disso, garante menor latência nas respostas da IA e permite o funcionamento de recursos inteligentes mesmo sem conexão com a internet, melhorando a experiência do usuário.

Fontes

Avalie este artigo:
Categoria
CEVIU IA
Publicado
02 de setembro de 2026
Editoria
CEVIU IA

Quer receber mais sobre CEVIU IA?

Conteúdo curado diariamente, direto no seu e-mail.

Conteúdo curado diariamenteDiversas categoriasCancele quando quiser