Thread

Ontem a Apple anunciou os novos Mac Studio, com M5 Max e M5 Ultra. Com o Mac Pro descontinuado, esse é oficialmente o computador mais potente que a Apple vende. Ao que tudo indica, eles estão querendo fazercom que rodar modelo de IA na sua própria máquina deixe de ser gambiarra de hobbista. Código que não pode sair da empresa, dado de cliente, custo por token que some, trabalhar offline: cada vez mais gente tem motivo pra querer o modelo local. E o número que aparece de verdade, é a banda de memória: 1,2 TB/s, contra 819 GB/s da geração anterior. Inferência de LLM é um problema de memória. Pra gerar cada token, o modelo inteiro precisa passar pela memória e osso dá um teto teórico bem simples: tokens/s = banda de memória ÷ tamanho do modelo Na prática, com 1,2 TB/s: • modelo de 70B em 4-bit, ~40GB: teto de ~30 tokens/s • modelo de 235B em 4-bit, ~130GB: teto de ~9 tokens/s • modelo de 400B+ em 4-bit passa de 200GB Cabe porque a Apple vai vender uma configuração com 512GB de memória unificada, chegando em Outubro. Preço ainda não anunciado, o que já diz bastante kkkk Compare com GPU discreta: uma H100 tem banda maior, mas 80GB de VRAM. Pra rodar um modelo de 200GB você precisa de três placas, NVLink, fonte parruda e refrigeração. O Mac Studio faz isso numa caixa de 20cm embaixo do monitor. O preço dessa brincadeira: US$ 2.499 no M5 Max e US$ 5.499 no M5 Ultra, sendo que o M3 Ultra saiu por US$ 3.999 no ano passado. A crise de RAM está cobrando o pedágio. 🥲 Acho que se eu tiver um computador desse, provavelmente nunca compraria outra máquina na vida (ou não),

Nenhum Voo ainda