Bloga dön
Remi d'Almeida10 dk okuma

Tek başına çalışan bir geliştirici veya küçük işletme yerel yapay zekâ için M5 Ultra almalı mı?

256 GB M5 Ultra'yı aylık $200–$400'lık bulut yapay zekâyla maliyet, yerel model performansı, eşzamanlılık ve çıkarım egemenliği açısından karşılaştırıyoruz.

256 GB M5 Ultra Mac Studio ile bulut yapay zekâ aboneliklerini karşılaştıran illüstrasyon
256 GB M5 Ultra Mac Studio ile aylık $200–$400 maliyetli öncü bulut yapay zekâ aboneliklerinin karşılaştırması.
Bu sayfada

Apple'ın M5 Ultra'lı yeni Mac Studio'su yerel yapay zekâ için olağanüstü bir makine.

İncelediğimiz yapılandırma şu özelliklere sahip:

  • 36 çekirdekli CPU
  • 80 çekirdekli GPU
  • 32 çekirdekli Neural Engine
  • 256 GB birleşik bellek
  • 1,2 TB/sn bellek bant genişliği
  • 4 TB SSD
  • $12,299 fiyat

Apple, M5 Ultra'yı 512 GB'a kadar birleşik bellekle de sunuyor. Çok büyük birleşik bellek ile 1,2 TB/sn bant genişliğinin bu birlikteliği, geleneksel tüketici GPU'larına sığmayan modelleri yerel olarak çalıştırmayı mümkün kılıyor.

Bu da bariz bir soruyu gündeme getiriyor:

Aylık $200 — çok yoğun kullananlar için belki $400 👀 — bir geliştiriciye öncü bulut yapay zekâ modellerine yeterli erişim sağlarken bir yapay zekâ çıkarım makinesine neden $12,299 harcansın?

Tek başına çalışan bir geliştirici açısından maliyet hesabının oldukça net olduğunu düşünüyorum.

Küçük işletme söz konusu olduğunda hesap daha karmaşık hâle geliyor.

Rakamları inceledikten sonra, bir M5 Ultra satın almak için en ikna edici nedenin nihayetinde maliyet olduğunu düşünmüyorum.

Daha ilginç olan gerekçe çıkarım egemenliği.


Aylık $200'e karşı $12,299

En basit karşılaştırmayla başlayalım.

SüreAylık $200 abonelik
1 yıl$2,400
2 yıl$4,800
3 yıl$7,200
5 yıl$12,000
61,5 ay$12,300

Dolayısıyla bu M5 Ultra'nın satın alma fiyatı, aylık $200'lık bir yapay zekâ aboneliğinin beş yıldan biraz fazlasına denk geliyor.

Eylül 2026 itibarıyla ChatGPT Pro'nun en yüksek kullanım limitine sahip paketi aylık $200 ve Codex'i içeriyor; ayrıca OpenAI'ın gelişmiş model ve araçlarına erişim sağlıyor. Anthropic'in Claude Max 20x planı da aylık $200 ve Claude Code'u içeriyor.

Dolayısıyla $400'lık senaryo tamamen varsayımsal değil: çok yoğun bir kullanıcı her iki hizmete de ödeme yapıp yine de Mac Studio'ya kıyasla başlangıçta çok daha az harcayabilir.

Bu karşılaştırma kusursuz değil.

Mac ikinci el değerinin bir kısmını korur. Başka iş yüklerini de çalıştırabilir. Makineyi satın aldıktan sonra bir milyon token daha işlemek yeni bir API faturası doğurmaz.

Ancak yerel çıkarımın da $12,299'lık satın alma fiyatına yansımayan maliyetleri var:

  • elektrik
  • dağıtım
  • model değerlendirmesi
  • izleme
  • çıkarım çalışma zamanı bakımı
  • yedeklemeler
  • kesinti süreleri
  • mühendislik zamanı

Yalnızca mevcut en güçlü yapay zekâ asistanını isteyen bir geliştirici için bulutu ekonomik açıdan yenmek son derece zor.

Üstelik daha temel bir sorun daha var.


Yerel DeepSeek, yerel GPT-5.6 Sol veya Claude Fable 5 değildir

256 GB birleşik bellek satın almak, en iyi tescilli öncü modellerin yerel bir kopyasını bir anda kullanıma sunmaz.

Bugün bu karşılaştırmaya GPT-5.6 Sol ve Claude Fable 5 gibi modeller dâhil.

OpenAI, GPT-5.6 Sol'u karmaşık profesyonel çalışmalar için amiral gemisi modeli olarak konumlandırıyor; buna kodlama, bilgi çalışmaları, araştırma, bilim, bilgisayar kullanımı ve diğer zorlu görevler dâhil. Anthropic ise Claude Fable 5'i uzun süren, zorlu bilgi ve kodlama çalışmaları için konumlandırıyor.

Bu modellerin ağırlıklarını Mac Studio'nuza indiremezsiniz.

M5 Ultra bunun yerine son derece büyük açık ağırlıklı modelleri çalıştırabilmenizi sağlar.

Bu da hâlâ kayda değer bir özellik.


256 GB gerçekte ne çalıştırabilir?

Ayrıntılı olarak incelediğimiz modellerden biri şu:

DeepSeek-V4-Flash-Vision-Exp UD-Q4_K_XL

GGUF yaklaşık 155 GB büyüklüğünde ve toplamda yaklaşık 305 milyar parametreli bir modele karşılık geliyor. Token başına yaklaşık 13 milyar dil parametresi etkin durumda.

Bu, model dosyasının ötesinde yaklaşık 101 GB brüt fiziksel bellek bırakıyor.

Bu belleğin tamamı gerçekte çıkarım için kullanılabilir değil. macOS, Metal tamponları, çalışma zamanının geçici çalışma alanı, KV önbelleği, görsel işleme ve diğer ayırmalar da belleğe ihtiyaç duyuyor. Önceki Apple Silicon testleri, gerçek çalışma kümesi gereksiniminin GGUF boyutunu fiziksel bellekten çıkarmakla elde edilen değerden önemli ölçüde daha yüksek olabileceğini gösteriyor.

Yine de Apple'ın birleşik bellek mimarisinin gerçekten ilginç hâle geldiği iş yükü tam da bu.

Geleneksel tüketici GPU'larının tek bir kompakt masaüstünde 155 GB'lık bir modeli barındırması mümkün değil.


Gerçekçi bir 64K bağlam kullanalım

Modelin hangi koşullarda çalıştırıldığı bilinmeden saniye başına token değerlerinin bir anlamı yoktur.

2K bağlamlı bir benchmark harika görünebilir ama gerçek bir kodlama, RAG veya ajan tabanlı iş yükünü doğru yansıtmayabilir.

Bu analizde hedef yapılandırma olarak F16 K/V önbelleğiyle 64K bağlamı kullanırdım.

Nasıl bir performans beklemeliyiz?

F16 K/V önbellekli 64K bağlam ve tek etkin üretim için kapasite planlamasında şu anda kabaca şu aralığı öngörüyoruz:

llama.cpp gibi genel amaçlı bir çalışma zamanıyla saniyede 10–20 çıktı token'ı.

DeepSeek'e özel, yüksek düzeyde optimize edilmiş bir çalışma zamanı potansiyel olarak yaklaşık:

saniyede 22–35 çıktı token'ına ulaşabilir.

Ancak ikinci değer bir beklenti değil, iyimser bir senaryo olarak değerlendirilmelidir.

En önemlisi de şu:

Bunlar tahmin; M5 Ultra üzerinde ölçülmüş benchmark sonuçları değil.

Bu Unsloth nicemlemesi çok yeni ve söz konusu modelin yeni M5 Ultra üzerinde henüz tekrarlanabilir bir benchmark'ı yok. Tahminlerde mevcut Apple Silicon sonuçları ve M5 Ultra'nın daha yüksek bellek bant genişliği referans olarak kullanılıyor.

Birisi tam olarak bu modeli tam olarak bu makinede çalıştırıp tekrarlanabilir sonuçlar yayımlayana kadar bu ayrım önemini koruyor.


Yerel DeepSeek ve öncü bulut modelleri

M5 Ultra'nın avantajı kesinlikle çıkarımda hiper ölçekli bir bulut sağlayıcısını geride bırakabilmesi değil.

Bunu yapamaz.

Tek fark ham hız da değil.

Yerel DeepSeek nicemlemesinin şu konularda hâlâ doğrulanması gerekiyor:

  • kodlama kalitesi
  • ajanların araç çağırma başarısı
  • uzun bağlam güvenilirliği
  • görsel işleme
  • çok dilli performans
  • tekrarlama ve özel token sorunları

Yerel bir modelin kullanılacak kadar büyük ve hızlı olması, onu otomatik olarak GPT-5.6 Sol veya Claude Fable 5 ile eş değer yapmaz.


Model yalnızca bir katmandır

DeepSeek ile GPT-5.6 Sol veya Claude Fable 5 bir model karşılaştırmasıdır.

Yerel çıkarım ile bir kodlama ürünü ise sistem karşılaştırmasıdır.

Araçlar, kod yürütme, bağlam yönetimi ve depo etkileşimi özünde bulut çıkarımı gerektirmez. Native bir çalışma alanı veya ajan çalışma ortamı bunları yerel olarak sağlayabilir; modeli, bağlamı ve araç yürütmesini denetlediğiniz altyapıda tutabilir.

Bulut ürünleri bu sistemi barındırılan bir hizmet olarak sunar. Yerel öncelikli bir ürün ise aynı ürün katmanını farklı bir mimariyle sağlayabilir: çıkarım, dosyalar, bağlam ve araçlar üzerinde denetim sağlamak için tasarlanmış bir mimariyle.

Aitopus'un yönü de bu: yerel ve bulut modellerini tek bir native çalışma alanında buluştururken her isteğin izlediği yolu ve her modelle paylaşılan bağlamı açıkça göstermek.


Eşzamanlılık ne durumda?

Bu, küçük işletmeler açısından en önemli kısıtlamalardan biri.

155 GB'lık modelin her çalışan için ayrı ayrı yüklenmesi gerekmez. Birden fazla oturum, aynı çıkarım sunucusundaki bellekte yerleşik ağırlıkları paylaşabilir.

Ancak yine aynı GPU ve 1,2 TB/sn bellek alt sistemi için rekabet ederler.

Daha küçük bağlam boyutlarında, doğrulama sonrasında iki eşzamanlı üretim makul olabilir.

Fakat bu makaledeki varsayımımız 64K.

İki eşzamanlı kullanıcıya 64K bağlamın tamamını ayırmak, fiilen yaklaşık 128K toplam bağlam kapasitesi sağlamak anlamına gelir.

256 GB'lık makine için bu çok daha zorlayıcıdır.

Analizimiz 128K'yı zaten operasyonel açıdan riskli olarak sınıflandırıyor. Önceki DeepSeek çalışma zamanlarında da bağlama bağlı, beklenmedik ölçüde büyük geçici bellek ayırmaları görüldü.

Bu nedenle ciddi bir 64K dağıtımında, 256 GB M5 Ultra'yı başlangıçta şöyle değerlendirirdim:

Aynı anda tek bir üretim çalıştıran ve diğer istekleri kuyruğa alan güçlü bir çıkarım sunucusu. Tam bağlamda eşzamanlı kullanım ise varsayılmamalı, test edilmelidir.

Bu, yirmi geliştiriciye bulut yapay zekâ erişimi verip hepsinin bağımsız çalışmasına izin vermekten çok farklı bir öneri.


Bu, yalnızca bir çalışanın kullanabileceği anlamına mı geliyor?

Hayır.

Eşzamanlılık ile kullanıcı sayısı aynı şey değildir.

Bir çalışan prompt gönderir, yanıtı bekler, okur, bir şeyler yazar, sonra geri dönüp başka bir soru sorar.

Çoğu kullanıcı sürekli token üretmez.

Dolayısıyla yerel bir çıkarım ağ geçidi, aynı anda yalnızca bir veya birkaç isteği çalıştırırken kimliği doğrulanmış çok sayıda kullanıcıya sahip olabilir.

Böylece tek bir M5 Ultra küçük bir kurum içi ekip için faydalı olabilir.

64K'da kod çözme daha yavaştır, uzun prompt'ları işlemek daha fazla zaman alır ve çok kullanıcılı bağlam ayırma daha zahmetlidir.

Bu nedenle tam olarak bu model ve donanım yük testinden geçirilmeden sabit bir çalışan sayısı tahmini yanıltıcı olur.

Kuyruklu, çok kullanıcılı çıkarım makul bir ihtimaldir; ancak sistemin pratikte kaç kullanıcıya sorunsuz hizmet verebileceği prompt uzunluğuna, yanıt uzunluğuna, istek sıklığına ve kullanıcıların kısa sorgular mı yoksa uzun süre çalışan kodlama ajanları mı kullandığına büyük ölçüde bağlıdır.


Kodlama ajanları denklemi yeniden değiştiriyor

Kısa sorular ile özerk kodlama ajanları birbirinden tamamen farklı iş yükleridir.

Normal bir kurum içi sorgu birkaç yüz token üretebilir.

Bir kodlama ajanı şunları yapabilir:

  1. bir depoyu inceleyebilir,
  2. binlerce muhakeme token'ı üretebilir,
  3. araç çağırabilir,
  4. sonuçları okuyabilir,
  5. genişletilmiş bağlamı yeniden gönderebilir,
  6. kodu değiştirebilir,
  7. testleri çalıştırabilir,
  8. yeniden muhakeme edebilir.

Tek bir ajan, çıkarım kapasitesini dakikalarca meşgul edebilir.

Analizimizdeki daha iyimser 32K varsayımlarında bile özerk kodlama iş yükleri için önerimiz sürekli etkin tek bir ajanla başlamak ve ancak dikkatli testlerden sonra ikinci bir ajanı değerlendirmekti.

64K'da bu temkinli yaklaşım daha da yerinde olur.

Dolayısıyla planınız şuysa:

“Bir M5 Ultra alıp on geliştiricinin Claude Code veya Codex kullanımını eşzamanlı çalışan on yerel kodlama ajanıyla değiştireceğim.”

bu varsayımla hareket etmezdim.

Henüz değil.


Peki M5 Ultra daha mı ucuz?

Tek başına çalışan bir geliştirici için mi?

Muhtemelen hayır.

Amacınız yalnızca mümkün olan en güçlü kodlama ve muhakeme asistanına sahip olmaksa aylık $200'lık öncü bir bulut hizmeti olağanüstü rekabetçi.

Beş yıl boyunca her ay $200 ödemek bu Mac Studio'nun satın alma fiyatına ancak ulaşıyor.

Aylık $400'da — örneğin hem ChatGPT Pro'yu hem de Claude Max 20x'i kullanmaya devam ederseniz — aynı $12,299 yaklaşık 31 aylık aboneliğe karşılık geliyor.

Bu süre içinde bulut modelleri de defalarca değişecektir.

Bugün satın aldığınız M5 Ultra, birkaç yıl sonra da aynı 80 GPU çekirdeğine ve 1,2 TB/sn bellek bant genişliğine sahip olacak.

Aboneliğiniz ise muhtemelen size hâlâ aynı modeli sunuyor olmayacak.


Küçük işletme için hesap daha karmaşık

Paylaşılan donanım maliyet hesabını değiştirir.

Birden fazla çalışana hizmet veren $12,299'lık tek bir makine ile her çalışan için ayrı makine satın almak elbette aynı şey değildir.

Makine satın alındıktan sonra yerel çıkarımın marjinal token maliyeti de fiilen sıfırdır.

İş yükü öngörülebilir ve kullanım yoğunsa donanım zaman içinde ekonomik açıdan cazip hâle gelebilir.

Ancak bu hesap, $200'lık bireysel abonelik sayısını basitçe çarpmak yerine gerçek kurumsal abonelik planları ve API harcamalarıyla karşılaştırılmalıdır.

Kurumsal bulut planlarının kullanıcı başına maliyeti $200'ın çok altında olabilir; ancak kullanım hakları ve model erişimleri farklıdır.

Bu nedenle işletmeler için bile şununla başlamazdım:

“Tasarruf etmek için M5 Ultra alacağız.”

Başka bir neden olmalı.

Ve bence böyle bir neden var.


Yerel çıkarımın en güçlü gerekçesi egemenliktir

Gizlilik bunun bir parçası.

Ancak egemenlik gizlilikten daha kapsamlıdır.

DeepSeek Mac Studio'nuzda çalışıyorsa çıkarım denetlediğiniz altyapıda gerçekleşir.

Kaynak kodunuzun ağınızdan çıkması gerekmez.

Kurum içi belgelerinizin ağınızdan çıkması gerekmez.

Prompt'larınızın harici bir çıkarım sağlayıcısına gönderilmesi gerekmez.

Model sürümünü siz denetlersiniz.

Nicemlemeyi siz denetlersiniz.

Çalışma zamanını siz denetlersiniz.

Bağlam sınırlarını siz denetlersiniz.

Ne zaman yükselteceğinize siz karar verirsiniz.

Bir bulut sağlayıcısı modeli makinenizden kaldıramaz.

Sağlayıcı kesintisi yerel çıkarımı durdurmaz.

API fiyatlarındaki değişiklik marjinal çıkarım maliyetinizi değiştirmez.

Uygulamanız elveriyorsa çıkarım ortamının tamamı internet erişimi olmadan çalışabilir.

Bu, gizlilikten fazlasıdır.

Bu, altyapınızın çıkarım katmanı üzerindeki denetimdir.


Bir tane almalı mısınız?

Tek başına çalışan ve en iyi yapay zekâ kodlama asistanını arayan geliştirici

Muhtemelen hayır.

Aylık $200'lık öncü bir bulut hizmeti aboneliği şu anda çok daha avantajlı.

GPT-5.6 Sol veya Claude Fable 5 gibi tescilli öncü modellere ve Codex ya da Claude Code gibi gelişmiş ortamlara erişim elde edersiniz.

Çıkarım altyapısının bakımını kendiniz yapmazsınız.

Üstelik modeller gelişmeye devam eder.

Öncelikle maliyeti optimize eden küçük işletme

Belki, ancak gerçek kullanım ölçüldükten sonra.

Paylaşılan yerel çıkarım ekonomiyi değiştirebilir; ancak gerçekçi bir 64K bağlamda çalışan tek bir 256 GB M5 Ultra, yüksek eşzamanlılığa sahip çıkarım sunucusu olarak görülmemelidir.

Önce iş yükünü ölçün.

Hassas veya stratejik açıdan önemli verileri işleyen işletme

İşte bu noktada M5 Ultra çok daha ilginç hâle geliyor.

Gereksiniminiz şuysa:

Kaynak kodumuz, belgelerimiz veya müşteri verilerimiz, denetlediğimiz altyapının dışına çıkmadan yapay zekâ tarafından işlenebilmeli.

$12,299 ile aylık $200'ı karşılaştırmak asıl meselenin büyük bölümünü gözden kaçırır.

Bulut aboneliğinin temelde aynı şekilde sunmadığı bir yeteneği satın alıyorsunuz.


Asıl mesele maliyet olmayabilir

M5 Ultra etkileyici bir yerel yapay zekâ makinesi.

Yaklaşık 305 milyar parametreli bir modeli yükleyebilen ve F16 K/V önbellekli 64K bağlamda makul olarak saniyede yaklaşık 10–20 çıktı token'ı üretebilen 256 GB'lık bir masaüstü, yalnızca birkaç yıl önce olağanüstü gelirdi.

Ancak bu, onu otomatik olarak buluttan daha iyi bir seçenek yapmaz.

Tek başına çalışan bir geliştirici için muhtemelen öyle değildir.

Küçük işletme için ekonomi, kullanım oranına ve iş yüküne bağlıdır.

Ancak $12,299'a başka bir açıdan da bakabiliriz.

Bulut yapay zekâda zekâ, hizmet olarak satın alınır.

Yerel yapay zekâda çıkarım üzerinde denetim satın alınır.

Tek başına çalışan bir geliştirici için ilki genellikle harcanan para karşılığında daha fazla yetenek sunar.

Çıkarım egemenliğine değer veren bir kuruluş için donanıma sahip olmanın tek nedeni ikincisi olabilir.


Yöntem ve önemli notlar

Bu makaledeki performans değerleri kapasite planlamasına yönelik tahminlerdir; M5 Ultra üzerinde ölçülmüş benchmark sonuçları değildir. Bu değerler unsloth/DeepSeek-V4-Flash-Vision-Exp-GGUF:UD-Q4_K_XL modeline, mevcut Apple Silicon referans ölçümlerine, güncel çalışma zamanı davranışına ve M5 Ultra'nın yayımlanan donanım özelliklerine dayanır.

64K tahmini özellikle şu varsayımları içerir:

  • tek etkin üretim
  • yapılandırılmış 64K bağlam
  • F16 K/V önbelleği
  • temkinli aralık için llama.cpp sınıfında genel amaçlı bir çalışma zamanı
  • macOS swap kullanılmaması

Performans, bellek kullanımı ve güvenilirlik; çalışma zamanı sürümüne, prompt uzunluğuna, görsel girdiye, eşzamanlılığa, nicemlemeye ve model güncellemelerine bağlı olarak önemli ölçüde değişebilir.

DeepSeek-V4-Flash-Vision-Exp kontrol noktası açıkça deneysel niteliktedir ve bu özel nicemleme yukarıda ele alınan tüm iş yükleri için henüz bağımsız olarak doğrulanmamıştır.