Yapay zekayı sunucuda mı, tarayıcıda mı çalıştırmalı? Ücretsiz sunucu planında ölçtük
4 Ekim 2026 · 2 dk okuma · Töz AI
Töz-1'i neden bir API arkasında değil, ziyaretçinin tarayıcısında çalıştırıyoruz? Karar varsayıma değil ölçüme dayandı: ücretsiz bir sunucu planında deneyip sonuçları yazdık.
Soru
Bir dil modelini kullanıcıya sunmanın klasik yolu sunucudur: model orada çalışır, kullanıcı bir API'ye istek atar. Bunun maliyeti var (sunucu, GPU, ölçekleme) ve bir bedeli var (yazdığınız her şey sunucuya gider). Küçük bir model ise tarayıcıya sığabilir. Hangisi daha iyi? Tahmin yürütmek yerine ölçtük.
Sunucu denemesi
Hedef, ücretsiz bir bulut planıydı (Render ücretsiz web servisi). Kutunun gerçekte ne verdiğini kendi içinden okuduk:
| İşlemci | AMD EPYC 7R13 |
|---|---|
| CPU kotası (cgroup) | 0,15 çekirdek (8 çekirdek görünüyor, kota bir çekirdeğin yüzde 15'i) |
| Bellek sınırı | ≈ 536 MB (planda "512 MB") |
| Uyku | 15 dk boşta kalınca uyur; uyanması panelin kendi uyarısına göre "50 saniye ya da daha fazla" |
O sırada Töz-1'in ONNX sürümü henüz yoktu; boyutça en yakın hazır modeli kullandık: SmolLM2-135M, 8-bit, 137 MB. ONNX Runtime ile, tek iş parçacığı, KV önbellekli, gerçek bir üretim döngüsü:
- İlk istem (16 token) işlemesi: yaklaşık 1 saniye
- Token başına yaklaşık 605 ms → 1,65 token/sn
- Bu hızı Töz-1'in boyutuna (≈198 MB) ölçekleyince yaklaşık 1,14 token/sn; 128 tokenlık bir cevap kabaca 112 saniye
Bellek de ayrı bir sorundu. İlk dağıtım, tek bir istek görmeden Out of memory (used over 512Mi) ile öldürüldü. ONNX Runtime'ın bellek arena'sını kapatınca açıldı, tepe kullanım 375 MB'a indi; ama bu yalnızca 32 tokenlık bağlamla ve 137 MB'lık modelle. Töz-1'in 1024 tokenlık bağlamında yalnızca KV önbelleği fp32'de yaklaşık 113 MB tutar (18 katman × 2 × 768 × 1024 × 4 bayt). Yani sığmıyor, ve ikinci bir kullanıcıya yer yok.
Tarayıcı
Aynı model, ziyaretçinin tarayıcısında: Töz-1'in 8-bit ONNX sürümü (298 MB), ONNX Runtime Web üzerinden WebAssembly ile ayrı bir iş parçacığında. Ölçtüğümüz cihaz güçlü değil: 2 çekirdekli, eski bir Intel Mac.
- 80 token yaklaşık 4 saniyede üretildi → yaklaşık 13 token/sn
- Aynı makinede WebGPU yolu yaklaşık 2 token/sn kaldı: tümleşik bir Intel GPU'sunda WebGPU her zaman WebAssembly'den hızlı değil
Çok iş parçacıklı WebAssembly için sayfanın SharedArrayBuffer kullanabilmesi gerekir; bu da COOP/COEP başlıklarına bağlı. Bunun giriş akışıyla nasıl çakıştığı ayrı bir hikâye, ama hız farkının kaynağı bu.
Karşılaştırma
| Ücretsiz sunucu | Tarayıcı | |
| Hız | ≈ 1,1 token/sn (ölçekli tahmin) | ≈ 13 token/sn (ölçüm) |
| Eşzamanlı kullanıcı | 1 (bellek yetmiyor) | Sınırsız: herkes kendi işlemcisini getirir |
| Soğuk başlangıç | 50 sn ve üstü | Yok |
| Mesaj içeriği | Sunucuya gider | Cihazdan çıkmaz |
| Bizim maliyetimiz | Sunucu kiralama | Yalnızca statik dosya barındırma |
Bedeli ne?
Dürüst olalım, tarayıcı yolunun bedeli var: ilk açılışta 298 MB iner (Hugging Face'in CDN'inden; barındırma sağlayıcımızın bant genişliğinden değil), sonra tarayıcı önbelleğinde kalır. Mobil veride bu yük. Zayıf bir cihazda üretim yavaşlar. Bu yüzden sitede model inmeden önce boyutu yazıp onay istiyoruz.
Ölçümün sınırları
- Sunucu sayısı ölçekli bir tahmin: ölçülen model SmolLM2-135M'di, Töz-1 değil.
- Tek makine, tek tarayıcı. Farklı cihazlarda sonuç değişir.
- Ücretli, daha güçlü bir sunucu bu tabloyu değiştirir. Doğrusal ölçekleme varsayımıyla tam bir çekirdek bile yalnızca 7-8 token/sn eder; yine de GPU'suz bir sunucu için pek umutlu bir rakam değil.
Sonuç: siteyi tamamen statik dosya olarak yayımlıyoruz; çıkarım ziyaretçinin cihazında. Modelin kendisi için Töz-1 nedir yazısına bakabilirsiniz.
Töz-1'i tarayıcınızda deneyin: kurulum yok, sunucu yok.
Töz-1'i deneDiğer yazılar
Töz-1 nedir?
Töz-1'in mimarisi, eğitimi ve sınırları: 4,42 milyar token Türkçe metinle sıfırdan eğitilmiş, tarayıcıda çalışan 195 milyon parametreli bir dil modeli.
4 Ekim 2026fp16 neden bozdu?
ONNX'e çevirdiğimiz Türkçe modelimiz tarayıcıda fp16 ile saçmalıyordu. Sebep: aktivasyonlar 1330'a çıkıyor, karesi fp16 sınırını aşıyor.
4 Ekim 2026