Töz-1 nedir? Sıfırdan eğitilmiş 195 milyon parametreli Türkçe dil modeli
4 Ekim 2026 · 3 dk okuma · Töz AI
Töz-1, Töz AI'ın tokenizer'dan ağırlıklara kadar kendi eğittiği ilk Türkçe dil modeli: 195 milyon parametre, yalnızca Türkçe, Apache-2.0 lisanslı ve bir tarayıcı sekmesinde çalışacak kadar küçük.
Kısaca Töz-1
Töz-1 bir küçük dil modeli (SLM): sohbet edebilen, kısa ve sade Türkçe cevaplar veren, ama bilgi dağarcığı bilinçli olarak sınırlı bir model. Bu yazıdaki bilgilerin kaynağı Hugging Face'teki model kartı; orada olmayan hiçbir sayıyı burada vermiyoruz.
İki sürüm var: ham ön eğitim modeli Töz-1-Base ve onun sohbet için ince ayar yapılmış hâli olan Töz-1. Sitedeki sohbet, Töz-1'in v2 sürümünü kullanır.
Mimari
| Parametre | 195 milyon (bağlı embedding) |
|---|---|
| Katman / genişlik / kafa | 18 / 768 / 12 |
| FFN | SwiGLU, 3072 |
| Konum | RoPE (θ = 10.000), 1024 token bağlam |
| Normalizasyon | RMSNorm (pre-norm) + QK-norm |
| Sözlük | 32.768 token, Türkçe için eğitilmiş byte-level BPE |
Mimari Hugging Face'teki Qwen3 sınıfıyla birebir uyumlu olduğu için model o sınıfla kaydedildi. Bu, modelin Qwen'den türetildiği anlamına gelmez: model kartına göre ağırlıklar tamamen sıfırdan eğitildi. Uyumluluğun pratik faydası şu: transformers.js gibi araçlar modeli ek kod yazmadan çalıştırabiliyor ve tarayıcıdaki sürüm bu sayede mümkün oldu.
Ön eğitim
- 5,68 milyar tokenlık Türkçe korpus: 4,96 milyar web metni + 0,72 milyar Vikipedi
- 30.000 adım × 147.456 token = 4,42 milyar token (parametre başına yaklaşık 23 token)
- WSD öğrenme oranı: tepe 4e-4, 800 adım ısınma, 24.000. adımdan sonra düşüş; son %15'te Vikipedi oranı %8'den %35'e çıkarıldı
- AdamW, weight decay 0,1, z-loss, fp16 karışık hassasiyet
- Donanım: Kaggle'da 2 × Tesla T4 ve tek bir RTX 3060 Ti (8 GB)
Parametre başına ~23 token, kabaca "parametre başına 20 token" diye bilinen Chinchilla oranının civarında: yani model bilinçli olarak az parametre ama bu parametre sayısına yetecek veri dengesinde eğitildi.
Sohbet eğitimi (SFT)
Ham model metni devam ettirir, soruya cevap vermez. Sohbet etmesi için ikinci bir aşama var: denetimli ince ayar (SFT). Kayıp yalnızca cevap tokenları üzerinde hesaplanır; model şu biçimi öğrenir:
Kullanıcı: {soru}
Töz: {cevap}<|endoftext|>Kullanıcı: {soru}
Töz:
Bir tasarım kararı: Vikipedi tanımları SFT'ye alınmadan önce ham modele okutuldu ve yalnızca modelin zaten bildiği varlıklar seçildi. Gerekçe model kartında şöyle: bilmediği bilgiyi SFT'de öğretmek, uydurmayı öğretir.
v1'den v2'ye: neden yeniden eğittik?
v1 (27 Eylül 2026) kodla ürettiğimiz dar kalıplarla eğitilmişti ve tanımadığı soru türlerini en yakın kalıba zorluyordu. Model kartındaki örnekler: "Valorant oynayayım mı?" sorusuna "Hayır, adım Töz-1", "Matematik kursu almalı mıyım?" sorusuna "Sadece tek basamaklı işlemler yapabiliyorum" diyordu. Tavsiye, fikir ve gündelik sorular veride neredeyse yoktu; "ben … miyim" (kullanıcı kendini soruyor) ile "sen … misin" (modelin yeteneği soruluyor) ayrımı da öğrenilmemişti.
v2 (Ekim 2026) bu boşluğu gerçek sohbet örnekleriyle kapatmayı hedefliyor: SFT'ye yaklaşık 9.000 filtrelenmiş Türkçe sohbet örneği eklendi, matematik örnekleri 1.000 azaltıldı. Kod, başka model kimlikleri ("ChatGPT", "OpenAI" gibi), İngilizce ağırlıklı metin ve çok uzun cevaplar elendi. Ön eğitim değişmediği için bilgi düzeyi aynı; değişen, davranış.
Ne yapabilir?
- Gündelik sohbet, selamlaşma, kendini tanıtma ("Sen kimsin?")
- Yaygın bilgi soruları: başkentler, kıtalar, Türkiye'nin illeri ve bölgeleri, bilinen kişi ve kavramların kısa tanımı
- Takip soruları: "Fransa'nın başkenti neresi?" → "Peki orada hangi dil konuşulur?"
- Tek basamaklı toplama, çıkarma, çarpma; daha büyük hesaplarda yapamadığını söyler
- Basit biçim talimatları: tek kelimeyle cevap, iki cümle
Sınırları
- Bilgi hataları yapar ve bunu kendinden emin söyler. Önemli bir bilgiyi bu modelden öğrenmeyin.
- 195 milyon parametre ve 4,4 milyar token dünya bilgisi için az: az bilinen kişi, yer ve olaylarda uydurur.
- Büyük harfle yazması istendiğinde bozulabilir; liste uzunluğu ve çok adımlı talimatlarda zayıf.
- Yalnızca Türkçe; yalnızca tek basamaklı aritmetik.
- Ayrı bir güvenlik eğitimi almadı; web verisinden gelen önyargıları taşıyabilir.
Ölçümler
Dilbilgisi testi TurBLiMP'te (0-shot, 16 konu × 1.000 cümle çifti; şans düzeyi %50) Töz-1-Base %93,2, Töz-1 v1 %91,2 aldı. Aynı scriptle ölçülen, 13,5 milyar token görmüş 151 milyon parametreli ufakzeka-1-base %92,0. Dilbilgisi az veriyle doyan bir yetenek; dünya bilgisi gerektiren testlerde daha çok token gören modellerin önde olması beklenir.
Turkish MMLU'da (6.200 sınav sorusu, 5 şık, şans %20) sonuçlar şansın biraz üstünde: Töz-1-Base %25,0, v1 %24,1. 195 milyon parametrelik bir model için KPSS, TUS ve ALES tarzı sorular çok zor. v2'nin ölçümleri henüz model kartına işlenmedi, bu yüzden burada v2 için bir benchmark sayısı vermiyoruz.
Nerede bulunur?
Ağırlıklar Apache-2.0 lisansıyla huggingface.co/TozAI/Toz-1 adresinde. Tarayıcı sürümünün nasıl çalıştığı için sunucu ya da tarayıcı yazımıza bakın.
Töz-1'i tarayıcınızda deneyin: kurulum yok, sunucu yok.
Töz-1'i deneDiğer yazılar
Sunucuda mı, tarayıcıda mı?
Küçük bir dil modelini ücretsiz bir bulut sunucusunda ve tarayıcıda çalıştırıp ölçtük: sunucuda yaklaşık 1,1 token/sn, tarayıcıda yaklaşık 13 token/sn.
4 Ekim 2026fp16 neden bozdu?
ONNX'e çevirdiğimiz Türkçe modelimiz tarayıcıda fp16 ile saçmalıyordu. Sebep: aktivasyonlar 1330'a çıkıyor, karesi fp16 sınırını aşıyor.
4 Ekim 2026