Ana sayfa › Veri setleri
Veri setleri ve benchmark'lar
Töz AI olarak Türkçe için ürettiğimiz eğitim verilerini ve ölçüm araçlarını Hugging Face'te herkese açık yayımlıyoruz. Her birinin lisansı, yapısı ve sınırları kendi sayfasında yazılı.
Eğitim verisi
Veri seti
TR Coding Data
Programlamayı Türkçe anlatan, kod içeren 28 ham metin dokümanı: dil modellerinin ön eğitimi için.
- MIT
- 28 doküman
- ≈ 317 bin token
- v0.2
Veri seti
Töz-1 SFT
Töz-1'i eğitmek için kodla üretilen 12.297 örneklik Türkçe talimat ve sohbet verisi, ayrı ölçüm setleriyle.
- CC BY-SA 4.0
- 12.297 örnek
- 14.316 tur
- JSONL
Benchmark
Lisanslar
| veri seti | lisans |
|---|---|
| TR Coding Data | MIT |
| Töz-1 SFT | CC BY-SA 4.0 |
| Mihenk-3D | CC BY 4.0 |
Lisanslar farklı: Töz-1 SFT, içindeki Vikipedi tanımları yüzünden CC BY-SA 4.0 ile paylaşılıyor. Kullanmadan önce ilgili sayfadaki kaynak notlarına bakın.
Nasıl kullanılır?
from datasets import load_dataset
kod = load_dataset("TozAI/TR-coding-data", split="train")
sft = load_dataset("TozAI/Toz-1-SFT", "sft", split="train")
mihenk = load_dataset("TozAI/mihenk-3d", "tr")