Ana sayfa › Veri setleri

Veri setleri ve benchmark'lar

Töz AI olarak Türkçe için ürettiğimiz eğitim verilerini ve ölçüm araçlarını Hugging Face'te herkese açık yayımlıyoruz. Her birinin lisansı, yapısı ve sınırları kendi sayfasında yazılı.

Eğitim verisi

Benchmark

Lisanslar

veri setilisans
TR Coding DataMIT
Töz-1 SFTCC BY-SA 4.0
Mihenk-3DCC BY 4.0

Lisanslar farklı: Töz-1 SFT, içindeki Vikipedi tanımları yüzünden CC BY-SA 4.0 ile paylaşılıyor. Kullanmadan önce ilgili sayfadaki kaynak notlarına bakın.

Nasıl kullanılır?

from datasets import load_dataset

kod = load_dataset("TozAI/TR-coding-data", split="train")
sft = load_dataset("TozAI/Toz-1-SFT", "sft", split="train")
mihenk = load_dataset("TozAI/mihenk-3d", "tr")