Ana sayfa › Veri setleri › TR Coding Data
TR Coding Data
- Veri seti
- MIT
- 28 doküman
- ≈ 317 bin token
- v0.2
Programlamayı Türkçe anlatan ve kod içeren ham metin dokümanları. Her satır tek başına bir doküman: rehber, proje anlatımı, hata ayıklama oturumu gibi. Dil modellerinin ön eğitimi ve mid-training aşaması için hazırlandı.
Bir bakışta
| Sürüm | v0.2 |
|---|---|
| Lisans | MIT |
| Dil | Türkçe anlatım; kod örnekleri farklı programlama dillerinde |
| Doküman | 28 |
| Token | 317.427 (Qwen/Qwen3-0.6B tokenizer'ı ile sayıldı) |
| Görev | text-generation (ön eğitim / mid-training) |
| Biçim | Parquet, tek bölüm (train) |
Nasıl üretildi?
Dokümanlar yapay zeka modelleri (Qwen, GLM, Claude, ChatGPT, Gemini) yardımıyla üretildi, sonra elle gözden geçirilip düzenlendi: sohbet ifadeleri (hitaplar, "Tamam" ve "Harika" gibi açılışlar) ve arama atıf işaretleri temizlendi. Kodların tamamı çalıştırılarak doğrulanmadı; kullanmadan önce kendi kontrollerinizi yapmanız önerilir.
Kolonlar
id | Doküman kimliği |
|---|---|
konu | Konu |
ana_dil | Baskın programlama dili |
diller | Dokümanda geçen tüm diller |
etiketler | Serbest etiketler |
lang | Doğal dil (FineWeb-2 kodu) |
token_count | Token sayısı |
karakter | Karakter sayısı |
kod_orani | Metnin kod bloklarında olan oranı |
text | Ham metin |
Dil dağılımı
Token ağırlıklı, baskın programlama diline göre:
| Python | %25,2 |
|---|---|
| HTML | %20,8 |
| Rust | %19,1 |
| Java | %17,3 |
| C++ | %10,8 |
| CSS | %2,8 |
| JavaScript | %1,3 |
| TypeScript | %0,9 |
| Bash | %0,9 |
| Go | %0,9 |
Sürüm notları
- v0.2: her doküman tek satır (v0.1'deki CSV kaynaklı bozuk parquet düzeltildi);
id,konu,ana_dil,token_countgibi kolonlar eklendi; sohbet artıkları temizlendi; yeni dokümanlar eklendi (≈80 bin → ≈318 bin token). - v0.1: ilk sürüm (≈80 bin token).
revision="v0.1"ile erişilebilir.
Kullanım
from datasets import load_dataset
ds = load_dataset("TozAI/TR-coding-data", split="train")
Bilmeniz gerekenler
- Küçük. 317 bin token, Töz-1'in 4,42 milyar tokenlık ön eğitimiyle kıyaslanınca çok küçük. Bir karışıma eklenen küçük bir parça olarak düşünün.
- Yapay zeka yardımıyla üretildi ve kodlar doğrulanmadı.
- Dağılım Python, HTML, Rust ve Java ağırlıklı.
Veri seti Hugging Face'te, MIT lisansıyla.
TR Coding Data Hugging Face'te herkese açık.
Hugging Face'te aç