Ana sayfa › Veri setleri › TR Coding Data

TR Coding Data

Programlamayı Türkçe anlatan ve kod içeren ham metin dokümanları. Her satır tek başına bir doküman: rehber, proje anlatımı, hata ayıklama oturumu gibi. Dil modellerinin ön eğitimi ve mid-training aşaması için hazırlandı.

Bir bakışta

Sürümv0.2
LisansMIT
DilTürkçe anlatım; kod örnekleri farklı programlama dillerinde
Doküman28
Token317.427 (Qwen/Qwen3-0.6B tokenizer'ı ile sayıldı)
Görevtext-generation (ön eğitim / mid-training)
BiçimParquet, tek bölüm (train)

Nasıl üretildi?

Dokümanlar yapay zeka modelleri (Qwen, GLM, Claude, ChatGPT, Gemini) yardımıyla üretildi, sonra elle gözden geçirilip düzenlendi: sohbet ifadeleri (hitaplar, "Tamam" ve "Harika" gibi açılışlar) ve arama atıf işaretleri temizlendi. Kodların tamamı çalıştırılarak doğrulanmadı; kullanmadan önce kendi kontrollerinizi yapmanız önerilir.

Kolonlar

idDoküman kimliği
konuKonu
ana_dilBaskın programlama dili
dillerDokümanda geçen tüm diller
etiketlerSerbest etiketler
langDoğal dil (FineWeb-2 kodu)
token_countToken sayısı
karakterKarakter sayısı
kod_oraniMetnin kod bloklarında olan oranı
textHam metin

Dil dağılımı

Token ağırlıklı, baskın programlama diline göre:

Python%25,2
HTML%20,8
Rust%19,1
Java%17,3
C++%10,8
CSS%2,8
JavaScript%1,3
TypeScript%0,9
Bash%0,9
Go%0,9

Sürüm notları

Kullanım

from datasets import load_dataset

ds = load_dataset("TozAI/TR-coding-data", split="train")

Bilmeniz gerekenler

Veri seti Hugging Face'te, MIT lisansıyla.

TR Coding Data Hugging Face'te herkese açık.

Hugging Face'te aç