Projelere Dön
// Project Case StudyNis 2025 – Haz 2025

GemmaTR

GemmaTR, Google Gemma, Unsloth ve LoRA tabanlı Türkçe LLM ince ayar projemdir. 400.000 Türkçe Wikipedia girdisi ve hukuk, eğitim, tarım odaklı 50.000 soru-cevap çifti içeren bir veri seti hazırladım, Google Colab üzerinde dört model varyantı eğittim ve çalışmayı Hugging Face üzerinden yayınladım.

Genel Bakış

GemmaTR, Google Gemma, Unsloth ve LoRA tabanlı Türkçe LLM ince ayar projemdir. 400.000 Türkçe Wikipedia girdisi ve hukuk, eğitim, tarım odaklı 50.000 soru-cevap çifti içeren bir veri seti hazırladım, Google Colab üzerinde dört model varyantı eğittim ve çalışmayı Hugging Face üzerinden yayınladım.

Problem

Türkçe kullanıcılar, özellikle hukuk, eğitim ve tarım gibi alan odaklı soru-cevap çalışmaları için İngilizceye kıyasla daha az açık ve özelleştirilmiş LLM kaynağına sahip.

Teknik Yaklaşım

Büyük bir Türkçe veri seti hazırladım, Google Gemma modelini Unsloth ve LoRA ile ince ayarladım ve Google Colab üzerinde 40 saatlik eğitim sürecinde dört model varyantı geliştirdim.

Sonuç

Ortaya çıkan model ağırlıklarını ve eğitim çıktılarını Hugging Face üzerinde yayınlayarak Türkçe ince ayar çalışmasını topluluk için yeniden kullanılabilir ve incelenebilir hale getirdim.

İlgili Yazı

Eklemeli Dil Engelini Aşmak: Türkçe Özetleme için Özel NLP Pipeline'ları

Teknolojiler

PythonGoogle GemmaUnslothLoRAHugging FaceTürkçe NLPVeri Seti HazırlamaGoogle Colab

Dış Bağlantılar