This guide is written in Turkish.

Fine-tuning mi, RAG mı? Şirket verisiyle model nasıl uyarlanır

ALTAIGüncelleme: 5 dk okuma

RAG (retrieval-augmented generation, erişimle zenginleştirilmiş üretim), soruyla ilgili belge parçalarını yanıt anında modele veren yöntemdir; fine-tuning (ince ayar) ise modelin ağırlıklarını kendi örneklerinizle yeniden eğitmektir. Sık değişen ve kaynağı gösterilmesi gereken bilgi için RAG, kurum terimleri, yanıt biçimi ve belirli bir görevdeki davranış için fine-tuning daha uygundur. İkisi birlikte de kullanılabilir: bir çalışmada, belgelerden üretilmiş sentetik soru-cevaplarla uyarlanmış model RAG ile getirilen metni daha iyi kullandı.

RAG ve fine-tuning nedir?

RAG’da modelin kendisi değişmez. Belgeleriniz parçalara bölünüp indekslenir; her soruda ilgili parçalar bulunur ve istemle (prompt) birlikte modele verilir. Bilgi güncellendiğinde yalnız indeksi güncellersiniz. Ayrıntılar için RAG nedir rehberine bakın.

Fine-tuning’de hazır bir modeli kendi örneklerinizle eğitmeye devam edersiniz. En yaygın biçimi SFT’dir (supervised fine-tuning, denetimli ince ayar): modele soru ve beklenen yanıt çiftleri ya da örnek konuşmalar gösterilir. LoRA gibi yöntemler tüm ağırlıkları değil, modele eklenen küçük adaptörleri eğitir; bu, maliyeti ve donanım ihtiyacını büyük ölçüde düşürür.

Nasıl farklılaşırlar?

RAGFine-tuning
Bilgi nerede dururDış bir indeksteModelin ağırlıklarında
GüncellemeBelgeyi yeniden indekslemekModeli yeniden eğitmek
Kaynak göstermeGetirilen parça gösterilebilirDoğrudan mümkün değil
Erişim yetkisiBelge düzeyinde uygulanabilirModel öğrendiğini kullanıcıya göre ayıramaz
En iyi öğrettiği şeyGüncel ve ayrıntılı bilgiBiçim, terim, üslup, dar bir görevdeki beceri
Çalışma maliyetiHer soruda daha uzun bağlamEğitim maliyeti; kullanımda kısa istem
Gereken veriBelgeler ve test sorularıEğitim örnekleri ve ayrı bir test seti

Hangisi ne zaman?

RAG’ı seçin:

  • bilgi sık değişiyorsa (fiyat, prosedür, ürün belgesi),
  • her yanıtın kaynağı gösterilmeliyse,
  • kullanıcılar farklı belgelere erişebiliyorsa,
  • koleksiyon büyükse.

Fine-tuning’i seçin:

  • model sabit bir biçimde yanıt vermeliyse (JSON, form alanları, araç çağrıları),
  • kurumunuzun terimlerini ve belge türlerini doğru kullanmalıysa,
  • sınıflandırma ya da bilgi çıkarma gibi dar bir görev varsa,
  • büyük bir modelin işini daha küçük, daha ucuz ve yerel bir modele yaptırmak istiyorsanız.

Hiçbiri gerekmeyebilir: iyi yazılmış bir istem ve birkaç örnek bazı işler için yeterlidir. Önce bunu ölçün.

İkisini birlikte kullanmak

ALTAI blogunda özetlenen bir çalışma (The Role of Parametric Injection — A Systematic Study of Parametric Retrieval-Augmented Generation) üç kurguyu karşılaştırdı:

  • RAG: ilgili metin getirilip temel modele verilir. Taban çizgisi budur.
  • PRAG: belgeler üzerinde eğitilmiş LoRA adaptörleri kullanılır, arama yapılmaz. RAG’dan kötü sonuç verdi; ayrıntılı olgusal bilgiler eksik kaldı.
  • PRAG-Combine: hem adaptörler hem arama kullanılır. Çalışmadaki bütün testlerde RAG’dan iyi sonuç verdi; arama sonuçları gürültülü olduğunda da güçlü kaldı.

Adaptörler, birçoğu sentetik olarak üretilmiş belge-soru-yanıt üçlüleriyle eğitilmişti. Sonuç şu: fine-tuning aramanın yerini tutmaz, modele getirilen metni nasıl yorumlayacağını öğretir. Bilgiye erişimi arama sağlar, onu kullanmayı ince ayar.

Uygulamada akış üç adımdır:

  1. Belgelerinizden çeşitli sorular ve kaynağa dayalı yanıtlar üretilir (sentetik veri).
  2. Bu örneklerle küçük bir model ya da LoRA adaptörü eğitilir.
  3. Kullanımda arama sürer; model getirilen parçaları alanı tanıyarak okur.

Bu tek bir çalışmanın bulgusudur. Aynı kazancı kendi verinizde ölçmeden varsaymayın.

Maliyet ve veri ihtiyacı

RAG için belgelerin metne çevrilmesi, parçalanması, embedding (vektör temsili) ile vektörleştirilmesi ve bir vektör veritabanında saklanması gerekir. Çalışma maliyetinin büyük kısmı her soruda modele giden ek bağlamdır. Türkçe belgelerde arama kalitesi büyük ölçüde metin işleme ve model seçimine bağlıdır; bkz. Türkçe embedding modelleri.

Fine-tuning için eğitim örnekleri ve GPU zamanı gerekir. Kurumların çoğunda belgeler vardır, örnek konuşmalar yoktur; bu boşluk belgelerden üretilen sentetik veriyle kapatılır. Örneklerin sayısından çok kalitesi ve çeşitliliği önemlidir. LoRA ile küçük bir modeli uyarlamak için çoğu zaman tek bir GPU yeter.

İki yolda da en az emek isteyen ama en çok atlanan parça, eğitimde kullanılmamış bir test setidir.

Adım adım

  1. Görevi ve başarı ölçütünü yazın. Kim soracak, iyi yanıt neye benzer, hangi hata kabul edilmez?
  2. Test setini ayırın. Gerçek sorulardan ve beklenen yanıtlardan oluşan, eğitime hiç girmeyecek bir set hazırlayın.
  3. Taban çizgisini ölçün. Güçlü bir model ve iyi bir istemle başlayın, sonra RAG ekleyin.
  4. Hataları ayırın. Yanlış belge geliyorsa sorun aramadadır: parçalama, embedding ya da hibrit arama. Doğru belge gelip yanıt yanlışsa ya da biçim tutmuyorsa elinizde bir fine-tuning adayı var demektir.
  5. Veri üretin ve eğitin. Belgelerden sentetik örnekler üretin, bir örneklemi okuyun, LoRA ile eğitin.
  6. Aynı test setinde karşılaştırın. Temel model + RAG ile uyarlanmış model + RAG’ı yan yana ölçün.

Değerlendirme: LLM-as-a-judge

Açık uçlu yanıtları elle puanlamak yavaştır. LLM-as-a-judge (yargıç model) yönteminde bir model, yanıtları bir ölçüte göre puanlar ya da iki yanıttan hangisinin daha iyi olduğuna karar verip gerekçesini yazar.

ALTAI, Gemma 3 4B modelini Prometheus-Eval’in iki veri setiyle LoRA kullanarak eğitti: 1–5 arası mutlak puanlama için Feedback Collection, A/B karşılaştırması için Preference Collection. İki model MergeKit ile Nuslerp yöntemi kullanılarak birleştirildi. Ortaya çıkan değerlendirici, çok daha büyük Prometheus 2 (8×7B) modelinin korelasyonlarına ulaştı ya da onları geçti. Preference-Bench üzerindeki tutarlılık testinde sonuç %77,83 tutarlı, %3,50 tutarsız ve %18,67 berabere oldu.

Sınırları da açıktır: eğitim verisi İngilizceydi, başka dillerde sistematik test yapılmadı ve model referans yanıta ihtiyaç duyuyor. Türkçe yanıtları değerlendirirken yargıç modelin puanlarını insanların puanladığı küçük bir örneklemle karşılaştırın. Ayrıca bkz. değerlendirme.

Dikkat edilmesi gerekenler

  • Bilgiyi ezberletmeye çalışmayın. Sık değişen olguları fine-tuning ile öğretmek halüsinasyon riskini artırır; güncel bilgi aramadan gelmelidir.
  • Test sızıntısını önleyin. Test sorularının üretildiği belgeler ve kalıplar eğitime girerse skorlar gerçeği yansıtmaz.
  • Kişisel veriyi eğitimden önce maskeleyin. Model eğitim verisindeki bilgileri yanıtlarına taşıyabilir. Bu metin hukuki danışmanlık değildir; kendi durumunuz için bir hukukçuya danışın.
  • Genel yeteneği de ölçün. Dar bir görevde eğitilen model başka işlerde gerileyebilir.
  • Şartları kontrol edin. Temel modelin lisansı ve sentetik veri üretiminde kullandığınız sağlayıcının şartları ayrıca geçerlidir.

ALTAI’de nasıl yapıyoruz

Kurumunuzun terimlerini, belge türlerini ve beklenen yanıt biçimini öğrenen dil modelleri eğitiyoruz. Eğitim örneklerini AfterImage ile hazırlıyor, model boyutunu donanımınıza göre seçiyor, sonuçları eğitimde kullanılmayan örneklerle test ediyoruz. Belgeye dayalı yanıt gereken işlerde Doküman Asistanı gibi uygulamalar kuruyor; yanıtın kaynak belgelerle desteklenmesini, doğru belgenin ve bölümün bulunmasını ve çalışanın düzeltmeye harcadığı süreyi birlikte ölçüyoruz. Özel model eğitimi için kapsamı, bütçesi ve takvimi belli ayrı bir proje teklifi hazırlıyoruz; çalışma biçimimiz Nasıl çalışıyoruz sayfasında. ALTAI platformunda (app.altai.dev) da dosyalarınızdan sentetik veri seti üretip Qwen3, Gemma veya Llama türevlerini LoRA ayarlarıyla eğitebilirsiniz. Projeniz için bize yazın.

Sık sorulan sorular

RAG varken fine-tuning’e gerek var mı?

Her zaman değil. Bilgi sık değişiyorsa ve kaynak gösterilmesi gerekiyorsa RAG çoğu zaman yeterlidir. Model getirilen belgeleri doğru yorumlayamıyor, kurum terimlerini karıştırıyor ya da biçime uymuyorsa, sentetik soru-cevaplarla yapılan fine-tuning RAG’ın sonucunu iyileştirebilir.

Fine-tuning ile modele şirket belgelerini öğretebilir miyim?

Kısmen. Model alanın terimlerini ve yapısını öğrenir, ama ayrıntılı ve güncel olguları güvenilir biçimde hatırlamaz. ALTAI blogunda özetlenen çalışmada da yalnız adaptörlerle çalışan kurgu RAG’ın gerisinde kaldı. Olgular için aramayı koruyun.

Fine-tuning için kaç örnek gerekir?

Görevin darlığına ve modelin büyüklüğüne bağlıdır. Dar görevlerde birkaç yüz ile birkaç bin arasında, iyi kontrol edilmiş örnekle başlamak yaygındır. Sayıyı artırmadan önce kaliteyi ve çeşitliliği artırın, her adımı ayrı test setiyle ölçün.

LoRA nedir?

LoRA (low-rank adaptation), modelin tüm ağırlıklarını değiştirmek yerine bazı katmanlara eklenen küçük matrisleri eğiten bir fine-tuning yöntemidir. Daha az bellek ve GPU zamanı ister. Ortaya çıkan adaptör ayrı bir dosya olarak saklanabilir ya da temel modelle birleştirilebilir.

RAG ve fine-tuning sonuçlarını nasıl karşılaştırırım?

Eğitime girmemiş aynı test setini kullanın. Arama kalitesini (doğru parça geliyor mu) ve yanıt kalitesini (doğru, kaynağa dayalı ve biçime uygun mu) ayrı ayrı ölçün. Yanıtları bir yargıç modelle puanlayabilirsiniz, ama bir örneklemi insanlara da puanlatın.