Yanıtların değişen belgelerden gelmesi, kaynaklarına atıfta bulunması veya kullanıcı başına erişim haklarına uyması gerektiğinde RAG kullanın; bu, çoğu kurumsal bilgi işini tanımlar. Promptlamanın güvenilir biçimde sağlayamadığı tutarlı bir stil, çıktı biçimi veya alana özgü davranışa ihtiyaç duyduğunuzda ve bu davranış bir eğitim çalıştırmasını haklı çıkaracak kadar istikrarlıysa ince ayar kullanın. Çoğu olgun dağıtım her ikisiyle de sonuçlanır: RAG gerçekleri sağlar, küçük bir LoRA adaptörü modelin nasıl yanıt verdiğini şekillendirir.

RAG ve ince ayar gerçekte ne yapar

Erişim destekli üretim (RAG)

RAG modele dokunmaz ve çıkarım anında gördüklerini değiştirir. Soru gömülür (embed), belgelerinizin bir indeksiyle eşleştirilir ve en iyi eşleşen pasajlar istemin içine yerleştirilir. Model bu bağlamdan yanıt verir ve kullandığı pasajlardan alıntı yapabilir. Bilgi indekste yaşar, dolayısıyla bir güncelleme yeniden eğitim değil bir belgeyi yeniden indekslemek anlamına gelir.

İnce ayar

İnce ayar, kendi örnekleriniz üzerinde eğitime devam ederek modelin ağırlıklarını değiştirir. Tam ince ayar her parametreyi günceller; LoRA gibi parametre-verimli yöntemler küçük adaptör matrisleri eğitir ve taban ağırlıkları dondurulmuş tutar. Sonuç, biçiminizi izler, terminolojinizi kullanır ve uzun talimatlar olmadan görevinizi ele alır. İnce ayar davranışı güvenilir biçimde öğretir; gerçekleri zayıf öğretir.

Önemli çıkarım: RAG, modelin sorgu anında ne bildiğini değiştirir; ince ayar nasıl davrandığını değiştirir. GPU süresi satın almadan önce mekanizmayı probleme eşleştirin.

RAG vs ince ayar: yan yana karşılaştırma

Aralıklar, sahip olduğunuz veya kiraladığınız GPU'larda açık ağırlıklı modeller için 2026 tahminleridir.

KriterRAGİnce ayar
Bilginin güncelliğiSon indeksleme çalıştırması kadar güncelEğitim anında donmuş; güncellemeler yeni bir eğitim döngüsü gerektirir
İzlenebilirlik ve alıntılarDoğal: yanıtlar belge kimlikleriyle alınan pasajlardan alıntı yaparYok: çıktılar bir kaynağa izlenemez
MaliyetErişim yığını artı sorgu başına yaklaşık 2-10 kat daha fazla girdi token'ıÖnceden eğitim hesaplaması (H100 sınıfı GPU'larda saatler ila günler), sonrasında daha kısa istemler
Gereken veriVar olduğu haliyle belgeler; etiket gerekmezStil için yaklaşık 1.000-10.000 düzenlenmiş istem-yanıt çifti, yeni beceriler için daha fazlası
Dağıtım süresiGünler içinde prototip, haftalar içinde üretimHaftalar, çoğunlukla veri düzenleme ve değerlendirmeyle
BakımBelge değiştiğinde yeniden indeksleme; erişim kalitesini izlemeSapmada yeniden eğitim; her taban model yükseltmesinden sonra yeniden doğrulama
Halüsinasyon riskiBağlama dayandırıldığında ve gerektiğinde çekimser kalması söylendiğinde daha düşük; erişim kaçırmaları hâlâ kendinden emin hatalar üretirEğitim setinin dışındaki gerçekler için daha yüksek
Güvenlik ve erişim kontrolüSorgu anında zorunlu kılınan belge başına izinler; belgeler saniyeler içinde kaldırılabilirEğitim verisi her kullanıcıya açıktır; güvenilir bir "öğrenmeyi geri alma" yoktur

Önemli çıkarım: RAG güncellik, izlenebilirlik ve erişim kontrolünde kazanır; ince ayar davranışsal tutarlılıkta ve çok yüksek hacimde sorgu başına maliyette kazanır.

Karar kontrol listesi: hangi yaklaşıma ihtiyacınız var?

Soruları sırayla yanıtlayın ve ilk net "evet"te durun.

  1. Yanıt, haftalık veya daha hızlı değişen bilgiye mi bağlı (politikalar, fiyatlar, talepler)? Evet: RAG. İnce ayarlı ağırlıklar, eğitim bittiği gün bayatlar.
  2. Yanıt, denetim veya kullanıcı güveni için nereden geldiğini mi göstermeli? Evet: RAG. Alıntılar, alınan pasajlara ihtiyaç duyar.
  3. Kullanıcıların temel veri üzerinde farklı hakları var mı? Evet: izin farkındalıklı filtrelemeye sahip RAG. Bazı kullanıcıların göremeyebileceği veri üzerinde asla ince ayar yapmayın.
  4. Model gerçekleri biliyor ama yanlış stil, yapı veya uzunlukta mı yanıt veriyor? Evet: ince ayar, genellikle bir LoRA adaptörü, örneklerle promptlama başarısız olduktan sonra.
  5. Görev dar, tekrarlayan ve yüksek hacimli mi (sınıflandırma, çıkarım, yönlendirme)? Evet: küçük bir modele ince ayar yapın; maliyet ve gecikmede büyük, promptlanmış bir modeli geride bırakır.
  6. Model, nadiren gördüğü alan diline mi takılıyor (iç kodlar, özel bir sorgu dili)? Evet: bu kelime dağarcığının arkasındaki gerçekler için RAG ile birlikte ince ayar.
  7. Güncel bir açık ağırlıklı modelde 5-10 örnekli yapılandırılmış bir sistem istemi denediniz mi? Hayır: önce bunu yapın. 2026 itibarıyla, Llama 4, Qwen 3 veya Mistral üzerinde promptlama artı RAG çoğu kurumsal durumu çözer; bkz. hangi açık ağırlıklı modeller kurumsal kullanıma uyar.
  8. Hâlâ kararsız mısınız? Önce RAG'ı inşa edin: geri alınabilirdir, denemesi ucuzdur ve günlükleri daha sonra ihtiyaç duyacağınız eğitim çiftlerine dönüşür.

Önemli çıkarım: güncellik, alıntılar ve erişim kontrolü RAG'ı zorunlu kılar; stil, şema ve hacim ince ayarı savunur; geri kalan her şey promptlama ve RAG ile başlar.

RAG ve ince ayarı ne zaman birleştirmeli

En güçlü üretim deseni, bilgi için RAG artı davranış için bir LoRA adaptörüdür. Erişim, güncel ve alıntılanmış gerçekler sağlar; adaptör, her çağrıda uzun bir sistem istemi olmadan kurumunuzun stilini, şemasını ve alıntı biçimini sunar. Bir adaptör küçüktür (onlarca ila birkaç yüz megabayt) ve taban model paylaşımlı kalır, dolayısıyla tek bir vLLM dağıtımı birçok adaptöre hizmet verebilir ve istek başına birini seçebilir.

Üç varyant tekrarlanır: üreticiye bağlamı iyi kullanmayı öğretmek için ince ayar (alıntı yapma, belgeler sessiz kaldığında çekimser kalma, alakasız pasajları görmezden gelme); gömme modelini veya yeniden sıralayıcıyı kendi sorgu-belge çiftlerinizde ince ayara tabi tutmak, ki bu genellikle üreticide yapılacak herhangi bir değişiklikten daha fazla yardımcı olur; veya daha büyük bir RAG hattı açık uçlu soruları ele alırken yapılandırılmış çıktı için küçük bir modele ince ayar yapmak.

Önemli çıkarım: hem gerçekler hem davranış önemli olduğunda ikisini birleştirin; gerçekleri indekste, davranışı adaptörde tutun, asla tersini değil.

RAG mimarisinin temelleri

Bir RAG hattı yalnızca erişimi kadar iyidir. "Model halüsinasyon gördü" olarak bildirilen çoğu başarısızlık aslında erişim başarısızlığıdır: doğru pasaj en iyi sonuçlarda eksikti veya ilgili cümle bağlamını kaybedecek şekilde bölünmüştü.

Parçalama (chunking)

Belgeleri sabit karakter sayılarında değil gerçek yapılarına göre (başlıklar, bölümler, tablo satırları) bölün. Tipik parçalar yüzde 10-20 örtüşmeyle yaklaşık 256-1.024 token'dır; daha küçük parçalar hassas erişim sağlar, daha büyükleri bağlamı korur. Her parçada kaynağı, sürümü, tarihi, sahibi ve erişim kontrol listesini meta veri olarak saklayın. Ebeveyn-çocuk parçalama (küçük getir, ebeveyn bölümü döndür) politika ve sözleşme metinlerine uygundur.

Hibrit arama

Yoğun (dense) vektör aramasını BM25 gibi sözcüksel bir indeksle birleştirin ve listeleri, tipik olarak karşılıklı sıra füzyonuyla (reciprocal rank fusion) birleştirin. Yoğun erişim yeniden ifadeyi ele alır; sözcüksel erişim, gömmelerin bulanıklaştırdığı ürün kodlarını, parça numaralarını, hata dizelerini ve isimleri ele alır. Erişim kontrolü ve belge sürümlerinin istemde değil erişimcide zorunlu kılınması için sıralamadan önce meta veriye göre filtreleyin.

Yeniden sıralama (reranking)

Geniş bir aday küme (yaklaşık 20-100 parça) alın, ardından istemin içine girecek 3-10 pasajı seçmek için bir çapraz kodlayıcı (cross-encoder) yeniden sıralayıcı uygulayın. Yeniden sıralama, çoğu hatta en ucuz kalite kazanımıdır çünkü iki bağımsız vektörü karşılaştırmak yerine sorgu ve pasajı birlikte okur. NVIDIA NIM, üreticiyle aynı GPU'larda çalışan gömme ve yeniden sıralama mikro hizmetleri sunar.

Değerlendirme

Herhangi bir şeyi ayarlamadan önce, bilinen kaynak pasajlara ve beklenen yanıtlara sahip 100-300 gerçek sorudan oluşan bir test seti oluşturun. Erişimi (recall@k, MRR) üretimden (bağlama sadakat, yanıt doğruluğu, alıntı doğruluğu) ayrı olarak ölçün. Parçalamada, gömmelerde veya istemde her değişiklikte yeniden çalıştırın; üretimi iyileştiren ama recall'ı düşüren bir değişiklik, aksi halde üretimde karşılaşacağınız bir gerilemedir.

Önemli çıkarım: üreticiye dokunmadan önce parçalamaya, hibrit aramaya ve yeniden sıralamaya yatırım yapın ve erişimi ile üretimi ayrı ayrı ölçün.

İnce ayarın temelleri

LoRA ve QLoRA

LoRA, taban ağırlıkları dondurur ve dikkat ile MLP katmanlarına enjekte edilen düşük ranklı matrisleri eğitir; adaptör tipik olarak modelin parametrelerinin yüzde 1'inin oldukça altındadır, sürümleyebileceğiniz ve anında değiştirebileceğiniz küçük bir dosyadır. QLoRA, eğitim sırasında dondurulmuş tabanı 4 bit hassasiyette tutar; orijinal makale, tek bir 48 GB GPU'da 65B bir modele ince ayar yaptı. Tam ince ayar, ağırlıklar, gradyanlar ve optimize edici durumu için parametre başına yaklaşık 16 bayta ihtiyaç duyar (70B bir model için kabaca 1.1 TB), adaptörlerin açıkça yetersiz kaldığı durumlar için çok düğümlü bir iştir.

2026 itibarıyla, 8B sınıfı bir model bir H100 veya RTX PRO 6000'de saatler içinde bir LoRA adaptörü eğitir; QLoRA ile 70B bir model bir veya iki 80 GB GPU'ya sığar ve çalıştırma başına yaklaşık bir gün sürer. Eğitim nadiren darboğazdır; veri ve değerlendirme darboğazdır. Adaptörü sunmak vLLM'de bir bayrak uzaklıktadır:

vllm serve /models/base-model \
  --enable-lora \
  --lora-modules house-style=/adapters/house-style \
  --max-lora-rank 64

Veri seti boyutu ve kalitesi

Stil, biçim ve ton için, yaklaşık 1.000-10.000 doğru, tutarlı ve temsili örnek, 100.000 taranmış örnekten daha iyi performans gösterir. Her örnek, tekrar üretildiğini görmekten memnun olacağınız bir örnek olmalıdır, çünkü üretilecektir. Yinelenenleri kaldırın, bir kullanıcının görmeye hakkı olmayan her şeyi çıkarın ve değerlendirme için yüzde 10-20'sini ayırın. Alan uzmanları tarafından düzeltilmiş, günlüğe kaydedilmiş RAG etkileşimleri genellikle en iyi kaynaktır.

Değerlendirme ve gerileme riski

İnce ayar, üzerinde eğitim yapmadığınız yetenekleri düşürebilir: talimat takibi, reddetmeler, diğer diller, araç çağırma ve akıl yürütme. Üç sette değerlendirin: hedef görev, genel bir yetenek paketi ve güvenlik ile uyumluluk testleriniz. Adaptöre bir referans, bir fark (diff) ve bir geri dönüş yoluna sahip bir yazılım sürümü gibi davranın. Taban modeli sabitleyin; yeni bir taban sürümü adaptörü geçersiz kılar ve yeniden eğitim ile yeniden değerlendirme gerektirir.

Önemli çıkarım: öntanımlı olarak LoRA veya QLoRA kullanın, bütçenin çoğunu veri ve değerlendirmeye harcayın ve her adaptörü gerileme testlerinin arkasına koyun.

Doğru seçime eşlenmiş tipik kurumsal senaryolar

SenaryoÖnerilen yaklaşımNeden
İK, BT ve politika belgeleri üzerinden iç yardım masasıRAGİçerik sürekli değişir; yanıtların politika sürümüne bir bağlantısı olmalıdır
Ürün belgeleri ve talepler üzerinden müşteri desteğiTon için RAG artı bir LoRA adaptörüGerçekler değişir; ton değişmemeli
Denetim izine sahip sözleşme veya hasar soru-cevabıAlıntılar ve kullanıcı başına filtrelemeyle RAGİzlenebilirlik ve erişim kontrolü pazarlık konusu değildir
Yüksek hacimde sabit bir şemaya hasar üçlemesi (triage) veya sınıflandırmaİnce ayarlı küçük model (8B sınıfı veya daha küçük)Dar görev, milyonlarca çağrı; kısa istemler maliyeti ve gecikmeyi düşürür
Özel bir çerçeve veya sorgu dili için kod asistanıDepo üzerinde ince ayar artı RAGÖntanımlı olarak sözdizimi, erişimle güncel kod
Kurumsal stilde raporlar ve mektuplarKaynak veri için RAG, stil için LoRAGerçekler güncel kalır, çıktı tutarlı kalır
SAP, Salesforce ve Microsoft 365 üzerinde ajanlarMCP sunucuları aracılığıyla RAG ve araç çağırma, ince ayar yokCanlı veri ağırlıklarda değil API'lerin arkasına aittir; bkz. bir MCP sunucusu nasıl inşa edilir

Önemli çıkarım: düzenlemeye tabi ve hızla değişen kullanım senaryoları RAG'a gider; dar, yüksek hacimli görevler ince ayara gider; çoğu karmaşık ürün ikisini birden kullanır.

Sıkça sorulan sorular

RAG, ince ayardan daha mı ucuz?

Genellikle başlangıçta: RAG bir eğitim çalıştırması veya etiketli veri gerektirmez, dolayısıyla bir prototip, günlerce mühendislik artı bir vektör veritabanı ve bir gömme modeline mal olur. İstek başına daha pahalıya mal olur, çünkü alınan pasajlar yaklaşık 2-10 kat daha fazla girdi token'ı ekler. İnce ayar önceden daha fazlaya mal olur ama daha kısa istemler verir, dolayısıyla dar bir görevde çok yüksek hacimlerde genellikle toplamda daha ucuzdur.

İnce ayar bir LLM'e yeni gerçekler öğretebilir mi?

Yalnızca zayıf ve güvenilmez biçimde. Birkaç bin örnek stili ve görev davranışını değiştirir ama belirli gerçeklerin güvenilir bir belleğini oluşturmaz ve model bir gerçeğin nereden geldiğini söyleyemez. Büyük alan derlemleri üzerinde sürdürülen ön eğitim bilgi ekleyebilir, ancak çok daha fazlaya mal olur ve yine de alıntı veya güncelleme sağlamaz. Doğru ve güncel olması gereken gerçekler için erişim kullanın.

Uzun bağlam pencereleri RAG'ı gereksiz kılar mı?

Hayır. 2026 itibarıyla açık ağırlıklı modeller 128K token'lık bağlam pencereleri ve daha fazlasını sunar; bu, tek bir küçük belge kümesi için erişimi atlamaya yeter. Binlerce belge için ölçeklenmez: maliyet ve gecikme her token ile artar, ilgili pasajlar gömüldükçe doğruluk düşer ve erişim kontrolünün yine de bir yerde gerçekleşmesi gerekir. Erişim, pencereye neyin gireceğini seçer; uzun bağlam bunun daha fazlasını geçirmenize izin verir.

Bir LLM'e ince ayar yapmak için ne kadar veriye ihtiyacım var?

LoRA ile stil, biçim ve ton için, tipik olarak yaklaşık 1.000-10.000 yüksek kaliteli örnek yeterlidir ve kalite sayıdan daha önemlidir. Gerçekten yeni bir beceri veya alan dili daha fazlasına, genellikle on binlerce örneğe ihtiyaç duyar. Boyut ne olursa olsun, veriyi yinelenenlerden arındırın, doğruluk için gözden geçirin, erişim hakları için temizleyin ve değerlendirme için yüzde 10-20'sini ayırın.

RAG halüsinasyonları ortadan kaldırır mı?

Önemli ölçüde azaltır ama tamamen değil. Yalnızca alınan bağlamdan yanıt vermesi ve aksi halde çekimser kalması talimatı verilen, bağlama dayandırılmış bir model, çok daha az desteksiz iddia yapar. Erişim doğru pasajı kaçırdığında, pasajlar çeliştiğinde veya model gevşek biçimde yeniden ifade ettiğinde hatalar kalır. Hibrit arama, yeniden sıralama, alıntı kontrolleri ve değerlendirme setinizdeki bir sadakat ölçütü çoğu kalıntı durumu ele alır.

Gizli veriler üzerinde bir modele güvenle ince ayar yapabilir miyim?

Yalnızca dikkatle. Eğitim verisi, doğru istem verildiğinde model tarafından yeniden üretilebilir ve eğitilmiş ağırlıklardan bir belgeyi kaldırmanın güvenilir bir yolu yoktur. Yalnızca modelin her kullanıcısının görebileceği veri üzerinde ince ayar yapın, önce kişisel verileri çıkarın, kontrol ettiğiniz altyapı üzerinde eğitin ve sunun, ve adaptörü geri çekilebilmesi için sürümleyin. Kullanıcı başına gizli içeriği izin filtreli bir RAG indeksinde tutun.

Nanobase AI nasıl yardımcı olabilir

Nanobase AI, bu kararın her iki tarafını da tasarlar, inşa eder ve işletir: izin farkındalıklı RAG hatları (parçalama, hibrit arama, yeniden sıralama, değerlendirme altyapıları) ve veri merkezinizde veya özel bulutunuzda vLLM, TensorRT-LLM veya NVIDIA NIM üzerinde sunulan, gerileme paketlerine sahip LoRA/QLoRA ince ayarı. GPU'ları (H100, H200, B200, RTX PRO) boyutlandırır, modelleri MCP sunucuları aracılığıyla SAP, Salesforce, Microsoft 365 ve Snowflake'e bağlar ve ekibinizin sürdürebileceği çalışma kılavuzlarını teslim ederiz.

Silikon Vadisi merkezli ve NVIDIA Inception Programı'nın bir üyesi olarak, izleyebilecekleri yanıtlara ve kontrolleri altında kalan veriye ihtiyaç duyan sigorta, finans ve endüstriyel ekiplere odaklanıyoruz. Tam kapsam için çözümlerimize bakın. Projenizi görüşmeye hazır mısınız? Nanobase AI ile iletişime geçin veya hello@bumu.tech adresine e-posta gönderin.