Autoresearch · 5 August 2026 · 3 min · Original language: Türkçe
RTX 3090 Yerel Qwen 3.5 Gece Optimizasyonu
Kısa cevap: Ölçülen en yüksek sonuç, 8.192 token bağlam ve 128 batch ile 98,08 output token/s oldu. Bu, 95,33 token/s başlangıca göre yaklaşık %2,9 daha hızlı. Ancak aynı ayar daha sonra altı kez yalnızca 89,2–89,6 token/s verdiği için bu tepe sonuç tekrarlanabilir sayılmamalı ve kalıcı varsayılan olarak kabul edilmemeli.
Measured improvement2.9% better
Started
95.33
Best
98.08
Best-so-far result across 1686 recorded experiments. Higher output tokens per second is better. Original research record
Grafikte görünen kazanç nasıl okunmalı?
Başlangıç profili 2.048 token bağlam ve 256 batch ile 95,33 token/s üretti. İlk güvenilir iyileşme, bağlamı 4.096 tokene ve batch'i 1.024'e çıkarmakla geldi: üç deterministik tekrarın medyanı 96,32 token/s oldu. Bu yaklaşık %1,0'lık küçük ama ölçülmüş bir artış.
Daha sonra 8.192 token bağlam ve 128 batch ile 98,08 token/s görüldü. Grafikteki en yüksek nokta budur; başlangıca göre 2,75 token/s, önceki iyi profile göre 1,77 token/s kazanç anlamına gelir.
Ne var ki tek bir hızlı ölçüm yeterli değildir. Aynı 8.192/128 ayarı daha sonraki tamamlanmış doğrulamalarda 89,5, 89,4, 89,6, 89,6, 89,2 ve 89,6 token/s verdi. Model bu ölçümlerde GPU'da tamamen yerleşik kaldı ve yaklaşık 8,4 GB VRAM kullandı. Dolayısıyla 98,08 token/s sonucu mevcut kanıtla kalıcı bir ayar kazancı olarak ayrılamıyor.
Denemelerin asıl öğrettiği şey
Toplam 1.686 deney kaydı içinde bağlam uzunluğu ve batch kombinasyonları çok geniş biçimde tarandı. Sonuçlar, “daha büyük bağlam” veya “daha büyük batch” yönünde basit ve sürekli bir hızlanma olmadığını gösteriyor.
Örneğin 16.384 token bağlam ve 512 batch erken bir ölçümde 95,94 token/s ile 4.096/1.024 profilinin altında kaldı. Geç aşamadaki 10.240–16.384 token bağlam ve 128–2.048 batch denemeleri de çoğunlukla 89,5–90,1 token/s aralığında sonuçlandı. Öte yandan 1.024 token bağlam ve 512 batch ile 68,74 token/s ölçülmesi, fazla küçük bir profilin de bu kurulumda ciddi kayıp yaratabildiğini gösterdi.
Pratik sonuç şu: RTX 3090'ın belleğini daha fazla doldurmak tek başına üretim hızını artırmıyor. Bu model ve sabit çıktı yükünde orta büyüklükte bağlamlar yeterli; batch değişiklikleri ise ancak kararlı bir referans ölçümüne karşı değerlendirilirse anlamlı.
Neden kesin bir “kazanan ayar” yok?
Araştırmanın son bölümünde yalnızca performans değişmedi; ölçüm altyapısı da kararsızlaştı. Bazı yeniden ölçümler CUDA hatasıyla sona erdi, bazılarında model ısınmış ve yüklü olarak raporlanmadı, bazı deneylerde benchmark veya backend tamamlanmadan durdu. Kullanıcı araştırmayı 12.288 token bağlam ve 1.024 batch denemesi tamamlanmadan durdurdu.
Bu nedenle 4.096/1.024 profili şu anda en savunulabilir geçici adaydır, fakat onun da bağımsız oturumlar arasındaki tekrarlanabilirliği doğrulanmış değildir. 98,08 token/s ise ilginç bir tepe değeridir; üretim ayarı olarak kabul edilecek kadar tekrar edilememiştir.
Kanıt ayrıca context ve batch dışındaki runtime seçenekleri için karşılaştırılabilir sonuç vermiyor. Dolayısıyla farklı runtime bayrakları, sürücüler, saat hızları veya güç ayarları hakkında bir kazanan ilan edilemez; son bölümdeki genel hız düşüşünün nedeni de ölçülmediği için bilinmiyor.
Uygulanabilir sonraki adım
Önce benchmark ortamını kararlı hale getirip 2.048/256 başlangıç profilini ve 4.096/1.024 adayını dönüşümlü olarak yeniden çalıştırmak gerekir. Her aday aynı ısınma süreciyle, sabit prompt ve çıktı uzunluğuyla, birden fazla bağımsız turda referansı geçmeden kabul edilmemeli.
8.192/128 ayarı ancak 98 token/s civarındaki sonucu yeniden ve tutarlı biçimde üretebilirse tekrar aday yapılmalı. CUDA, model yükleme veya backend hatası görülen turlar ölçüm olarak sayılmamalı. Bu temel kararlılık sağlandıktan sonra runtime ayarlarını tek tek değiştirmek, gerçek ayar kazancını gece boyunca oluşan sistemsel hız değişiminden ayırmanın en güvenilir yoludur.