Büyük dil modellerinde eğitimsiz statik dikkat maskelemenin yapısal sınırları: Çarpımsal modülasyon üzerine mekanistik bir inceleme

dc.contributor.advisorAslan, Özkan
dc.contributor.authorBilgehan, Fatih Çağrı
dc.date.accessioned2026-10-09T06:57:55Z
dc.date.issuedTemmuz, 2026
dc.departmentEnstitüler, Fen Bilimleri Enstitüsü, Bilgisayar Ana Bilim Dalı
dc.description.abstractBüyük dil modellerinin (LLM) temelini oluşturan öz-dikkat mekanizması, deterministik doğası gereği dilin yapısal tutarlılığını korurken metinsel yaratıcılığı kısıtlayabilmektedir. Bu yüksek lisans tezinde, söz konusu yaratıcılık-tutarlılık ödünleşimini eğitim gerektir- meden (zero-shot) ele almayı hedefleyen statik bir çarpımsal dikkat maskeleme yöntemi (BAW) önerilmiş ve mekanistik sınırları kapsamlı biçimde analiz edilmiştir. BAW yöntemi, dikkat matrisi üzerine doğrudan etki eden çarpımsal bir ağırlık meka- nizmasıdır. Yerel sözdizimsel bağları koruyan Gaussian bir bileşen ile kuantum dönüş kapısının (RX) ölçüm olasılığı formundan (cos2) esinlenen, matematiksel olarak periyo- dik bir yükseltilmiş-kosinüs (raised cosine) çekirdeği olan ve uzak bağlamlarda periyodik dikkat kontrastı yeniden ölçeklemesi sağlayan kuantum-esinli bir bileşenin entegrasyonun- dan oluşur. Mekanizma, GPT-2 mimari ailesinin üç ölçeğinde (Small, Medium, Large), dört farklı kolda (Taban, Gaussian, Kuantum, Hibrit) toplam 108.000 metin üzerinde 16 otomatik metrikle (13 temel, 3 ikincil doğrulayıcı) değerlendirilmiştir. Tezin en temel teorik katkısı, çarpımsal maskenin (𝑊 = 𝐺 × 𝑄) yapısal bir menzil- uyumsuzluğu taşıdığının analitik olarak ispatlanmasıdır: Gaussian bileşenin hızlı üstel sö- nümlenmesi, kuantum bileşeninin uzak-menzil rezonans zirvelerini temsili 𝜎 = 4, 𝜃𝑠𝑐𝑎𝑙𝑒 = 0.10 konfigürasyonunda 10−54; incelenen hiperparametre ızgarasının tamamında (analitik fizibilite analizi) ise 10−7–10−280 aralığında sıfırlayarak hibritte sinerjiyi engellemiştir. Kuantum bileşeni izole olarak (Quantum-only kolunda) tüm dizi boyunca aktif kalmış ve Base modele kıyasla ölçülebilir yapısal kaymalar üretmiş; ancak bu kaymalar yaratıcılık vekil (proxy) metriklerinde sistematik bir üstünlüğe dönüşmemiştir. Ayrıca bu sınırlı etki, özellikle yaratıcılık ve çeşitlilik proxy metriklerinde model ölçeği büyüdükçe belirgin biçimde zayıflamıştır. Son olarak, yaygın kullanılan otomatik yaratıcılık proxy metrikle- rinin yüzeysel anahtar kelime sayımına dayanan kırılgan yapıları tespit edilmiş; niteliksel kaymaları algılamada yetersiz kaldıkları gösterilmiştir. Buna ek olarak gerçekleştirilen körleştirilmiş büyük dil modeli hakem (LLM-as-judge) ikincil değerlendirmesi de kollar arası anlamlı bir kalite veya yaratıcılık farkı bulamamış; hakemde tespit edilen güçlü po- zisyon yanlılığı ise otonom yaratıcılık değerlendirme yöntemlerinin yapısal kırılganlığına bağımsız bir gösterge sunmuştur.
dc.description.abstractThe self-attention mechanism underlying large language models (LLMs) inherently rest- ricts textual creativity while preserving structural coherence due to its deterministic na- ture. This master’s thesis proposes and mechanistically analyzes a training-free (zero-shot) static multiplicative attention masking method (BAW) designed to address the creativity- coherence trade-off. The BAW method is a multiplicative weight mechanism acting directly upon the attention matrix, integrating a Gaussian “local stability” component that preserves local syntactic dependencies with a component inspired by the measurement-probability form (cos2) of the quantum RX rotation gate, mathematically a periodic raised-cosine kernel, that periodically rescales attention contrast at distant token positions. The mechanism was evaluated across three scales of the GPT-2 architectural family (Small, Medium, Large) in four experimental arms (Base, Gaussian, Quantum, Hybrid) over 108,000 generated texts using 16 automated metrics (13 primary, 3 secondary confirmatory). The primary theoretical contribution of this thesis is the analytical proof that the multip- licative mask (𝑊 = 𝐺 × 𝑄) exhibits a structural range-mismatch: the rapid exponential decay of the Gaussian component nullifies the quantum component’s long-range reso- nance peaks at the order of 10−54 in the representative 𝜎 = 4, 𝜃𝑠𝑐𝑎𝑙𝑒 = 0.10 configuration, and between 10−7 and 10−280 across the entire analyzed hyperparameter grid (analytical feasibility analysis), thereby precluding any synergistic interaction in the Hybrid arm. The quantum component, when tested in isolation (Quantum-only arm), remained active across the full sequence length and produced measurable structural shifts relative to the Base model; however, these shifts did not translate into systematic improvements in proxy creativity metrics. Furthermore, this limited effect was markedly weakened as model scale increased, particularly in proxy creativity and diversity metrics. Finally, the study identifies the fragile nature of widely used automated proxy creativity metrics that rely on superficial keyword counting and demonstrates their inadequacy in capturing qualitative structural shifts. In addition, the secondary blinded LLM-as-judge evaluation found no significant quality or creativity difference between the experimental arms; while the strong position bias detected in the judge provided independent evidence of the structural fragility of autonomous creativity evaluation methods.
dc.identifier.orcid000900024709422X
dc.identifier.urihttps://hdl.handle.net/11630/29104
dc.language.isotr
dc.publisherFatih Çağrı Bilgehan
dc.relation.publicationcategoryTez
dc.rightsinfo:eu-repo/semantics/openAccess
dc.subjectDikkat mekanizması
dc.subjectPre-softmax dikkat modülasyonu
dc.subjectEğitimsiz (zero-shot) modülasyon
dc.subjectMenzil-uyumsuzluğu
dc.subjectYükseltilmiş kosi- nüs çekirdeği
dc.subjectOtomatik yaratıcılık ölçümü.
dc.subjectAttention mechanism
dc.subjectPre-softmax attention modulation
dc.subjectTraining-free (zero- shot) modulation
dc.subjectRange-mismatch
dc.subjectRaised-cosine kernel
dc.subjectAutomated creati- vity evaluation.
dc.titleBüyük dil modellerinde eğitimsiz statik dikkat maskelemenin yapısal sınırları: Çarpımsal modülasyon üzerine mekanistik bir inceleme
dc.title.alternativeStructural limits of training-free static attention masking in large language models: A mechanistic investigation of multiplicative modulation
dc.typeMaster Thesis

Dosyalar

Orijinal paket

Listeleniyor 1 - 1 / 1
Yükleniyor...
Küçük Resim
İsim:
10758304.pdf
Boyut:
1.08 MB
Biçim:
Adobe Portable Document Format

Lisans paketi

Listeleniyor 1 - 1 / 1
Yükleniyor...
Küçük Resim
İsim:
license.txt
Boyut:
1.17 KB
Biçim:
Item-specific license agreed upon to submission
Açıklama: