Büyük dil modellerinde eğitimsiz statik dikkat maskelemenin yapısal sınırları: Çarpımsal modülasyon üzerine mekanistik bir inceleme
| dc.contributor.advisor | Aslan, Özkan | |
| dc.contributor.author | Bilgehan, Fatih Çağrı | |
| dc.date.accessioned | 2026-10-09T06:57:55Z | |
| dc.date.issued | Temmuz, 2026 | |
| dc.department | Enstitüler, Fen Bilimleri Enstitüsü, Bilgisayar Ana Bilim Dalı | |
| dc.description.abstract | Büyük dil modellerinin (LLM) temelini oluşturan öz-dikkat mekanizması, deterministik doğası gereği dilin yapısal tutarlılığını korurken metinsel yaratıcılığı kısıtlayabilmektedir. Bu yüksek lisans tezinde, söz konusu yaratıcılık-tutarlılık ödünleşimini eğitim gerektir- meden (zero-shot) ele almayı hedefleyen statik bir çarpımsal dikkat maskeleme yöntemi (BAW) önerilmiş ve mekanistik sınırları kapsamlı biçimde analiz edilmiştir. BAW yöntemi, dikkat matrisi üzerine doğrudan etki eden çarpımsal bir ağırlık meka- nizmasıdır. Yerel sözdizimsel bağları koruyan Gaussian bir bileşen ile kuantum dönüş kapısının (RX) ölçüm olasılığı formundan (cos2) esinlenen, matematiksel olarak periyo- dik bir yükseltilmiş-kosinüs (raised cosine) çekirdeği olan ve uzak bağlamlarda periyodik dikkat kontrastı yeniden ölçeklemesi sağlayan kuantum-esinli bir bileşenin entegrasyonun- dan oluşur. Mekanizma, GPT-2 mimari ailesinin üç ölçeğinde (Small, Medium, Large), dört farklı kolda (Taban, Gaussian, Kuantum, Hibrit) toplam 108.000 metin üzerinde 16 otomatik metrikle (13 temel, 3 ikincil doğrulayıcı) değerlendirilmiştir. Tezin en temel teorik katkısı, çarpımsal maskenin (𝑊 = 𝐺 × 𝑄) yapısal bir menzil- uyumsuzluğu taşıdığının analitik olarak ispatlanmasıdır: Gaussian bileşenin hızlı üstel sö- nümlenmesi, kuantum bileşeninin uzak-menzil rezonans zirvelerini temsili 𝜎 = 4, 𝜃𝑠𝑐𝑎𝑙𝑒 = 0.10 konfigürasyonunda 10−54; incelenen hiperparametre ızgarasının tamamında (analitik fizibilite analizi) ise 10−7–10−280 aralığında sıfırlayarak hibritte sinerjiyi engellemiştir. Kuantum bileşeni izole olarak (Quantum-only kolunda) tüm dizi boyunca aktif kalmış ve Base modele kıyasla ölçülebilir yapısal kaymalar üretmiş; ancak bu kaymalar yaratıcılık vekil (proxy) metriklerinde sistematik bir üstünlüğe dönüşmemiştir. Ayrıca bu sınırlı etki, özellikle yaratıcılık ve çeşitlilik proxy metriklerinde model ölçeği büyüdükçe belirgin biçimde zayıflamıştır. Son olarak, yaygın kullanılan otomatik yaratıcılık proxy metrikle- rinin yüzeysel anahtar kelime sayımına dayanan kırılgan yapıları tespit edilmiş; niteliksel kaymaları algılamada yetersiz kaldıkları gösterilmiştir. Buna ek olarak gerçekleştirilen körleştirilmiş büyük dil modeli hakem (LLM-as-judge) ikincil değerlendirmesi de kollar arası anlamlı bir kalite veya yaratıcılık farkı bulamamış; hakemde tespit edilen güçlü po- zisyon yanlılığı ise otonom yaratıcılık değerlendirme yöntemlerinin yapısal kırılganlığına bağımsız bir gösterge sunmuştur. | |
| dc.description.abstract | The self-attention mechanism underlying large language models (LLMs) inherently rest- ricts textual creativity while preserving structural coherence due to its deterministic na- ture. This master’s thesis proposes and mechanistically analyzes a training-free (zero-shot) static multiplicative attention masking method (BAW) designed to address the creativity- coherence trade-off. The BAW method is a multiplicative weight mechanism acting directly upon the attention matrix, integrating a Gaussian “local stability” component that preserves local syntactic dependencies with a component inspired by the measurement-probability form (cos2) of the quantum RX rotation gate, mathematically a periodic raised-cosine kernel, that periodically rescales attention contrast at distant token positions. The mechanism was evaluated across three scales of the GPT-2 architectural family (Small, Medium, Large) in four experimental arms (Base, Gaussian, Quantum, Hybrid) over 108,000 generated texts using 16 automated metrics (13 primary, 3 secondary confirmatory). The primary theoretical contribution of this thesis is the analytical proof that the multip- licative mask (𝑊 = 𝐺 × 𝑄) exhibits a structural range-mismatch: the rapid exponential decay of the Gaussian component nullifies the quantum component’s long-range reso- nance peaks at the order of 10−54 in the representative 𝜎 = 4, 𝜃𝑠𝑐𝑎𝑙𝑒 = 0.10 configuration, and between 10−7 and 10−280 across the entire analyzed hyperparameter grid (analytical feasibility analysis), thereby precluding any synergistic interaction in the Hybrid arm. The quantum component, when tested in isolation (Quantum-only arm), remained active across the full sequence length and produced measurable structural shifts relative to the Base model; however, these shifts did not translate into systematic improvements in proxy creativity metrics. Furthermore, this limited effect was markedly weakened as model scale increased, particularly in proxy creativity and diversity metrics. Finally, the study identifies the fragile nature of widely used automated proxy creativity metrics that rely on superficial keyword counting and demonstrates their inadequacy in capturing qualitative structural shifts. In addition, the secondary blinded LLM-as-judge evaluation found no significant quality or creativity difference between the experimental arms; while the strong position bias detected in the judge provided independent evidence of the structural fragility of autonomous creativity evaluation methods. | |
| dc.identifier.orcid | 000900024709422X | |
| dc.identifier.uri | https://hdl.handle.net/11630/29104 | |
| dc.language.iso | tr | |
| dc.publisher | Fatih Çağrı Bilgehan | |
| dc.relation.publicationcategory | Tez | |
| dc.rights | info:eu-repo/semantics/openAccess | |
| dc.subject | Dikkat mekanizması | |
| dc.subject | Pre-softmax dikkat modülasyonu | |
| dc.subject | Eğitimsiz (zero-shot) modülasyon | |
| dc.subject | Menzil-uyumsuzluğu | |
| dc.subject | Yükseltilmiş kosi- nüs çekirdeği | |
| dc.subject | Otomatik yaratıcılık ölçümü. | |
| dc.subject | Attention mechanism | |
| dc.subject | Pre-softmax attention modulation | |
| dc.subject | Training-free (zero- shot) modulation | |
| dc.subject | Range-mismatch | |
| dc.subject | Raised-cosine kernel | |
| dc.subject | Automated creati- vity evaluation. | |
| dc.title | Büyük dil modellerinde eğitimsiz statik dikkat maskelemenin yapısal sınırları: Çarpımsal modülasyon üzerine mekanistik bir inceleme | |
| dc.title.alternative | Structural limits of training-free static attention masking in large language models: A mechanistic investigation of multiplicative modulation | |
| dc.type | Master Thesis |










