Kosinüs benzerliği, iki vektör arasındaki açıyı ölçerek bu vektörlerin ne kadar "aynı yönü gösterdiğini" sayısal olarak ifade eden bir benzerlik metriğidir. Sonuç –1 ile +1 arasında değişir; 1'e ne kadar yakınsa iki nesne o kadar birbirine benzer kabul edilir. Metin ve görsel karşılaştırmada, sahte ürün tespitinden marka koruma sistemlerine kadar pek çok alanda temel ölçüt olarak kullanılır.
Terimin matematiksel tanımı bir cümleye sığar. Uygulamada ise karmaşıklık tam burada başlar: kosinüs benzerliğinin bir ürün ilanı için ne anlama geldiğini, hangi kavramlarla karıştırıldığını ve pratikte nasıl yorumlanması gerektiğini aşağıda bulacaksınız.
Bir pazaryeri ilanını düşünün. Ürün başlığı, açıklaması ve görseli – her biri sayısal bir vektöre dönüştürülebilir. İki ilanın vektörleri arasındaki kosinüs benzerliği yüksekse, bu ilanlar birbirine çok benziyordur. Bu benzerlik tek başına "sahte" demek değildir; ancak yüksek benzerlik skoru, incelenmesi gereken bir risk sinyali üretir.
SahteAvcı gibi araçlar, metin benzerliğini ölçmek için MiniLM-L6-v2 gibi küçük dil modellerinden yararlanır. Model, iki ürün açıklamasını vektöre çevirir; ardından kosinüs benzerliği hesaplanır. Skor yükseldikçe ilanların içerik olarak örtüştüğü anlaşılır. Görsel tarafta ise algısal hash (perceptual hash) yöntemi devreye girer – bu da özünde bir benzerlik ölçümüdür, ama piksel uzayında çalışır.
Peki bu hesaplama marka koruma için neden kritiktir? Bir taklit ürün ilanı çoğunlukla orijinal ürünün açıklamasını kısmen kopyalar, görsellerini çalar ya da çok yakın bir dil kullanır. Kosinüs benzerliği, bu örtüşmeyi otomatik olarak ölçerek analist gözünün kaçırabileceği yüzlerce ilanı önceliklendirir. Takedown sürecine geçmeden önce hangi ilanların gerçekten incelenmesi gerektiği bu skorla belirlenir.
Kosinüs benzerliği birkaç yakın kavramla iç içe geçer. Aralarındaki farkı bilmek, hem teknik belgeleri okurken hem de marka itirazı süreçlerinde doğru dili kullanmak açısından önemlidir.
| Kavram | Ne ölçer? | Fark |
|---|---|---|
| Kosinüs benzerliği | Vektörler arasındaki açı | Yön benzerliğini ölçer; büyüklükten bağımsızdır |
| Öklid uzaklığı | İki nokta arasındaki geometrik mesafe | Büyüklüğe duyarlıdır; kısa metinlerde yanıltıcı olabilir |
| Jaccard benzerliği | İki kümenin ortak eleman oranı | Kelime düzeyinde çalışır; anlam bağlamını yakalamaz |
| Perceptual hash (algısal hash) | Görsel içerikteki yapısal benzerlik | Piksel tabanlıdır; metin vektörü değildir |
| TF-IDF skoru | Bir kelimenin belgede özgünlüğü | Kosinüs benzerliğiyle birlikte kullanılır, onun yerini tutmaz |
Tablo ne gösteriyor? Kosinüs benzerliği, bağlam anlayan modellerin (embedding modelleri) çıktısında en yaygın tercih edilen metriktir. Öteki metrikler farklı soruları yanıtlar.
Bir pazaryerinde iki ilan var. Birincisi: "Orijinal deri cüzdan, el yapımı, kahverengi." İkincisi: "El işi hakiki deri cüzdan – kahve tonu." Bu iki cümle kelime kelime aynı değil. Jaccard benzerliği düşük çıkar. Ama MiniLM gibi bir embedding modeli her ikisini de anlam vektörüne dönüştürdüğünde kosinüs benzerliği yüksek çıkar – çünkü cümleler aynı kavramı farklı sözcüklerle ifade ediyor.
Bu yüksek skor, ilanın sahte olduğunu kanıtlamaz. Meşru bir satıcı da benzer dili kullanıyor olabilir. Ancak bu sinyal, ilanın öncelikli inceleme listesine alınmasını gerektirir. Özellikle ikinci el ürün pazarlarında aynı görsel ya da açıklama farklı ilanlar arasında döngüsel olarak kullanılır; bu da kosinüs benzerliğini güçlü bir erken uyarı aracı yapar.
Marka sahipleri için asıl değer buradadır: yüzlerce ilanı tek tek okumak yerine benzerlik skoru yüksek olanlar önce sıraya girer. Hem orijinal ürün doğrulama hem de taklit ürün şüphesinin ilk tespitinde bu yaklaşım standart hale gelmiştir.
Bu ve benzeri terimlerin sahte ürün tespitinde nasıl bir araya geldiğini takip etmek ister misiniz? SahteAvcı bültenine kaydolun; yeni sözlük içerikleri ve pazaryeri analizleri yayımlandığında size ulaşalım: bülten kaydı.
Evet. Kosinüs benzerliği bir matematiksel ölçüm tekniğidir; yasal ya da yasadışı olması söz konusu değildir. Bu yöntemi kullanan sistemlerin topladığı verilerin ve ürettiği kararların hangi yasal çerçevede değerlendirileceği ayrı bir sorudur. Veri işleme boyutu için KVKK ve delil toplama sınırları konusuna bakmanızı öneririz.
Hayır. Kosinüs benzerliği bir analiz aracıdır; taklit ürün ise hukuki ve ticari bir kavramdır. Yüksek benzerlik skoru, bir ilanın incelenmesi gerektiğine işaret eder; o ilanın sahte olduğunu kanıtlamaz. Kesin bir değerlendirme için ek delil ve insan gözü gereklidir.
Uygulama genellikle şu adımlarla işler: metin ya da görsel vektöre dönüştürülür, ardından iki vektör arasındaki açının kosinüsü hesaplanır. SahteAvcı'da temel metin analizi tarayıcınızda yerel olarak çalışır. Gelişmiş modeller için kendi API anahtarınızı (BYOK) bağlarsanız, görseller seçtiğiniz API sağlayıcısına gönderilir. Ayrıntılar için eklenti indirme sayfasına bakabilirsiniz.