Kosinusa līdzības apgūšana: no vektoru matemātikas līdz reālās pasaules mākslīgajam intelektam

Pēdējā atjaunošana: 08/12/2026
  • Kosinusa līdzība mēra divu vektoru virziena izlīdzināšanu, aprēķinot leņķa starp tiem kosinusu, ignorējot to kopējo lielumu.
  • Šis rādītājs ir būtisks mūsdienu mākslīgajam intelektam, nodrošinot semantisko meklēšanu, personalizētas ieteikumu sistēmas un augstas dimensijas iegulto elementu apstrādi.
  • Lai gan standarta kosinusa līdzība apstrādā elementus kā neatkarīgus, uzlabotas versijas, piemēram, mīkstais kosinuss, integrē elementu attiecības, lai uzlabotu precizitāti.

Representación digital de esferas interconectadas que simbolizan clusters de vectores y datos en una red futurista, ideāls para ilustrar bases de datos vectoriales.

Vai esat kādreiz domājuši, kā Spotify, šķiet, precīzi zina, kura dziesma būs īstā, vai kā Google saprot, ka jūsu meklēšanas vaicājumam ir nozīme kaut kam konkrētam, pat ja jūs neizmantojat precīzus vārdus? Liela daļa maģijas notiek aizkulisēs, izmantojot vektoru iegulšanu . Tā vietā, lai uztvertu vārdus vai vienumus kā vienkāršu tekstu, mākslīgais intelekts tos pārveido par punktiem milzīgā, daudzdimensionālā telpā, un tieši šeit iesaistās kosinusa līdzības koncepcija, lai visu saprastu.

Būtībā šis matemātiskais triks ļauj datoriem noteikt, cik "tuvu" viena otrai atrodas divas lietas, aplūkojot leņķi starp to vektoriem . Tam nav svarīgi, vai viens vektors ir daudz garāks par otru; tam rūp tikai tas, vai tie norāda vienā un tajā pašā vispārējā virzienā. Tas pilnībā maina spēles noteikumus dabiskās valodas apstrādē (NLP) un ieteikumu dzinējos, jo tas koncentrējas uz semantisko nozīmi , nevis tikai uz atbilstošu rakstzīmju salīdzināšanu.

trampa de dependencias de modelos de lenguaje
Saistītais raksts:
La trampa de dependencia de los LLM: límites, sesgos y riesgos

Aprēķina pamati un skrūvītes

Ilustración abstracta de modelos de lenguaje extensos (LLM) y el processmiento semántico de la IA, representando cómo se organzan los conceptos.

Lai saprastu, kā tas darbojas, jums ir jāsaprot, ka katrs datu elements — vai tas būtu vārds vai filma — tiek attēlots kā vektors, kur katra dimensija ir noteikts atribūts. Lai atrastu līdzību, mēs veicam dažas konkrētas darbības. Vispirms mēs aprēķinām skalāro reizinājumu , kas ietver atbilstošo vērtību reizīšanu no abiem vektoriem un to summēšanu, lai redzētu, cik lielā mērā tās ir izlīdzinātas. Pēc tam mēs nosakām katra vektora lielumu (jeb garumu) , apvelkot kvadrātsakni no tā kvadrātā kāpināto komponentu summas.

Pēdējais solis ir faktiskā kosinusa līdzības formula : ņem šo skalāro reizinājumu un dali to ar divu lielumu reizinājumu. Matemātiski tas izskatās šādi: Kosinusa līdzība = (A · B) / (||A|| × ||B||) . Rezultāts ir rādītājs, kas parasti svārstās no -1 līdz 1. Vērtējums 1 nozīmē, ka vektori ir pilnīgi izlīdzināti , 0 nozīmē, ka tie ir ortogonāli (pilnīgi nesaistīti), un -1 nozīmē, ka tie ir diametrāli pretēji.

Perspektīvā: karaļi, karalienes un āboli

Visualización matemática en 3D de dos vectores representados como flechas de neón con un ángulo theta entre ellos, ilustrando el concepto fundamental de la similitud de coseno.

Padarīsim to konkrētu. Iedomājieties tiesību maģistru (LLM), kas apstrādā vārdus “karalis” un “karaliene”. Tā kā šie termini bieži parādās blakus tādiem vārdiem kā “tronis” vai “monarhija”, to vektoru iegulšana norādīs gandrīz vienā virzienā, kā rezultātā tiks iegūts augsts kosinusa līdzības rādītājs . Tagad iemetiet maisījumā vārdu “ābols”. Pat ja tas atrodas vienā dokumentā, tas sakrīt ar tādiem terminiem kā “auglis” vai “dārzs”, tāpēc tā vektors norādīs pavisam citā virzienā, kā rezultātā tiks iegūts daudz zemāks līdzības rādītājs.

Lai viss būtu plūstoši, uzņēmumi to neaprēķina uzreiz katram atsevišķam vienumam. Viņi izmanto vektoru datubāzes . Šie specializētie rīki ir izstrādāti, lai indeksētu daudzdimensionālus vektorus, ļaujot ļoti ātri iegūt līdzīgākās atbilstības, manuāli nepārbaudot visu datu kopu.

Amazon Neptūna datu bāzes grafos
Saistītais raksts:
Amazon Neptune, la base de datos de grafos de AWS para relaciones a escala

Pārsniedzot pamatus: mīkstais kosinuss un citi rādītāji

Standarta kosinusa līdzībai ir trūkums: tā pieņem, ka katra dimensija ir neatkarīga. Tomēr reālajā pasaulē tādi vārdi kā “spēle” un “spēle” ir dažādas dimensijas, bet semantiski saistītas . Šeit noder mīkstā kosinusa līdzība . Tā ievieš līdzības matricu (bieži izmantojot Levenšteina attālumu vai WordNet), lai ņemtu vērā saistību starp pazīmēm, ļaujot modelim efektīvāk vispārināt jēdzienus , pat ja formālās pazīmes atšķiras.

Ir arī vērts to salīdzināt ar citiem izplatītiem rādītājiem. Piemēram, Eiklīda attālums (L2) mēra taisnas līnijas attālumu starp diviem punktiem, kas ir lieliski piemērots telpiskajam tuvumam. Manhetenas attālums (L1) aprēķina attālumu, sekojot režģa veida ceļam. Lai gan šie attālumi mēra absolūto attālumu , kosinusa līdzība koncentrējas tikai uz orientāciju . Pastāv arī skalārā reizinājuma līdzība , kas ņem vērā gan leņķi, gan lielumu. Ja normalizējat vektorus līdz garuma vienībai, skalārais reizinājums un kosinusa līdzība faktiski kļūst par vienu un to pašu, bet skalārā reizinājuma aprēķināšana ir skaitļošanas ziņā lētāka .

Praktiski pielietojumi grafu datos un meklēšanā

Grafiku datubāzu, piemēram, Amazon Neptune un citu grafu sistēmu , pasaulē kosinusa līdzība tiek izmantota, lai atrastu kohēziju starp grupām vai identificētu līdzīgus lietotājus. Piemēram, ja jums ir cilvēku un viņu iecienītāko virtuvju grafs, varat attēlot viņu preferences kā punktu skaita vektorus. Pielietojot kosinusa līdzības algoritmu , varat sarindot lietotājus ar vislīdzīgākajām gaumēm neatkarīgi no tā, vai viena persona novērtē vairāk restorānu nekā cita.

Mūsdienu meklētājprogrammas arī attālinās no tīri leksiskas meklēšanas (piemēram, Ctrl+F) un virzās uz vektoru meklēšanu . Lai gan leksiskā meklēšana ir lieliska tokenizācijai, tā nepamana teksta būtību. Vektoru meklēšana uztver pamatā esošo nolūku . Tādās sistēmās kā Elasticsearch tas tiek ieviests, pārveidojot vaicājumus iegultos elementos un atrodot tuvākos kaimiņus , izmantojot iepriekš apspriestās metrikas, bieži pārveidojot diapazonu no -1 līdz 1 pozitīvā vērtējumā , lai uzlabotu rangu.

Neatkarīgi no tā, vai veidojat filmu ieteikšanas rīku vai sarežģītu mākslīgā intelekta aģentu, pareizās līdzības metrikas izvēle ir atkarīga no tā, vai vektora lielumam ir nozīme. Ja jūs interesē tikai datu “tēma” vai “virziens”, kosinusa līdzība ir labākā izvēle. Tiem, kam nepieciešama neapstrādāta telpiskā attāluma informācija, labākā izvēle ir Eiklīda līdzība. Apvienojot šos matemātiskos rīkus ar efektīviem indeksēšanas algoritmiem , mēs varam pārvērst nestrukturētus datus organizētā, meklējamā cilvēciskās nozīmes kartē.

Related posts: