Ljudski mozak i računalni jezični modeli: ista pre

poruka: 9
|
čitano: 2.346
1
+/- sve poruke
ravni prikaz
starije poruke gore
Ovo je tema za komentiranje sadržaja Bug.hr portala. U nastavku se nalaze komentari na "Ljudski mozak i računalni jezični modeli: ista pre".
18 godina
offline
Ljudski mozak i računalni jezični modeli: ista pre

Ukratko, LLM radi potpuno isto kao mozak, next token/word prediction. 

 

"Mozak to radi kao živo, utjelovljeno, osjetljivo, pristrano i genijalno biološko tkivo. LLM to radi kao matematički model treniran na tekstu, bez svijesti, bez iskustva i bez vlastite odgovornosti."

 

A ovakvi komentari vise spadaju u nekakve religijske textove nego u znanstveni clanak. Niti imamo jasnu definiciju sto je zivo a sto nezivo, sto je svijest al smo eto sigurni da mi to imamo a LLM nema.

 

Tocno je jedino da je mozak bioloski a AI nije. 

Moj PC  
3 2 hvala 0
8 godina
offline
Re: Ljudski mozak i računalni jezični modeli: ista

Opaaa, ovdje se otišlo u izravno cherry-picking, u izdvajanje jedne rečenice uz preskakanje većine argumenata koji su u tekstu itekako razrađeni! Čestitamo na skraćenom putu logike prema posvemašnjoj falaciji  :-)

Glavna teza članka (za one koji nisu shvatili) nije da su mozak i LLM “potpuno različiti” u svakom smislu, nego je upravo suprotna: da se u obradi jezika susreću na istom informacijskom problemu – kako iz prethodnog konteksta predvidjeti što najvjerojatnije dolazi sljedeće. To je u tekstu više puta izričito rečeno na nekoliko načina.

Iz činjenice da i mozak i LLM koriste prediktivnu logiku uopće ne slijedi da “rade potpuno isto”. LLM je treniran na tekstualnim obrascima (a ne na osobnom iskustvu i životnim situacijama, jer se u njima nikada nije našao) i predviđa sljedeći token kroz matematički model, vektore i transformer arhitekturu. Mozak predviđa u živom organizmu, kroz senzorne, motoričke, emocionalne, memorijske i socijalne sustave. Jezik je mozgu samo jedan dio opće prediktivne obrade svijeta.

 

Što se tiče svijesti, iz toga što nemamo konačnu filozofsku definiciju ne slijedi da je jednako utemeljeno pripisivati svijest LLM-u kao i ljudskom mozgu. Trenutno imamo vrlo dobre razloge reći da LLM proizvodi jezično uvjerljive nastavke, a nemamo dobar dokaz da ima subjektivno iskustvo, utjelovljeno značenje ili odgovornost. A to su karakteristike ili izravne posljedice svijesti, kako god ju mi definirali.

 

Rečenica da je mozak “živo, utjelovljeno, osjetljivo, pristrano i genijalno biološko tkivo”, a LLM “matematički model treniran na tekstu” nije religijska tvrdnja (to si napisao samo da nešto napišeš, a da dobro zvuči, jel'da?), nego sažeta razlika između biološkog sustava i računalnog modela. Bilo bi pošteno da si priložio suvisli argument kojim se dokazuje mozak NIJE živo biološko tkivo i NIJE središte nečega što (ovako ili onako) definiramo kao svijest... ili argument koji dokazuje da jezični model JESTE živ i da posjeduje svijest, a ne samo sklop riječi kojima nas u to pokušava uvjeriti.

 

Najkraće: LLM i mozak dijele prediktivnu logiku u obradi jezika. To im je važna sličnost. Ali “sličan informacijski problem” nije isto što i “potpuno isti sustav”.
I ptice i kukci i avioni rješavaju problem leta, ali to još uvijek ne znači da to bumbar radi isto kao Boeing, niti da ne možemo znati je li Boeing živo biće.

Ili jesmo, ili nismo! Ili ono treće...
Poruka je uređivana zadnji put ned 28.6.2026 10:20 (Doc Berecki).
18 godina
offline
Re: Ljudski mozak i računalni jezični modeli: ista
Doc Berecki kaže...

 

Iz činjenice da i mozak i LLM koriste prediktivnu logiku uopće ne slijedi da “rade potpuno isto”. LLM je treniran na tekstualnim obrascima (a ne na osobnom iskustvu i životnim situacijama, jer se u njima nikada nije našao) i predviđa sljedeći token kroz matematički model, vektore i transformer arhitekturu. Mozak predviđa u živom organizmu, kroz senzorne, motoričke, emocionalne, memorijske i socijalne sustave. Jezik je mozgu samo jedan dio opće prediktivne obrade svijeta.

 

 

 Zato mi je smijesno kada ljudi vide napredak LLM-a i misle da AGI eto samo sto nije...

17 godina
offline
Ljudski mozak i računalni jezični modeli: ista pre

-klasični problemi kako nešto kao znanje ili informaciju kvalitetno prenjeti i kome.. 'sarma'.

-problem medija, 'širokih narodnih masa..' tj ciljana publika je što šira iz rakursa medija-marketinga-reklame-klikbajtova.. ograničenog znanja i stručne terminologije kako bi mogli 'učestvovati' u razgovoru, dok bi kvalitetna-stručna publika bila ograničena na 'onu dvojicu..' i time nije marketinški zanimljivo, pa pobjeđuje 'popularno-znanstveni' pristup-kriterij, jezika-opsia .. svega.

 

-dali je lako kvalitetno pisati textove-članke?

-nije, ni jedan posao nije lagan, mada nam kao gledatelju može tako izgledati, npr skok balerine, drvosječa, portir, učitelj, direktor..

-kao i problem širine nužnog znanja da bi čitatelj uopće mogao sudjelovati, razumjeti.. (ili se svodi na 'vjersku temu-dogmu', jer 'netko tako kaže'...).

-što je potrebno za npr priču o elektronici? čitatelj mora nešto znati o struji, komponentama, tranzistor-otpornik, što je ohm-otpor, što napon, dok programer mora znati koji pin čipa šalje podatak kao i protokol..

 

-čemu ovaj uvod? .. tokenizacija, pokušaj opisa-objašnjavanja čitatelju što je token.. odnosno, u matematici bi to bilo nula-jedan (vektorska jedinica) i brojevi do recimo 10 u dekadskom sustavu, ono što djeca uče uz abecedu.. može li se pričati o matematici ako čitatelj ne zna brojeve-brojati? .. može li električar-elektroničar ako ne zna pročitati oznaku pnp ili colourcod crte otpornika nešto napraviti, razumjeti što koji dio-modul radi? može li u bilo kojoj struci sudjelovati osoba koja o toj struci ne zna ništa, ni nazive-oznake onog o čemu se govori, kao nužno da bi se bilo koja komunikacija ili prijenos informacija mogli prenjeti, tj ne samo prenjeti, kao knjiga pisana nepoznatim pismom, nego prenjeti s razumijevanjem, što bi bilo u takvoj usporedbi, knjiga koju možemo pročitati, tj informacija.. ono osnovno za znanost-znanje.

-tako se vrlo dobro, 'pitko', opiše laiku što je tokenizacija, onaj dio, zašto je nešto medicinskog logički povezano s pojmovima kao bolnica, liječnik, pacijent .. i to je ok, nužan-početni korak, no tad se vraćamo na problem, za kog su pisani textovi-članci? .. one kojima je sve nužno prethodno objasniti? što da pišemo o kuhanju, elektronici, matematici.. i da moramo prethodno objasniti osnove, brojeve, tranzistore, brašno.. a ako pišemo 'stručnije' tad sužavamo ciljanu klikbajt publiku, pri čemu široko popularni članci ili bug-forum kao izvor nisu prvo mjesto, tj tu je logičnije pisati za široke narodne mase za sve teme osim pc-it, ako uzmemo da smo nešto kao pc-publika.. no nismo, većina nije, jer većina ne zna što je token, jer većina nisu programeri, a riječ su vjerojatno čuli posljednjih godina upravo u kontekstu ai-ja koji se svakodnevno pojavljuje u bilo čemu, pa i u domaćim 'ai-firmama' koje dilaju hidratizacijsku kremicu a poveznica s aijem je besmisleno-legalan naziv obrta.. onak, osjećaj kao kad pojedeš lošu kremšnitu i ne možeš ni prdnuti ko čovjek.. :)

-treba li kemičaru objašnjavati tablicu elemenata.. i dodatak, svi smo učili barem osnove kemije, pa je to dovoljno široko opće znanje.. kao što smo svi učili brojeve-slova, povijest-zemljopis.. opće znanje, nužno za sudjelovanje u bilo kojem sadržaju pa i banalno gledanju filmova kaubojaca ili elijenaca.. ono da znamo da su kauboji na zapadu i prebrojavaju krave a elijenci putuju kroz vrijeme-prostor pa nas znanje povijesti o piramidama nekako na kraju filma spasi dok grozničavo tražimo 5-element .. :) ..

-nije tablica elemenata slučajno bez razloga upravo tako organizirana-složena, prirodno, periodički.. uz grupaciju metali, plemeniti plinovi itd.. korelacijski pandan tokenizaciji bolesti i riječi pacijent-liječnik.. postoji razlog, veza, pravilo.. logika i zakoni, prirodni, oni jači od proizvoljnih tumačenja..

 

-no što čitatelj informativnog stvarno primi, konzumira i razumije.. u ovom po meni vrlo dobrom primjeru laičkog približavanja objašnjenja riječi token-tokenizacija, što bi trebala biti primarna težnja ovakvog članka.. ono da juzer razumije, da zna.. kao što zna brojeve 1,2,3.. pa može razumjeti koncept 2+2=4 .. no, može li prosječan čitatelj razumjeti članak tj fokusiram na dio tokena.. a taj token je nešto kao 'atom', temeljna čestica kojom se gradi baza logičkog modela, aija.. da zidamo kuću to bi bila recimo cigla, beton, daska-čavao-čekić.. da pečemo kruh, brašno-voda..

-pohvalno za autora (klasični berecky) vrlo dobro za laike-čitko opiše tokenizaciju, .. i krene u ono čemu to ekšli služi, idući korak, jer nije smisao cigle biti cigla, nego cigla služi da izgradimo potrebno, kuću ili što želimo.. cilga sama za sebe je 'besmislena', čak ako je prodajemo za cenera :) .. krene u vektorizaciju, problem, jer tu jednostavno gubi čitatelja koji kao učenik blijedo gleda ploču, no ne razumije dalje ništa.. ostao je na brojevima od 1 do 10.. nije prošao zbrajanje-množenje a treba korjenovati... izgubljen (bez prijevoda) :) ..

 

-no zašto pisac bilo kojeg kvalitetnog članka, koji naginje znanstvenom.. ima problem razumljivog pisanja.. jer ne može objasniti svaki korak, pojam, preširoke teme da bi u jednom članku-odlomku bio sve.. kao i to da pojedini autor ne može sam biti stučan za sve, ako zna kemiju, možda ne zna programiranje.. a ovo je primarno ili ipak pc-it tema, ai, llm, .. i ono što se pod zamućenim pojmom vektorizacije opisuje je ekšli odavno poznata, obična, relacija u bazi podataka.. iz kojeg se razloga i nazivaju relacijske baze.. dakle, prosječan čitatelj bi tad trebao znati što je npr baza (podataka) .. i recimo da to okvirno zna, kao pojam-značenje, kao što recimo zna što je file .. (*nix, sve je file..) :) .. kratka povijest, prvo ih nema, pa ih izmisle, prvo sekvencijalne (traka-kaseta..) pa zatim razvojem memorija-diskova, ... relacijske, gdje možemo po potrebi dohvatiti bilo koji potreban podatak na bilo kojem dijelu memorijskog prostora.. za što nam naravno treba neka relacija-odnost, put-putokaz-pointer-link.. kao što ceste vode u rim ili bilo kamo, no da bi znali to kamo moramo imati putokaze-oznake, kao što na otporniku mora biti deklariran otpor da bi znali gdje ga možemo-nemožemo iskoristiti, kao što u rečenici postoji točka, odlomak.. ili u priči fabula.. kao što elementi (kemijski) nisu nabacani, nego strukturirani, organizirani, s razlogom.. odnosno već takvim asocijacijama možemo uvidjeti 'pattern' (pravilo-sličnost-ponavljanje-uzorak..) u mada različitim granama-strukama, osnovna logika je 'ista'.. za sve postoji neka 'relacija'.. kao što sam SQL upit na bazu u samom nazivu kaže što je i čemu služi u relacijskoj bazi podataka.. 

 

-i sad ono, obilaznica koja stiže cilju.. zašto ovaj postić.. pa zato. :) .. jer imamo problem, buzzworde, pretakanje iz šupljeg u prazno, maglovito zamagljivanje iz raznih razloga, npr ai-vlasnik želi da investitori ulože trilijarde u njegove dionice.. no dok prodaje maglu ne želi objasniti stvarne činjenice, nego izmisli novi metajezik, termine, pojmove.. tj već par desetljeća u programiranju nemamo stvarni pomak nego izmišljanje novih termina-naziva, kao da za boju npr zelenu izmislimo novu riječ, karikirano plava .. i da to radimo rutinski desetljeće, pri čemu baš nitko više ne može pratiti nit, dok bilo tko izvan struke 'mudro šuti' pa tako npr berecky neće (jer nije ni pozvan) kritizirati ili primijetiti taj problem, nego će naprosto koristiti zadane termine-riječi, kao riječ AI ili LLM .. i riječ token-tokenizacija.. odnosno, svi 'moramo' korititi istu terminologiju, neovisno što o njoj mislimo, dok oni koji to 'razvijaju' brže izbacuju nove pojmove nego što ih možemo konzumirati, obraditi.. uz poplavu pseudoznanstvenih članaka ili studija-radova.. masa koja se generira eliminira mogućnost kvalitetne kontrole, kao i tempo koji nameću da se terminologije usvoje, npr covid19-pandemija=kriza=hitnost.. i tad nema vremena testirati cjepiva, opravdano-logično.. no znamo da je to i loše, jer lijekove treba testirati i zato postoji rigorozan normalan protokol.. ne da ga zaobiđemo, ne bez razloga.. a to već desetljećima radimo rutinski u svim znanstvenim granama, popularizacijom-masom..

 

-što je token? .. a što je relacija? što je cigla-beton-daska-čavao? što je šaraf-matica? što je šaraf bez matice ili matica bez šarafa, oboje bez alata koji je kompatibilan, koji je upravo napravljen da bi zategnuo maticu kao ključ-šarafciger-gedora..

-tokenizacija, vektorizacija.. riječi koje zamagljuju maglu, odnosno juzer koji zna što je baza, što je dizel gorivo, što je voda, što je zid.. (ako to ne zna, ništa, imat će probleme u životu ako preživi..) .. dakle, na bug forumu unutar teme je za očekivati da čitatelj zna osnovno, što je baza.. ne da zna sve, ne da koristi ili da zna bilo što, ne znam skoro ništa o nafti, no znam koje gorivo moram ili ne smijem natočiti, kao i to što je voda i da to ne miješam.. nisam kemičar, nije ni onaj bantucrnac ili čoban u zagori, ne zna ništa, no zna što je voda.. kao i da ne može glavom kroz zid mada mu vektor F nije bio jasan na satu fizike :) ..

 

-što je problem? problem je kvalitetna kmunikacija.. za što je preduvijet postojanje protokola, standarda, značenja.. slovo-broj, text, riječ.. značenje koje nakupina slova na ekranu ima.. ako stalno izmišljavamo nove riječi-značenja-termine.. u svrhu 'zamagljivanja' kako bi biznis mambođambo promo slajdovima privukao novac, tad ne žele znanje, informacije.. žele prezentaciju i zato stvaraju 'termine' umjesto proizvode.. čak se može reći da umjesto proizvodnje proizvoda, proizvode termine, riječi koje dobijaju značenje ili ga mijenjaju.. i umjesto da naučimo nešto novo, kao kuhar koji pročita novi recept, mi konstantno moramo učiti-usvajati nove termine-značenja, kao učiti novi jezik, prevoditi knjigu-sadržaj samo da bi ga mogli 'razumjeti' i posao se sveo upravo na to, ne prijenos informacija, nego zatrpavanje količinom koju prvo moramo 'prevesti' odnosno naučiti 'novi jezik' da bi ispunili osnovnu svrhu informacija-komunikacija.. zamislimo da se svaki dan izmisli novi motor za auto, koji traži novo gorivo, bacamo stari auto-gorivo, radimo novo gorivo, no sutra opet novi auto traži novo.. umjesto da vozimo auto, bavimo se gorivom.. prijevodom, sporazumijevanje.. koje na kraju dođe na nivo 'indijanskog prstvonog piđiningliša', jer nekako se kao ljudi razumijemo, no ne baš precizno... ili s mađarima :) ..

 

-zašto je potrebna nova riječ, kao token-tokenizacija ili LLM za AI biz-balon? .. pa da biznis kaže, to je ekšli stara-poznata baza podataka.. ovako kaže NOVO! neviđeno!! prvi put u vašem gradu (ili selu)!!!!.. naravno da će novac ići na 'novo' ne na staro-postojeće... i naravno, 'još samo danas..' pa tko zakasni, ne uskoči u vlak, ostaje-gubi.. ne razmišljati puno, nego naglavačke uskočiti, novac.. mediji su u tome samo mediji dok su i kvalitetni autori ponekog članka ograničeni ljudskim gabaritima, sizifovski-nemoguće protiv takve mase i nemoguće za sve grane-struke-termine koji se umixaju unutar jedne 'manje' teme-članka.. ne možemo stalno sve provjeravati, dio jednostavno moramo uzeti kao 'takvo' (kao činjenicu, dogmu, bez provjere.. možemo provjeriti no to je 99% gubljenje vremena, npr provjeravati jesu li sve vrećice čipsa s točno 200g čipsa ili kilogram šećera s točno 1000g šećera.. uzaludno i većinom beskorisno, 'vjerujemo' deklaraciji).

-tako umjesto čitanja s razumijevanjem, kritički-znanstveno, čitamo 'vjerski' ono što piše, jer je previše raznih dijelova povezano, u svakom bizu-poslu-struci.. odnosno za sve tad postoje timovi stručnjaka koji to rade, no u ovom postu smo samo čitatelj-pojedinac (u jednini, osoba).. i ako znamo kemiju, ne znamo zemljopis, programiranje, kuhanje, zidanje.. spoj znanja koji se isprepleću u životu, u svemu.. pa do tog da je bolje šutjeti i ne ispasti glup ili iz vlaka.. (što mene ne spriječava, uz plahte loremipsuma..) :)

 

-berecky odlično laiku približi neki termin kao token, tražiti da jednako približi i ostale termine u jednom članku je nerealno..

-pogotovo dio koji gura biz-mediji, masu-termine koje štancaju umjesto sadržaja-informacija-činjenica, koristan teret-roba vs ambalaža.

-pa tad možda u nekom idućem članku-temi.. npr što je vektorizacija podataka takvog tokeniziranog opisa.. umjesto rečenice koja kaže, da dobija matematički opis-reprezentaciju .. vektor i staviti to u 'korelaciju' s već postojećim znanjem, kao relacijska baza.. tj novi dio se odnosi na tehnološki napredak u npr brzini, kao što je bakreni mrežni cat5e kabel do 1gbit a optički 10-100gbita.. brža mreža omogućava brži prijenos podataka, obradu, kao i novi buzzword u tome 'neuronske mreže' .. a sve zajedno daje 'super-ai-bazu' na kojoj se llm trenira.. onak, nogometaš se trenira na livadi, puca loptu u gol.. ponekad pogodi :) .. ali da, to je osnovni model, čoban čuva ovčice, portir čuva firmu, rade isti posao kao što šaraf i matica drže bilo koji spoj bilo na autu ili psećoj kućici.. i sve to možemo razumjeti s osnovnim znanjima kao ljudi-djeca, pa .. 'samo netko to treba pretočiti u čitljivo-prenosivo štivo'.. naravno, ne ja, jer od mojih postića većinu samo boli glava i ode scroll.. no možda ponekad to napravi netko tko zna, kao za tokenizaciju u ovom primjeru.. i ovo je post o toj jednoj riječi, primjer, konotacije.. ciglica u dijelu kuće, ako gledamo što je naslov teme, ljudski mozak.

- Zamislite koliko veće-kompleksnije tad takva tema mora biti obuhvaćena da bi bila 'čitljiva' tj razumljiva...?

C64/TurboModul-OpenSourceProject.org.cn.部分作品为网上收集整理,供开源爱好者学习使用
Poruka je uređivana zadnji put ned 28.6.2026 11:26 (ihush).
 
0 0 hvala 0
17 godina
offline
Re: Ljudski mozak i računalni jezični modeli: ista
knight kaže... 

 Zato mi je smijesno kada ljudi vide napredak LLM-a i misle da AGI eto samo sto nije...

 AGI je samo stepenica prema ASI: Artificial Super Intelligence

 

 

Poruka je uređivana zadnji put ned 28.6.2026 12:48 (zzib).
18 godina
offline
Re: Ljudski mozak i računalni jezični modeli: ista
O cemu ti i kakve to veze ima s onim sto sam ja napisao?
17 godina
offline
Re: Ljudski mozak i računalni jezični modeli: ista

O napretku na AGI, zatim ASI: konzervativna očekivanja su 2030-2040 za AGI, 2040-2050 za ASI

18 godina
offline
Re: Ljudski mozak i računalni jezični modeli: ista
Aha. Ok.
8 godina
offline
Ljudski mozak i računalni jezični modeli: ista pre

Token je najmanja jedinica teksta koja ima značenje.
Token je par koji se sastoji od kategorije i leksema.

Na primjer 3 + 1 se sastoji od tri tokena.

("broj",3), ("+", ), ("broj","1")

"broj" i "+" su kategorije, a "3","1" su leksemi.

Preskaču se razmaci i ostala prazna polja.

 

kad parser naleti na token broja 3, gurne token na stek, onda naleti na + i proviri sljedeći token

ako je broj, gurne na stek, zatim ako se radi o interpreteru pozove funkciju "+" koja uzme 2 parametra sa steka i gurne rezultat na stek.

 

ako se radi o compileru, onda prevede na neki drugi jezik.

 

Poruka je uređivana zadnji put ned 28.6.2026 20:45 (gpd).
 
0 0 hvala 0
1
Nova poruka
E-mail:
Lozinka:
 
vrh stranice