»

ByteDance trenira največji model umetne inteligence doslej

Slo-Tech - ByteDance, ki ga poznamo kot lastnika TikToka, pripravlja veliki jezikovni model, s katerim želi preseči tudi veliki Anthropicov Mythos. Dosedanji največji kitajski model je Moonshotov Kimi K3, ki ima 2800 milijard parametrov, novi ByteDanceov model pa bo imel trikrat več parametrov, torej 10.000 milijard. Po poročanju virov blizu podjetja so nedavno začeli prvo fazo priprave (pre-training), ki traja od tri do šest mesecev, ki ji potem sledi še fino prilagajanje (fine tuning).

Velikost Mythosa 5 uradno ni znana, poznavalci pa jo ocenjujejo na 8.000 milijard parametrov. Nekoliko šibkejši Fable 5 naj bi sestavljalo 5.000 milijard parametrov. Število parametrov je pomemben dejavnik, od katerega je odvisna zmogljivost modela, še zdaleč pa ni edini. Zato seveda ne moremo trditi, da bo novi ByteDanceov model boljši od Antropicovih, se jim bo pa verjetno zelo približal.

Kitajska podjetja že vse od preplaha konec minulega leta, ko je DeepSeek celo zatresel zahodne borze, dokazujejo, da...

0 komentarjev

Kdo je Kimi K3 in kaj zmore?

Slo-Tech - Kitajsko podjetje Moonshot je ta teden predstavilo svoj model generativne umetne inteligence Kimi K3, ki ima 2800 milijard parametrov in je po besedah avtorjev primerljivo kakovosten kot veliki zahodni modeli. Kimi K3 je odprtokodni model, njegovo kodo pa bodo javnosti razkrili čez dober teden. O njegovih sposobnostih bomo lahko podrobno sodili 27. julija, ko bo postal tudi največji prostodostopni model.

Model uporablja Kimi Delta Attention in Attention Residuals ter lahko dela na vhodnih podatkih, ki so veliki do milijon žetonov. Po golih sposobnostih še nekoliko zaostaja za najzmogljivejšima Claude Fable 5 in GPT 5.6 Sol, ne manjka pa mu veliko, trdijo. Kitajski modeli so se v zadnjih mesecih izdatno izboljšali (start-upi DeepSeek, MiniMax, z.ai izdajajo svoje modele kot po tekočem traku), obenem pa tudi podražili. Kimi K3 je najdražji kitajski model, a še vedno pol cenejši kot GPT-5.6 Sol, ocenjujejo analitiki iz Bank of America. Moonshot pravi, da stane milijon izhodnih...

42 komentarjev

Mythos 5 in Fable 5 dobila zeleno luč za vrnitev

Slo-Tech - Ameriška administracija je tudi uradno prižgala zeleno luč za vrnitev modelov Mythos 5 in Fable 5, ki ju je moral Anthropic zaradi omejitev začasno umakniti. Iz podjetja sporočajo, da bodo uporabniki z današnjem dnem dobili dostop do njiju, bo pa postopek postopen.

ZDA so 12. junija modela uvrstile na seznam tehnologij, katerih izvoz brez posebnih dovoljenj ni možen. Ker Anthropic uporabnikov ni mogel razlikovati po prebivališču - tudi iz ZDA bi ga lahko uporabljali tuji državljani - je moral dostop v celoti blokirati. Po treh tednih pogajanj je ministrstvo za trgovino sporočilo, da je Anthropic ustrezno obvladal tveganja, ki jih predstavljajo Mythos 5, Fable 5 in njune prihodnje izboljšave. Poudarimo, da Mythos nikoli ni bil prosto dostopen, saj je že pred tem zapletom Anthropic uporabo dovolil le posebej izbranim partnerjem.

A napredka se ne da držati v škatli. Medtem ko je bil Mythos nedostopen, so kitajski konkurenti začeli izdajati podobne modele. Podobno zmogljiv je tudi...

17 komentarjev

Anthropicov Mythos 5 se vrača

Slo-Tech - Potem ko je ameriška administracija Anthropicu dva tedna preprečevala, da bi svoj model Mythos 5 ponudil strankam, je stališča vendarle omehčala. Včeraj so iz Washingtona sporočili, da so glede na Anthropicova dodatna pojasnila in ukrepe za obvladovanje tveganje spremenili pogoje za licenciranje Mythosa 5. Minister za trgovino Howard Lutnick je v pismu Anthropicu sporočil, da lahko dostop do Mythosa 5 ponovno omogočijo nekaterim poslovnim uporabnikom.

V praksi to pomeni, da bo Mythos 5 na voljo za institucionalne uporabnike iz panog infrastruktura, kibernetska varnost in podobno. Ameriška administracija ni preklicala direktive o izvoznih omejitvah, temveč je za Mythos 5 uvedla nekaj izjem, podobno kot so storili tudi za OpenAI-jev GPT-5.6. Splošna javnost dostopa še vedno nima, a se v Anthropicu trudijo, da bi se to spremenilo. Prav tako ostaja omejen dostop tudi do sestrskega modela Fable 5.

Mythos 5 bo lahko uporabljalo dobrih sto podjetij in organizacij. Med njimi so lahko...

31 komentarjev

DeepSeek R2 zamuja zaradi slabih Huaweijevih čipov

Slo-Tech - Konec minulega leta je kitajski DeepSeek izdal svoj veliki jezikovni model R1, ki so ga na Zahodu opazili januarja in je zaradi domnevno bistveno cenejšega treninga za krajši čas povzročil pravo paniko. Njegov naslednik R2 bi bil moral iziti maja letos, a ga še vedno ni. Po podatkih virov blizu DeepSeeka razlog za zamudo tiči v Huaweijevih čipih, ki so jih skušali uporabiti za trening, a so imeli z njimi nemalo težav.

Po neuradnih podatkih so se čipi Ascend izkazali za neprimerne in nezanesljive. Zaradi tehničnih težav so se na koncu odločili, da bodo uporabili Nvidiine čipe, saj so bili Huaweijevi nestabilni, prepočasni in s slabšo programsko podporo. Huawei je DeepSeeku celo poslal strokovnjake, da bi jim pomagali usposobiti čipe za razvoj modela, a na koncu je projekt padel v vodo. Za trening bodo nujni Nvdiini čipi, se pa DeepSeek trudi, da bi bilo model na Huaweijevih čipih moč vsaj poganjati.

10 komentarjev

OpenAI odgovoril z o3-mini

Slo-Tech - Iztekajoči teden sta močno zaznamovala kitajska modela umetne inteligence DeepSeek in Alibaba Qwen, ki obljubljata primerljive rezultate z zahodnimi modeli ob nekajkrat nižjih stroških. To je preplašilo zlasti trge in proizvajalce čipov, medtem ko se proizvajalci programske opreme novih modelov lahko le razveselijo, saj bodo z manj stroški lahko postorili več. OpenAI je hitro odgovoril in je javnosti odprl model o3-mini, ki je na voljo brezplačno in brez registracije, torej za slehernika.

OpenAI je o3-mini napovedoval in demonstriral že minuli mesec, sedaj pa ga je dal v uporabo. Podobno kot o1-mini je tudi naslednik prilagojen za uporabo v naravoslovno-tehničnih kontekstih, matematiki, računalništvu in programiranju, torej razširjenem STEM. Na voljo so trije podmodeli (reasoning effort option), in sicer nizki, srednji in visoki. Najzmogljivejši presega tudi o1, vsi pa so varčnejši. OpenAI zagotavlja tudi, da o3-mini naredi tretjino manj resnih napak kot o1-mini in se hitreje...

16 komentarjev

Kitajska družba DeepSeek razburkala področje umetne inteligence s poceni jezikovnim modelom R1

Slo-Tech - V približno tednu dni je dotlej malo znano kitajsko podjetje DeepSeek z lansiranjem naprednega velikega jezikovnega modela R1 področje generativnih algoritmov na videz postavilo na glavo: za bistveno nižjo ceno so namreč napravili izdelek, ki se lahko kosa z OpenAI o1.

Prejšnji ponedeljek - ravno na dan Trumpove druge prisege - je malo znano kitajsko zagonsko podjetje DeepSeek predstavilo družino jezikovnih modelov DeepSeek R1. Natančneje, gre za modele z določeno zmožnostjo sklepanja (simulated reasoning - SR), ki v fazi izvajanja postopek odgovarjanja strukturirajo v nekakšno zaporedje argumentiranega iskanja delnih odgovorov, zaradi česar so uporabni predvsem na področju znanosti, matematike in tehnologije. Prvi algoritem takšne sorte so pri OpenAI predstavili lanskega septembra v obliki o1 in torej veljajo za čelo napredka.

Posebnost R1 pa ni zgolj to, da naj bi kitajski startup v zgolj nekaj mesecih dohitel OpenAI, saj naj bi bil R1 po izkazu sila blizu o1, temveč še bolj v...

169 komentarjev