» »

Kdo je Kimi K3 in kaj zmore?

Kdo je Kimi K3 in kaj zmore?

Slo-Tech - Kitajsko podjetje Moonshot je ta teden predstavilo svoj model generativne umetne inteligence Kimi K3, ki ima 2800 milijard parametrov in je po besedah avtorjev primerljivo kakovosten kot veliki zahodni modeli. Kimi K3 je odprtokodni model, njegovo kodo pa bodo javnosti razkrili čez dober teden. O njegovih sposobnostih bomo lahko podrobno sodili 27. julija, ko bo postal tudi največji prostodostopni model.

Model uporablja Kimi Delta Attention in Attention Residuals ter lahko dela na vhodnih podatkih, ki so veliki do milijon žetonov. Po golih sposobnostih še nekoliko zaostaja za najzmogljivejšima Claude Fable 5 in GPT 5.6 Sol, ne manjka pa mu veliko, trdijo. Kitajski modeli so se v zadnjih mesecih izdatno izboljšali (start-upi DeepSeek, MiniMax, z.ai izdajajo svoje modele kot po tekočem traku), obenem pa tudi podražili. Kimi K3 je najdražji kitajski model, a še vedno pol cenejši kot GPT-5.6 Sol, ocenjujejo analitiki iz Bank of America. Moonshot pravi, da stane milijon izhodnih žetonov 15 dolarjev, medtem ko je cena za Fable 5 okoli 50 dolarjev.

Ob tem se spomnimo na preplah, ki ga je povzročil prihod DeepSeeka, za katerega se je kasneje izkazalo, da vendarle še ne bo zamenjal uveljavljenih modelov. A pokazal je, da se kitajski modeli izboljšujejo, zaostanek za zahodnimi pa hitro zmanjšuje. Odprtokodnost modelov je sicer koristna, zlasti pri razumevanju delovanja in prilagajanju, a ozko grlo za uporabo je že danes razpoložljiva računska moč. Novi kitajski modeli so že prilagojeni na kitajske čipe, ki so cenejši od Nvidijinih.


42 komentarjev

rekakitece ::

AI (LLM) je prva prava globalno-ekonomska stvar, v kateri lahko Kitajska neposredno konkurira (odprtokodnih modelov tudi ne moreš ravno prepovedat), in to zelo uspešno kot vidimo.

WhiteAngel ::

Predvsem odprtost kitajskih modelov me preseneča. Očitno iščejo nišo med developerji in v skupnosti.

temni_princ ::

Hvaležen sem Kitajcem, da izdajajo open weight modele. Če LLM laboratoriji uporabljajo odprte/javne podatke za učenje, se mi zdi prav, da javnosti povrnejo z releasom modela.

iloveboobz ::

kolk časa da tole colibri integrira in se bo dal furat na domačem rigu z polzjo hitrostjo ?:))
smoki

darkotri ::

Polnega? 2,5T? Ja ne vem če ima kdo dovolj VRAMA :))


iloveboobz je izjavil:

kolk časa da tole colibri integrira in se bo dal furat na domačem rigu z polzjo hitrostjo ?:))
darko

pegasus ::

Če ga skvantizirajo na fp4, rabiš samo še cca 10.5TB rama. To je že kar dosegljivo ;)

iloveboobz ::

pegasus je izjavil:

Če ga skvantizirajo na fp4, rabiš samo še cca 10.5TB rama. To je že kar dosegljivo ;)

si mal kiksnu tle... Za fp4 bi rabu za weightse sam še kake ~1.4TB rama :)

darkotri je izjavil:

Polnega? 2,5T? Ja ne vem če ima kdo dovolj VRAMA :))


iloveboobz je izjavil:

kolk časa da tole colibri integrira in se bo dal furat na domačem rigu z polzjo hitrostjo ?:))

govorim o tejle varjanti
https://github.com/JustVugg/colibri

za glm-5.2 rabiš ~24GB da to poganjaš iz diska. verjetno bi za K3 rabu kake 128GB, kar je vseen bistveno bolj dosegljivo kot ~2TB+ za fp4 varjanto.

Ampak as said, izjemno počasno.
smoki

Zgodovina sprememb…

PROTEINSKI ::

Claude Fable 5 RIP

WhiteAngel ::

V čem je fora, da pri domačih modelih context window ne more bit velik 1M?

Ghost7 ::

Novi kitajski modeli so že prilagojeni na kitajske čipe, ki so cenejši od Nvidijinih.


ABOUT F***N TIME!
https://www.bitstamp.net/ref/OM6lA9mwoeRO5Rba/

Zimonem ::

WhiteAngel je izjavil:

V čem je fora, da pri domačih modelih context window ne more bit velik 1M?

Ker mi keširat vse že zgenerirane žetone to pa žre pomnilnik.

Mr.B ::

Smešno je,
da po skoraj petih letih še vedno nisi sposoben opredeliti,
pod kakšnimi pogoji zmagujemo v Ukljani.

tony1 ::

"going on to declare that a "probable outcome of an open-weight-model-dominant world is full AI communism"

:))

Newsflash: cel internet je en komunizem 8-)

iloveboobz ::

smoki

Mr.B ::

Zanima me, kdaj bo TACO imel dovolj spodbude (v $$$), da da bann na uporabo kitajskih AI modelov.
Trenutni finančni model ameriških AI rešitev je v primerjavi s kitajskimi alternativami težko dolgoročno vzdržen.
Smešno je,
da po skoraj petih letih še vedno nisi sposoben opredeliti,
pod kakšnimi pogoji zmagujemo v Ukljani.

Zimonem ::

Zanimivo je da 80% ameriških firm uporablja kitajske lokalne modele, saj nočejo filat anthropicu in openaiju svojih podatkov in datasetov. Sedaj je kampanja, da se to prepove.

enavlaka ::

Kitajski modeli so hardwaresko dosti lažji, tečejo celo na cpu, če si pripravljen potrpeti za odgovor.

Mr.B ::

enavlaka je izjavil:

Kitajski modeli so hardwaresko dosti lažji, tečejo celo na cpu, če si pripravljen potrpeti za odgovor.

Ja smao po tem linku : bomo pocakali :O
Smešno je,
da po skoraj petih letih še vedno nisi sposoben opredeliti,
pod kakšnimi pogoji zmagujemo v Ukljani.

nekikr ::

In jih raje pošiljajo Kitajcem? Mislim, da je cena problem. Plačujem za Gemini in Claude, Claude celo največji paket, pa velikokrat ostanem brez žetonov, ker se 5x zmoti preden prideva do prave rešitve. In velikokrat so to čisto banalne zadeve. "kje si dobil to, to bi moralo biti vsaj 10x manjše"? "Prav imaš dobro si opazil, narobe sem upošteval....analiziram vse skupaj še enkrat"....aaaaaaand it's gone. Nadaljuj čez 5 ur ali plačaj dodatno zdaj.

Mr.B ::

nekikr je izjavil:

In jih raje pošiljajo Kitajcem? Mislim, da je cena problem. Plačujem za Gemini in Claude, Claude celo največji paket, pa velikokrat ostanem brez žetonov, ker se 5x zmoti preden prideva do prave rešitve. In velikokrat so to čisto banalne zadeve. "kje si dobil to, to bi moralo biti vsaj 10x manjše"? "Prav imaš dobro si opazil, narobe sem upošteval....analiziram vse skupaj še enkrat"....aaaaaaand it's gone. Nadaljuj čez 5 ur ali plačaj dodatno zdaj.

Kitajski model lahko izvajaš lokalno, Američani pa ga v večini primerov izvajajo lokalno.
Oznaka "opensource" ni tam brez razloga.
Ne bi zaupal internih podatkov podjetja v prosto izmenjavo Microsoftu ali podobnim zahodnih ponudnikom
Zato bo zanimivo videti, kako si nekateri predstavljajo popolno blokado vseh teh odprtokodnih modelov.
Smešno je,
da po skoraj petih letih še vedno nisi sposoben opredeliti,
pod kakšnimi pogoji zmagujemo v Ukljani.

141741 ::

Kako detaljne so tvoje instrukcije - v kilobajtih, da se ne lovimo?

enavlaka ::

Mr.B je izjavil:

enavlaka je izjavil:

Kitajski modeli so hardwaresko dosti lažji, tečejo celo na cpu, če si pripravljen potrpeti za odgovor.

Ja smao po tem linku : bomo pocakali :O

Ja, tako je.
Mini-china modeli so tako majhni, da jih lahko poganjaš na telefonu. Ogromna prednost lokalnih LMM, ki jih lahko vzameš s sabo in ne pošiljajo podatkov moneysoftu in fedovcem.

Zimonem ::

Kimija 3 ne morš poganjati kar na enem hw(itak pridejo uteži šele čez kak teden) , sploh pa če bi ti futral neko storitev. Za silo se da kak ds4 glasu za soho. Sploh ker ima optimizacije za cache.
https://theaicronicle.com/en/news/resea...

Ampak če imaš biznis kupiš ali zakuliš omare. Sicer si prvič ne suveren , drugič nekomu drugemu razvijaš biznis.

Lahko odprte modele fine tunaš, imaš svoj privaten rag...

Mr.B ::

enavlaka je izjavil:

Mr.B je izjavil:

enavlaka je izjavil:

Kitajski modeli so hardwaresko dosti lažji, tečejo celo na cpu, če si pripravljen potrpeti za odgovor.

Ja smao po tem linku : bomo pocakali :O

Ja, tako je.
Mini-china modeli so tako majhni, da jih lahko poganjaš na telefonu. Ogromna prednost lokalnih LMM, ki jih lahko vzameš s sabo in ne pošiljajo podatkov moneysoftu in fedovcem.

Tudi zahodne AI modele je mogoče namestiti lokalno, pa se nihče ne pritožuje nad tem, kar omenjaš z dobro mero sarkazma. Troll
Smešno je,
da po skoraj petih letih še vedno nisi sposoben opredeliti,
pod kakšnimi pogoji zmagujemo v Ukljani.

Ales ::

Mr.B je izjavil:

enavlaka je izjavil:

Mr.B je izjavil:

enavlaka je izjavil:

Kitajski modeli so hardwaresko dosti lažji, tečejo celo na cpu, če si pripravljen potrpeti za odgovor.

Ja smao po tem linku : bomo pocakali :O

Ja, tako je.
Mini-china modeli so tako majhni, da jih lahko poganjaš na telefonu. Ogromna prednost lokalnih LMM, ki jih lahko vzameš s sabo in ne pošiljajo podatkov moneysoftu in fedovcem.

Tudi zahodne AI modele je mogoče namestiti lokalno, pa se nihče ne pritožuje nad tem, kar omenjaš z dobro mero sarkazma. Troll

Zakaj misliš, da je trol? Lokalno od sodobnih zahodnih modelov lahko uporabljaš Gemmo 4, a je največji dense model 31-miljardni, MOE pa 26/4-miljardni. Primerljivo veliki Qwen 3.6 so vsaj konkurenčni, če ne boljši.

Manjši Gemma 4 modeli so odlični za npr. telefone, to pa.

Med večjimi pa odprtih & po zmogljivosti konkurenčnih zahodnih modelov trenutno ni. Ne da jih ne bi moglo biti, ampak zahodni pristop je drugačen. Posledično so Kitajci v zadnjega pol leta prevzeli popolno prevlado na tem področju.

Zdaj bi rabili še eno novico za Qwen Image 3.0, prišel ven danes...

Zgodovina sprememb…

  • spremenil: Ales ()

Zimonem ::

Imate model je spet specializiran. Prihaja pa qwen 3.8 s podobnim naborom parametrov kot Kimi. Ampak Alibaba ponavadi ponudi kmalu cel kup destiliranih modelov katere se da uporabljate izven omar. Potem jih pa prav hitro tudi priredijo.

Mr.B ::

To je verjeten model, kako bodo na eleganten način blokirali kitajske modele.

Za uporabo najnaprednejših modelov OpenAI in Anthropic za kibernetsko varnost je očitno potrebna uvrstitev na njihov uradni seznam odobrenih uporabnikov ter odobritev vlade ZDA. Kar pa kitajski modeli nikoli ne bodo odobreni...


Razvijajoča zgodba...
Hugging Face says it resorted to a Chinese AI model to battle a fully autonomous cyberattack because U.S. model guardrails stymied its defense

Hugging Face said that from its analysis, the AI agent attacking its systems seems to have acted entirely on its own, without any human initiating the attack or directing its progress.

Earlier this month, cybersecurity company Sysdig said it had documented the first completely autonomous ransomware attack in the real world. It dubbed the AI agent that carried out the attack and the method it used "Jadepuffer." This week Sysdig said it had discovered a new version of Jadepuffer ransomware that specifically targeted trained AI models sitting on corporate networks. These models are considered valuable ransomware targets as they are expensive to train and may not have back-up copies.

To combat the attack it was experiencing, Hugging Face said it used GLM 5.2 running on its own infrastructure to analyze more than 17,000 logs, or footprints, that the attackers left behind.

The company said the attacking AI agent entered its systems through Hugging Face's data-processing pipeline, a "uniquely exposed" part of AI platforms. It then set up a series of temporary sandboxes, or disposable coding environments in the cloud, where it executed its plan.

Hugging Face said it is still investigating the impact of the attack, and does not know which large language model powered it. The attacker broke into a limited set of internal datasets and credentials, but Hugging Face is still working on assessing the full scope of the attack.
GLM 5.2 was released in mid-June by Beijing-based Z.ai, and is the company's new flagship model. It made waves in Silicon Valley for being on-par with Anthropic's Claude Opus 4.8 and OpenAI's GPT-5.5, Business Insider reports. Chinese AI companies have continuously kept the American industry on its toes, beginning with DeepSeek R1 in 2025, and most recently with this month's release of Kimi K3. Both are open source.


Še dobro, da to ni bil OpenAI ali Anthropic agent, ki je pobegnil iz sandboxa :))

Če verjamemo...
OpenAI Models Escaped Containment and Hacked Hugging Face
The cybersecurity-focused models, including GPT-5.6 Sol, broke out of a testing sandbox, exploited a zero-day, and gained access to the open internet to pull off the attack.
Describing the incident as "unprecedented," OpenAI said its AI models broke out of a sealed testing environment last week and hacked into Hugging Face's production system to steal the answers to a test they were being graded on. The models--the publicly available GPT-5.6 Sol and an unreleased, reportedly more capable one--were being evaluated on their offensive hacking skills with the safeguards that normally block high-risk cyber activity switched off.
Smešno je,
da po skoraj petih letih še vedno nisi sposoben opredeliti,
pod kakšnimi pogoji zmagujemo v Ukljani.

Mr.B ::

Smešno je,
da po skoraj petih letih še vedno nisi sposoben opredeliti,
pod kakšnimi pogoji zmagujemo v Ukljani.

pegasus ::

Za potrpežljive - K3 lepo teče na 12 let starem PCju brez gpuja: https://github.com/sqliteai/waste

OutOfTheBox ::

Kaj pomeni "lepo teče" in kako potrpežljive? Maš kakšen task za primerjavo?

karafeka ::

pegasus je izjavil:

Za potrpežljive - K3 lepo teče na 12 let starem PCju brez gpuja: https://github.com/sqliteai/waste

Z najmanj 64gb rama? Moj malo več star laptop ne vem če podpira več kot 16gb. Pa samo ddr3 seveda.

iloveboobz ::

OutOfTheBox je izjavil:

Kaj pomeni "lepo teče" in kako potrpežljive? Maš kakšen task za primerjavo?



. Today, the complete 2.78-trillion-parameter Kimi K3 runs on a 64 GB MacBook Pro at about 0.6 tokens per second.


pegasus je izjavil:

Za potrpežljive - K3 lepo teče na 12 let starem PCju brez gpuja: https://github.com/sqliteai/waste

je pa še en podobn projekt tut za druge modele

https://github.com/JustVugg/colibri
smoki

Zgodovina sprememb…

c3p0 ::

Za primer so dali 64GB MBP M5, torej ima GPU in unified memory. Ima kdo dober primer brez GPUja?

pegasus ::

5-10 sekund na token na 2x e5-2680Lv4 in sata ssdju. Dovolj za normalno osebo. Itak to kar zadeva izpljune še 3x premasiraš in predelaš v neko smiselno in delujočo obliko, je pa dovolj za začetno motivacijo.

Zimonem ::

Neuporabno, ob tem da merijo pri praznem kontekstu, ko se nabere nekaj konteksta pa hitrost pade na en žeton / starost vesolja.

uomostolto ::

c3p0 je izjavil:

Za primer so dali 64GB MBP M5, torej ima GPU in unified memory. Ima kdo dober primer brez GPUja?


Pozabi brez GPU. Če dobro dela na MACu potem bo na grafični letel.

iloveboobz ::

te varjante so skoraj vedno omeje z hitrostjo SSDja, tko da ti GPU nič ne koristi, k je ze half decen CPU več kot dovolj hitr.
smoki

uomostolto ::

iloveboobz je izjavil:

te varjante so skoraj vedno omeje z hitrostjo SSDja, tko da ti GPU nič ne koristi, k je ze half decen CPU več kot dovolj hitr.


Od kdaj? Samo toliko rama mora biti, da gre cel model v njega. Pa prava nastavitev, da ga ne dropa.

iloveboobz ::

uomostolto je izjavil:

iloveboobz je izjavil:

te varjante so skoraj vedno omeje z hitrostjo SSDja, tko da ti GPU nič ne koristi, k je ze half decen CPU več kot dovolj hitr.


Od kdaj? Samo toliko rama mora biti, da gre cel model v njega. Pa prava nastavitev, da ga ne dropa.

tle se ne pogovarjamo da damo cel model v ram. Za K3 bi v praksi rabu 2TB rama, da bi ga komfortno furo. Takrat potem ram ni več bottleneck, ampak procesna zmogljivost.

Ampak če večino model streamaš z diska, je disk tist k je omejitev.
smoki

Blinder ::

Se da s tem programirat na svojem kompu in privarčevat namesto, da se plača za AI model?
99.991% of over-25 population has tried kissing.
If you're one of the 0.009% who hasn't, copy & paste this in your Signature.
Intel i5-14400f rtx 3050 Pismo smo stari v bozjo mater. Recesija generacija

iloveboobz ::

se da, ampak je _izjemno_ počasno, sploh za kakšne bolj long horizon projekte...

Na M5 meku z 64GB maš ~0,5 tokena na sekundo, zdej pa računaj kolk tokenov rabiš za nek večji projekt :)
smoki

Zimonem ::

uomostolto je izjavil:

iloveboobz je izjavil:

te varjante so skoraj vedno omeje z hitrostjo SSDja, tko da ti GPU nič ne koristi, k je ze half decen CPU več kot dovolj hitr.


Od kdaj? Samo toliko rama mora biti, da gre cel model v njega. Pa prava nastavitev, da ga ne dropa.

Od kje ti pa ta ideja????


Vredno ogleda ...

TemaSporočilaOglediZadnje sporočilo
TemaSporočilaOglediZadnje sporočilo
»

Kdo je Kimi K3 in kaj zmore?

Oddelek: Novice / Ostale najave
425220 (177) Zimonem
»

OpenAI teden dni vedel, da ChatGPT vdira v Hugging Face

Oddelek: Novice / Znanost in tehnologija
132482 (499) sbawe64
»

Mythos 5 in Fable 5 dobila zeleno luč za vrnitev

Oddelek: Novice / Ostale najave
173020 (1616) Tody
»

DeepSeek je na internetu pozabil javno dostopno bazo svojih podatkov

Oddelek: Novice / Zasebnost
4612283 (1321) BT52
»

kaj pravi chat gpt o deepseek r1 (strani: 1 2 )

Oddelek: Loža
6614109 (10960) delavec44

Več podobnih tem