Hirdetés
- Milyen TV-t vegyek?
- Projektor topic
- Unod a kompakt klaviatúrákat? Akkor talán neked szól ez a modern Zboard iteráció
- Bluetooth hangszórók
- Már a jövő évi készletet is eladta a CXMT
- Mini-ITX
- Szünetmentes tápegységek (UPS)
- Milyen asztali (teljes vagy fél-) gépet vegyek?
- Milyen ÚJ notebookot vegyek?
- Hobby elektronika
-
Fórumok
PROHARDVER! - hardver fórumok
Notebookok TV & Audió Digitális fényképezés Alaplapok, chipsetek, memóriák Processzorok, tuning Hűtés, házak, tápok, modding Videokártyák Monitorok Adattárolás Multimédia, életmód, 3D nyomtatás Nyomtatók, szkennerek Tabletek, E-bookok PC, mini PC, barebone, szerver Beviteli eszközök Egyéb hardverek PROHARDVER! BlogokMobilarena - mobil fórumok
Okostelefonok Mobiltelefonok Okosórák Autó+mobil Üzlet és Szolgáltatások Mobilalkalmazások Tartozékok, egyebek Mobilarena blogokIT café - infotech fórumok
Infotech Hálózat, szolgáltatók OS, alkalmazások SzoftverfejlesztésGAMEPOD - játék fórumok
PC játékok Konzol játékok MobiljátékokLOGOUT - lépj ki, lépj be!
LOGOUT reakciók Monologoszféra FototrendFÁRADT GŐZ - közösségi tér szinte bármiről
Tudomány, oktatás Sport, életmód, utazás, egészség Kultúra, művészet, média Gazdaság, jog Technika, hobbi, otthon Társadalom, közélet Egyéb Lokál PROHARDVER! interaktív
Új hozzászólás Aktív témák
-
Geller72
veterán
-
consono
nagyúr
-
Geller72
veterán
-
Geller72
veterán
Olvasgattam egy kicsit fórumokon (reddit/qwen) a 3.8-al kapcsolatban és a legtöbben inkább azt valószínűsítik, hogy a 3.7-et teljesen elengedi az Alibaba és ha jön is ki free kisebb modellsorozat, az már eleve a 3.8-al jön ki, nem a 3.7-el.
-
Geller72
veterán
A mostanival az a baj, hogy folyamat megáll, de alapból is iszonyú lassú. Pedig prontos lenne.
-
consono
nagyúr
Kíváncsi leszek erre az Inklingre, főleg a kisebbik modellre (bár mondjuk az is elég nagy lesz).
-
S_x96x_S
veterán
> az Nvidia Nemotron 3 Ultra-val kódolásban?
a fireworks -nél éppen most cserélik le az új "Inkling"-re.:
"we're also deprecating Nemotron 3 Ultra on July 31st in favor of Inkling (coming soon)."
-
consono
nagyúr
A Pi-t is nézegetem
Igazán valahogy azt a működésmódot keresem, amivel az Opus látványosan jó eredményt produkál. Nem csak a nagy modellt, mert nyilván az is számít, hanem azt, hogy jókor és jó kérdéseket tesz fel és, hogy FELTESZI a kérdést, mikor érdemi döntési helyzet van. Persze biztos ennek is ki lehet váltani egy részét promptolással, meg system prompt szerkesztéssel, meg hasonlók... -
oio1i10o
junior tag
En hasznaltam lokallal illetve z.AI API-val is, de nalam a Claude Code nagyon sok tokent zabalt, ugyhogy lecsereltem pi-coding-agentre. Kb azonnal latszodott, hogy mennyivel gyorsabb es hatekonyabb a pi ha az ember jol promptol, de cserebe sokkal kevesbe hulyebiztos.
-
JoinR
őstag
Most pont azt csinálom, amit a végén írtál: Opussal tervezek meg javítok. Azért érdekel ez az egész Claude Code mizéria, mert maga a keretrendszer, amit ad az sokkal okosabbnak tűnik helyből, mint pl. az Gemini CLI/Antigravity CLI, amit már felokosítottam egy halom skillel. Persze nem is várom el az Opus teljesítményét, inkább csak játék lenne: megnézni, hogy mennyi múlik a modellen és mennyi a környezeten.
Hát kb. minden a modellen múlik. Én kicsit szórakoztam opencode oh-my-openagent harnessbe betenni a local qwen codert az egyszerű subagentekbe, de igazából nincs sok értelme pont a legolcsóbb modellt kiváltani..
-
Geller72
veterán
Most pont azt csinálom, amit a végén írtál: Opussal tervezek meg javítok. Azért érdekel ez az egész Claude Code mizéria, mert maga a keretrendszer, amit ad az sokkal okosabbnak tűnik helyből, mint pl. az Gemini CLI/Antigravity CLI, amit már felokosítottam egy halom skillel. Persze nem is várom el az Opus teljesítményét, inkább csak játék lenne: megnézni, hogy mennyi múlik a modellen és mennyi a környezeten.
"Persze nem is várom el az Opus teljesítményét, inkább csak játék lenne: megnézni, hogy mennyi múlik a modellen és mennyi a környezeten."
-Kurva sok. Hermesben definiáltam skilleket, a hermes fejleszti is őket, folyamatosan csekkolom is, eddig talán egyszer kellett "belenyúlnom", szépen fejleszti a skilleket és a toolokat is. Minden más skill-t és toolt tiltok, promptban adom meg, hogy mikor, mit használhat és hogyan. Megfelelő kontrollal kisebb modellek is tudnak jól dolgozni, természetesen bizonyos keretek közt használva őket. -
consono
nagyúr
Még nem próbáltam, de pont ezen dolgozok (local qwen 27b lesz valószínűleg a végén). Nagyon nagy a gap, a kis modelleknek nagyon elő kell készíteni mindent is. Fel kell építened egy jó orchestrator-t hozzá routinggal, mikor hova irányítsa a feladatot, mit csináljon ha failel, okosabb modellel kell review-ztatni, stb... (kis modell nem biztos hogy önmagát kellene hogy reviewzza.)
Ha ki akarod próbálni, arra ügyelj, hogy a claude megtiltotta (szankcionálhatja) a proxy használatot, tehát nem tudod egyszerűen kicserélni mondjuk a haiku-t. Csinálj egy skill-t/command-ot és bash commandként hívd a local llm-et.
Szubjektív véleményem, hogy érdemesebb haiku-t használni (olcsó és gyors), jól célzott agenteket építeni (kis context) és amit lehet determinisztikussá tenni először (lint, compile, log filtering stb.) Csak azután kezdenék el local irányba kacsintgatni, miután ez is kevés. A másik irány: eltávolodni a claude-tól. Általános skill-ek agentek amik opencode-al is kompatibilisek, és lehessen váltani más szolgáltatóra. Planningra meg komplex bugok fixálására megtartnani az opus-t minden másra meg olcsóbb modell/megoldás elég.Most pont azt csinálom, amit a végén írtál: Opussal tervezek meg javítok. Azért érdekel ez az egész Claude Code mizéria, mert maga a keretrendszer, amit ad az sokkal okosabbnak tűnik helyből, mint pl. az Gemini CLI/Antigravity CLI, amit már felokosítottam egy halom skillel. Persze nem is várom el az Opus teljesítményét, inkább csak játék lenne: megnézni, hogy mennyi múlik a modellen és mennyi a környezeten.
-
Geller72
veterán
Teszteltem az 550B-t több tesztfeladatsorral is, és jobb eredményeket hozott, mint a Hy3. Egy bajom van vele, hogy lassú, gondolom a terhelés miatt. De ettől függetlenül erősnek tartom. A Hy3 holnaptól már nem lesz free. Ami még szimpatikus, hogy míg a Hy3 262k cl, addig az Ultra 1M.
-
dippe
tag
Még nem próbáltam, de pont ezen dolgozok (local qwen 27b lesz valószínűleg a végén). Nagyon nagy a gap, a kis modelleknek nagyon elő kell készíteni mindent is. Fel kell építened egy jó orchestrator-t hozzá routinggal, mikor hova irányítsa a feladatot, mit csináljon ha failel, okosabb modellel kell review-ztatni, stb... (kis modell nem biztos hogy önmagát kellene hogy reviewzza.)
Ha ki akarod próbálni, arra ügyelj, hogy a claude megtiltotta (szankcionálhatja) a proxy használatot, tehát nem tudod egyszerűen kicserélni mondjuk a haiku-t. Csinálj egy skill-t/command-ot és bash commandként hívd a local llm-et.
Szubjektív véleményem, hogy érdemesebb haiku-t használni (olcsó és gyors), jól célzott agenteket építeni (kis context) és amit lehet determinisztikussá tenni először (lint, compile, log filtering stb.) Csak azután kezdenék el local irányba kacsintgatni, miután ez is kevés. A másik irány: eltávolodni a claude-tól. Általános skill-ek agentek amik opencode-al is kompatibilisek, és lehessen váltani más szolgáltatóra. Planningra meg komplex bugok fixálására megtartnani az opus-t minden másra meg olcsóbb modell/megoldás elég. -
Geller72
veterán
Köszönöm. Akkor lehet, hogy az Ultrára ráeresztem a tesztjeim.
-
consono
nagyúr
Valaki használta itt a Claude Code-ot helyi modellekkel? Mik a tapasztalatok? Tudom, hogy viszonylag egyszerűen megoldható a dolog, igazán a gyakorlati tapasztalatok érdekelnek, hogy megéri e ezzel küzdeni azért, mert jó a harness.
-
dippe
tag
Visszanéztem a logokat, a Supert. Amire emlékszem, hogy közepesen komplex problémánál (de nem triviális akadálynál) totál elakadt, ahol a gpt 120b, de még a qwen 27b is továbblendült. TS kódolás volt a scope, modellt próbáltam kiválasztani.
-
Geller72
veterán
-
Geller72
veterán
újabb open modell várható

( Qwen3.8-Max-Preview )
""""
Qwen3.8 is launching and going open-weight soon!🌐
With a massive 2.4T parameters, this model is continuously evolving. We believe it’s one of the most powerful model available today, compatible to leading frontier AI models , second only to Fable 5.
...
""" https://x.com/Alibaba_Qwen/status/2078759124914098291Remélem, lesz openrouteren is..ezek szerint a 3.7 valamiért nem sikerült annyira jól, még fizetősben sem.
-
Geller72
veterán
-
Rage47
nagyúr
Van revolutos Picsart előfizum, gondoltam kipróbálom a videógenerálást. 1000 kreditem van, már vagy 500 elment és még mindig nem jó a videó, pedig a promptot is úgy generáltatom GPT-vel. Valami mindig hibázik, pl. legutóbb tökéletes lett minden már, de 2 szót elrontott a személy, aki beszél nekem a videóban. Komolyan, mintha direkt csinálnák a cégek, hogy fogyjon a kredit potyára.
Szerk.: én hibáztam, a Seedance 2.0 nem tud németül, ezért hibázott.
Tanuljatok ebből ti is 
-
S_x96x_S
veterán
újabb open modell várható

( Qwen3.8-Max-Preview )
""""
Qwen3.8 is launching and going open-weight soon!🌐
With a massive 2.4T parameters, this model is continuously evolving. We believe it’s one of the most powerful model available today, compatible to leading frontier AI models , second only to Fable 5.
...
""" https://x.com/Alibaba_Qwen/status/2078759124914098291 -
dippe
tag
-
freeapro
senior tag
Egy kérdés: van még valakinek strix halo clustere? A reddit-en a TB-net-ről írt hozzászólásomat feltűnően sokan olvassák Magyarországról. Hungary stabilan a TOP3-ban van.
Ha van szívesen konzultálnék. Az USB4-RDMA félig-meddig működik. A 7us latency-t sikerült elérnem, de max 18Gbps az átviteli sebesség, és terhelésre beesik. A cél Hellas 48Gbps-e. -
freeapro
senior tag
A topikhoz csak távolról kapcsolódik, de két napja csodálkozva olvastam gazdasági hírekben, hogy a magyar gazdaság harmadik legerősebb része, az autóipar csúnya visszaesése óta a helyét az AI(!) vette át. Mivel van hazánkban egy igen nagy Foxconn egység, akik Ai szervereket gyártanak és ez azt jelenti, hogy a hazai GDP nem kicsi részét ők termelik most. Nekem ez nagyon új volt.
Kicsik vagyunk. Volt idő, mikor a magyar GDP több mint felét a Székesfehérvári IBM merevlemezgyár adta.
-
DarkByte
addikt
A topikhoz csak távolról kapcsolódik, de két napja csodálkozva olvastam gazdasági hírekben, hogy a magyar gazdaság harmadik legerősebb része, az autóipar csúnya visszaesése óta a helyét az AI(!) vette át. Mivel van hazánkban egy igen nagy Foxconn egység, akik Ai szervereket gyártanak és ez azt jelenti, hogy a hazai GDP nem kicsi részét ők termelik most. Nekem ez nagyon új volt.
Jaja
Mondjuk ehhez az is kellett hogy ennyire tropán legyen a magyar gazdaság, és most épp nagyon rosszul megy az EU-s autógyártóknak is. -
Komplikato
veterán
A topikhoz csak távolról kapcsolódik, de két napja csodálkozva olvastam gazdasági hírekben, hogy a magyar gazdaság harmadik legerősebb része, az autóipar csúnya visszaesése óta a helyét az AI(!) vette át. Mivel van hazánkban egy igen nagy Foxconn egység, akik Ai szervereket gyártanak és ez azt jelenti, hogy a hazai GDP nem kicsi részét ők termelik most. Nekem ez nagyon új volt.
-
Geller72
veterán
Van valakinek tapasztalata openrouteren az Nvidia Nemotron 3 Ultra-val kódolásban?

-
consono
nagyúr
De igen, mérettől függően a Qwen 3.5 vagy Gemma 4 továbbtanításai:
> 9B dense (on top of Qwen 3.5 9B)
> 31B dense (on top of Gemma 4 31B)
> 35B MoE (on top of Qwen 3.5 35B)
> 397B MoE (on top of Qwen 3.5 397B)Nagyon tele volt ezzel a YouTube pár hetet, hogy custom scaffolding képes model. De kb. akkor hallottam róla utoljára

Én is.
Megnéztem pár videót, nem rossz, de inkább kódoltatok továbbra is online modellel. A 9b-snél nagyobb nem futna nálam... Most elég jól bevált, hogy a Gemini által megcsinált kódot a Claude finomítja. -
DarkByte
addikt
De igen, mérettől függően a Qwen 3.5 vagy Gemma 4 továbbtanításai:
> 9B dense (on top of Qwen 3.5 9B)
> 31B dense (on top of Gemma 4 31B)
> 35B MoE (on top of Qwen 3.5 35B)
> 397B MoE (on top of Qwen 3.5 397B)Nagyon tele volt ezzel a YouTube pár hetet, hogy custom scaffolding képes model. De kb. akkor hallottam róla utoljára

-
Geller72
veterán
-
consono
nagyúr
Ha valaki kísérletezni akarna, van itt egy elég érdekes modell, unsloth-tól. Elérhető különbőző változata a 9B-től a 35B-MoE-n át akár a 397B-MoE verzióig. Természetesen free modell.
Elég komoly bench eredményei vannak. Ez itt a 35B modellé:

A 397B a Claude Opus 4.7 és 4.8 közt van. Ami nem semmi. Az új, Qwen3.7 maxot gyakorlatilag mindenben veri.

A 35B-MoE modell card-ja
A 9B modell card-ja
A 397B MoE modell card-jaLeírás:
Csúcskategóriás kódoló ágensek: Elérhetők 9B-Dense, 31B-Dense, 35B-MoE és 397B-MoE változatokban (melyek a Gemma 4 és a Qwen 3.5 alapjaira épülő utótanítással készültek), és a hasonló méretű nyílt forráskódú modellek között csúcskategóriás (state-of-the-art) teljesítményt nyújtanak olyan kódolási teljesítményteszteken, mint a Terminal-Bench 2.1, a SWE-Bench, az NL2Repo és az OpenClaw.
Önfejlesztő tanítási keretrendszer: Az Ornith-1.0 megerősítéses tanulást (RL) alkalmaz, amellyel nemcsak a megoldási folyamatokat (rollouts) tanulja meg előállítani, hanem az azokat vezérlő keretrendszert (scaffold) is. A keretrendszer és az abból adódó megoldás együttes optimalizálásával a modell jobb keresési útvonalakat fedez fel, és magasabb minőségű megoldásokat hoz létre.
Az Ornith az nem valami Qwen finetune? Mintha az rémlene.
-
Geller72
veterán
Nem futtatok lokális modelleket, csak egy 4060 8GB vga-m van. Egyszerűbb nekem a felhő.
...eddig a kisebb feladatokban jobban teljesít..a 9B.., mint a deepseek flah fizetős modellje. És ez még csak a Q4_K_M, nem is a Q6..
Mindkettőnek ugyanazokat a promptokat adtam. -
Speeedfire
félisten
..azért ezt teszteld le szerintem. Az már most biztos, hogy ebből a 9B lényegesen jobb, mint a google 14b-je..
Ezt már én teszteltem, valós körülmények közt, nem ilyen-olyan bench-ekkel..
. És ha egy 9B-s modell ezekben a "szinti" tesztekben a qwen3.6-35B szintjén van, az már azért sejtet valamit..Nem futtatok lokális modelleket, csak egy 4060 8GB vga-m van. Egyszerűbb nekem a felhő.
-
Geller72
veterán
Azért ezek a teszt eredmények....kb semmit se jelentenek. Hiába jó teszteken a grok, minimax stb. Való életben elvérzenek.
..azért ezt teszteld le szerintem. Az már most biztos, hogy ebből a 9B lényegesen jobb, mint a google 14b-je..
Ezt már én teszteltem, valós körülmények közt, nem ilyen-olyan bench-ekkel..
. És ha egy 9B-s modell ezekben a "szinti" tesztekben a qwen3.6-35B szintjén van, az már azért sejtet valamit.. -
Speeedfire
félisten
Ha valaki kísérletezni akarna, van itt egy elég érdekes modell, unsloth-tól. Elérhető különbőző változata a 9B-től a 35B-MoE-n át akár a 397B-MoE verzióig. Természetesen free modell.
Elég komoly bench eredményei vannak. Ez itt a 35B modellé:

A 397B a Claude Opus 4.7 és 4.8 közt van. Ami nem semmi. Az új, Qwen3.7 maxot gyakorlatilag mindenben veri.

A 35B-MoE modell card-ja
A 9B modell card-ja
A 397B MoE modell card-jaLeírás:
Csúcskategóriás kódoló ágensek: Elérhetők 9B-Dense, 31B-Dense, 35B-MoE és 397B-MoE változatokban (melyek a Gemma 4 és a Qwen 3.5 alapjaira épülő utótanítással készültek), és a hasonló méretű nyílt forráskódú modellek között csúcskategóriás (state-of-the-art) teljesítményt nyújtanak olyan kódolási teljesítményteszteken, mint a Terminal-Bench 2.1, a SWE-Bench, az NL2Repo és az OpenClaw.
Önfejlesztő tanítási keretrendszer: Az Ornith-1.0 megerősítéses tanulást (RL) alkalmaz, amellyel nemcsak a megoldási folyamatokat (rollouts) tanulja meg előállítani, hanem az azokat vezérlő keretrendszert (scaffold) is. A keretrendszer és az abból adódó megoldás együttes optimalizálásával a modell jobb keresési útvonalakat fedez fel, és magasabb minőségű megoldásokat hoz létre.
Azért ezek a teszt eredmények....kb semmit se jelentenek. Hiába jó teszteken a grok, minimax stb. Való életben elvérzenek.
-
5leteseN
őstag
-
Geller72
veterán
Ha valaki kísérletezni akarna, van itt egy elég érdekes modell, unsloth-tól. Elérhető különbőző változata a 9B-től a 35B-MoE-n át akár a 397B-MoE verzióig. Természetesen free modell.
Elég komoly bench eredményei vannak. Ez itt a 35B modellé:

A 397B a Claude Opus 4.7 és 4.8 közt van. Ami nem semmi. Az új, Qwen3.7 maxot gyakorlatilag mindenben veri.

A 35B-MoE modell card-ja
A 9B modell card-ja
A 397B MoE modell card-jaLeírás:
Csúcskategóriás kódoló ágensek: Elérhetők 9B-Dense, 31B-Dense, 35B-MoE és 397B-MoE változatokban (melyek a Gemma 4 és a Qwen 3.5 alapjaira épülő utótanítással készültek), és a hasonló méretű nyílt forráskódú modellek között csúcskategóriás (state-of-the-art) teljesítményt nyújtanak olyan kódolási teljesítményteszteken, mint a Terminal-Bench 2.1, a SWE-Bench, az NL2Repo és az OpenClaw.
Önfejlesztő tanítási keretrendszer: Az Ornith-1.0 megerősítéses tanulást (RL) alkalmaz, amellyel nemcsak a megoldási folyamatokat (rollouts) tanulja meg előállítani, hanem az azokat vezérlő keretrendszert (scaffold) is. A keretrendszer és az abból adódó megoldás együttes optimalizálásával a modell jobb keresési útvonalakat fedez fel, és magasabb minőségű megoldásokat hoz létre.
Annyit fejlődtek a modellek pár hónap alatt, hogy tk. ez a 9B-s modell a Qwen3.6-35B szintjén van.
-
Geller72
veterán
Ha valaki kísérletezni akarna, van itt egy elég érdekes modell, unsloth-tól. Elérhető különbőző változata a 9B-től a 35B-MoE-n át akár a 397B-MoE verzióig. Természetesen free modell.
Elég komoly bench eredményei vannak. Ez itt a 35B modellé:

A 397B a Claude Opus 4.7 és 4.8 közt van. Ami nem semmi. Az új, Qwen3.7 maxot gyakorlatilag mindenben veri.

A 35B-MoE modell card-ja
A 9B modell card-ja
A 397B MoE modell card-jaLeírás:
Csúcskategóriás kódoló ágensek: Elérhetők 9B-Dense, 31B-Dense, 35B-MoE és 397B-MoE változatokban (melyek a Gemma 4 és a Qwen 3.5 alapjaira épülő utótanítással készültek), és a hasonló méretű nyílt forráskódú modellek között csúcskategóriás (state-of-the-art) teljesítményt nyújtanak olyan kódolási teljesítményteszteken, mint a Terminal-Bench 2.1, a SWE-Bench, az NL2Repo és az OpenClaw.
Önfejlesztő tanítási keretrendszer: Az Ornith-1.0 megerősítéses tanulást (RL) alkalmaz, amellyel nemcsak a megoldási folyamatokat (rollouts) tanulja meg előállítani, hanem az azokat vezérlő keretrendszert (scaffold) is. A keretrendszer és az abból adódó megoldás együttes optimalizálásával a modell jobb keresési útvonalakat fedez fel, és magasabb minőségű megoldásokat hoz létre.
-
5leteseN
őstag
"Beelőztél", de így is jóóó! Túl jó volt, hogy ne csinálja meg valaki.
...kösz-kösz a teszt-híreket!

Nekem tetszik az ingyenes. Ha nem emelik fel majd az árát(vagy butítják le), akkor annyi pénzért még a fizetős is teljesen vállalható. -
Geller72
veterán
Ezt kipróbálom majd, már letöltöttem..
-
Geller72
veterán
Itt vannak a már eleve - akár - "kisebb" verziók is. Van 29B-MTP, 50B ..stb is..Én nem erőlködnék vele..
-
5leteseN
őstag
-
consono
nagyúr
Mondj hasonló értéket!

...ja, és 10 nap alatt!

-----------------------------------------------------------
Egyébként meg legyünk profi MI-Felhasználók, és kérdezzünk meg egy "szakértőt", például a friss-ropogós Kimi 3-at:
"Egy 300B-s LLM kvantálása után kb. mekkora lenne a Q4, Q5, Q6-os változat?
Becslést kérek, hogy mennyibe kerülne egy ilyen kvantálás ezekre a fokozatokra egyenként a RunPod szolgáltatónál!"
Kimi 3: "A képlet: 300 × 10⁹ paraméter × effektív bit/súly ÷ 8. A gyakorlati bájt/paraméter értékek (skálafaktorok, metaadatok miatt a névlegesnél több):

Az architektúra (MoE vs. dense), a tokenizer és az, hogy mely tenzorok maradnak magasabb precízen, néhány GB-ot módosíthat.
Fontos: allama-quantizeCPU-n fut, a GPU szinte tétlen — ezért nem a GPU-t kell kinézni, hanem a RAM + vCPU + gyors NVMe kombinációt.A munkafolyamat:
1; Forrásmodell letöltése (~600 GB safetensors) — 0,5–1,5 óra (egyszeri)
2; F16 GGUF konverzió (~600 GB írás) — 1–2 óra (egyszeri)
3; Kvantálás szintenként — a gyakorlati tapasztalatok (405B-s kvantálások) alapján lineárisan skálázva: 3–8 óra/szint, erősen függ a vCPU-számtól és hogy a ~600 GB-os F16 fájl mennyire fér el a RAM-ban (mmap-olva megy, de 128 GB RAM alatt erősen töredezik az I/O)
4; Eredmény feltöltése/tárolása (~630 GB összesen)
Árak (Community Cloud, másodperc-alapú számlázás): RTX 3090 $0,46/ó (125 GB RAM), RTX 4090 $0,69/ó, A100 PCIe $1,19–1,39/ó (117–125 GB RAM), H100 PCIe $1,99–2,89/ó (188 GB RAM). Tárhely: pod volume $0,10/GB/hó, network volume $0,05–0,07/GB/hó — 1,5–2 TB lemez egy napra arányosítva kb. $3–7.
Becsült költség kvantálásonként:
Egyszeri fix költség (letöltés + F16 konverzió + lemez): ~$5–15.
1; Teljes Q4 + Q5 + Q6 sorozat egy session-ben: kb. $20–50 (Community Cloud), mivel a letöltés és az F16 konverzió csak egyszer kell, a második és harmadik kvant már „olcsóbb".
2; Ha csak egyetlen szint kell (pl. Q4_K_M): ~$10–20 a fix költségekkel együtt.
3; Secure Cloud felár ~+20–40%.
4; Ha imatrix-os (IQ/IQ4_XS) kvant kéne, ahhoz már GPU-s kalibráció (
llama-imatrix) is járulna — az külön ~$10–30 többlet lenne.Tipp: a legjobb ár/érték itt az, ha a legolcsóbb GPU-hoz rendelhető legnagyobb RAM-os (128+ GB, ideális 192–256 GB), sok vCPU-s pod-ot választod, 2 TB-os network volume-mel — a GPU óradíja itt „járulékos veszteség", a kvantálás nem használja."
Ime!

NA jó, de akkor miért nem csinálod meg?
Illetve más még miért nem csinálta meg? -
5leteseN
őstag
Mondj hasonló értéket!

...ja, és 10 nap alatt!

-----------------------------------------------------------
Egyébként meg legyünk profi MI-Felhasználók, és kérdezzünk meg egy "szakértőt", például a friss-ropogós Kimi 3-at:
"Egy 300B-s LLM kvantálása után kb. mekkora lenne a Q4, Q5, Q6-os változat?
Becslést kérek, hogy mennyibe kerülne egy ilyen kvantálás ezekre a fokozatokra egyenként a RunPod szolgáltatónál!"
Kimi 3: "A képlet: 300 × 10⁹ paraméter × effektív bit/súly ÷ 8. A gyakorlati bájt/paraméter értékek (skálafaktorok, metaadatok miatt a névlegesnél több):

Az architektúra (MoE vs. dense), a tokenizer és az, hogy mely tenzorok maradnak magasabb precízen, néhány GB-ot módosíthat.
Fontos: allama-quantizeCPU-n fut, a GPU szinte tétlen — ezért nem a GPU-t kell kinézni, hanem a RAM + vCPU + gyors NVMe kombinációt.A munkafolyamat:
1; Forrásmodell letöltése (~600 GB safetensors) — 0,5–1,5 óra (egyszeri)
2; F16 GGUF konverzió (~600 GB írás) — 1–2 óra (egyszeri)
3; Kvantálás szintenként — a gyakorlati tapasztalatok (405B-s kvantálások) alapján lineárisan skálázva: 3–8 óra/szint, erősen függ a vCPU-számtól és hogy a ~600 GB-os F16 fájl mennyire fér el a RAM-ban (mmap-olva megy, de 128 GB RAM alatt erősen töredezik az I/O)
4; Eredmény feltöltése/tárolása (~630 GB összesen)
Árak (Community Cloud, másodperc-alapú számlázás): RTX 3090 $0,46/ó (125 GB RAM), RTX 4090 $0,69/ó, A100 PCIe $1,19–1,39/ó (117–125 GB RAM), H100 PCIe $1,99–2,89/ó (188 GB RAM). Tárhely: pod volume $0,10/GB/hó, network volume $0,05–0,07/GB/hó — 1,5–2 TB lemez egy napra arányosítva kb. $3–7.
Becsült költség kvantálásonként:
Egyszeri fix költség (letöltés + F16 konverzió + lemez): ~$5–15.
1; Teljes Q4 + Q5 + Q6 sorozat egy session-ben: kb. $20–50 (Community Cloud), mivel a letöltés és az F16 konverzió csak egyszer kell, a második és harmadik kvant már „olcsóbb".
2; Ha csak egyetlen szint kell (pl. Q4_K_M): ~$10–20 a fix költségekkel együtt.
3; Secure Cloud felár ~+20–40%.
4; Ha imatrix-os (IQ/IQ4_XS) kvant kéne, ahhoz már GPU-s kalibráció (
llama-imatrix) is járulna — az külön ~$10–30 többlet lenne.Tipp: a legjobb ár/érték itt az, ha a legolcsóbb GPU-hoz rendelhető legnagyobb RAM-os (128+ GB, ideális 192–256 GB), sok vCPU-s pod-ot választod, 2 TB-os network volume-mel — a GPU óradíja itt „járulékos veszteség", a kvantálás nem használja."
Ime!

Sajnos a 132GB RAM-omba így sem fér bele ezért rákérdeztem:
"...Q3 méret(MoE, 21B aktív)?
Kimi 3:

Összevetés a korábbiakkal: Q3_K_M (~145 GB) vs. Q4_K_M (~180 GB) → kb. 35–40 GB megtakarítás, cserébe érezhető minőségromlásért.

- - -
A Q3 futtatásához elég lesz 132GB RAM és 2x22GB VGA?
- - -
Kimi 3: "Rövid válasz: igen, de szűken — kb. 20–30 GB tartalékkal
Memória-egyenleg (Q3_K_M, ~145 GB):
Tehát befér, de nem nyújtózkodva. A maradék ~20–25 GB elég egy 8–16k kontextushoz (Q8_0/Q4 KV cache-csel); 32k+ kontextusnál már cseréld le a KV-t Q4-re, vagy a modellt IQ3-ra.
Mivel MoE-ről van szó (21B aktív), a leghatékonyabb:

-
5leteseN
őstag
Soknak találod a 10T tokent? Szerintem nem az. Persze nem látom a nagy szolgáltatók számait, de ha kicsit többet dolgozok az AI-al simán belecsuszik 3-400 millió token nálam is egy héten, mert amire használom ott nem igazán játszik a cache. Jó, 70-80%-a kis modellekkel (Flash meg Flash light, vagy Haiku), mert cost cap van, nem token limit, meg kell a gyors válasz. De én csak egy ember vagyok, biztos van a cégnél még rajtam kívül pár száz ilyen, mert folyamatos a nyöszörgés, hogy a hónap második felére kifutnak a keretből...
Szóval világ szinten a 10T nem tűnik soknak, főleg hogy ingyen van, de lehet, hogy fordítva ülök a lovon
A másik meg a pár tíz EUR-os kvantálás: ha ilyen olcsó és könnyű lenne, akkor miért nem csinálta meg senki?

Mondj hasonló értéket!

...ja, és 10 nap alatt!

-----------------------------------------------------------
Egyébként meg legyünk profi MI-Felhasználók, és kérdezzünk meg egy "szakértőt", például a friss-ropogós Kimi 3-at:
"Egy 300B-s LLM kvantálása után kb. mekkora lenne a Q4, Q5, Q6-os változat?
Becslést kérek, hogy mennyibe kerülne egy ilyen kvantálás ezekre a fokozatokra egyenként a RunPod szolgáltatónál!"
Kimi 3: "A képlet: 300 × 10⁹ paraméter × effektív bit/súly ÷ 8. A gyakorlati bájt/paraméter értékek (skálafaktorok, metaadatok miatt a névlegesnél több):

Az architektúra (MoE vs. dense), a tokenizer és az, hogy mely tenzorok maradnak magasabb precízen, néhány GB-ot módosíthat.
Fontos: allama-quantizeCPU-n fut, a GPU szinte tétlen — ezért nem a GPU-t kell kinézni, hanem a RAM + vCPU + gyors NVMe kombinációt.A munkafolyamat:
1; Forrásmodell letöltése (~600 GB safetensors) — 0,5–1,5 óra (egyszeri)
2; F16 GGUF konverzió (~600 GB írás) — 1–2 óra (egyszeri)
3; Kvantálás szintenként — a gyakorlati tapasztalatok (405B-s kvantálások) alapján lineárisan skálázva: 3–8 óra/szint, erősen függ a vCPU-számtól és hogy a ~600 GB-os F16 fájl mennyire fér el a RAM-ban (mmap-olva megy, de 128 GB RAM alatt erősen töredezik az I/O)
4; Eredmény feltöltése/tárolása (~630 GB összesen)
Árak (Community Cloud, másodperc-alapú számlázás): RTX 3090 $0,46/ó (125 GB RAM), RTX 4090 $0,69/ó, A100 PCIe $1,19–1,39/ó (117–125 GB RAM), H100 PCIe $1,99–2,89/ó (188 GB RAM). Tárhely: pod volume $0,10/GB/hó, network volume $0,05–0,07/GB/hó — 1,5–2 TB lemez egy napra arányosítva kb. $3–7.
Becsült költség kvantálásonként:
Egyszeri fix költség (letöltés + F16 konverzió + lemez): ~$5–15.
1; Teljes Q4 + Q5 + Q6 sorozat egy session-ben: kb. $20–50 (Community Cloud), mivel a letöltés és az F16 konverzió csak egyszer kell, a második és harmadik kvant már „olcsóbb".
2; Ha csak egyetlen szint kell (pl. Q4_K_M): ~$10–20 a fix költségekkel együtt.
3; Secure Cloud felár ~+20–40%.
4; Ha imatrix-os (IQ/IQ4_XS) kvant kéne, ahhoz már GPU-s kalibráció (
llama-imatrix) is járulna — az külön ~$10–30 többlet lenne.Tipp: a legjobb ár/érték itt az, ha a legolcsóbb GPU-hoz rendelhető legnagyobb RAM-os (128+ GB, ideális 192–256 GB), sok vCPU-s pod-ot választod, 2 TB-os network volume-mel — a GPU óradíja itt „járulékos veszteség", a kvantálás nem használja."
Ime!

-
consono
nagyúr
Minden bakija ellenére is összejött nekik a 10 nap alatt a 10(+)T-token!
/


Azért ez szerintem égő ez a "Kínai-fricska" a "Nagy Nyugati Fogyasztói Társadalom"-nak és az Ő "Mindenkinek-is jó lesz" Új-Apostolainak(OpenAI, Musk, Google, ...)!Szerintem is jó egyébként, használgatom, szerintem is az eddigi legjobb ingyenes LLM!
Igazán lehetne belőle Q4/Q5-ös GGUF, ha pedig még az ebből aktív 3-10B MoE (+esetleg MTP) is összejönne, akkor elkezdenék gondolkodni valami ehhez elegendő(na jó: csak az aktív, +kontextus-os) hardveren!
/ 
Soknak találod a 10T tokent? Szerintem nem az. Persze nem látom a nagy szolgáltatók számait, de ha kicsit többet dolgozok az AI-al simán belecsuszik 3-400 millió token nálam is egy héten, mert amire használom ott nem igazán játszik a cache. Jó, 70-80%-a kis modellekkel (Flash meg Flash light, vagy Haiku), mert cost cap van, nem token limit, meg kell a gyors válasz. De én csak egy ember vagyok, biztos van a cégnél még rajtam kívül pár száz ilyen, mert folyamatos a nyöszörgés, hogy a hónap második felére kifutnak a keretből...
Szóval világ szinten a 10T nem tűnik soknak, főleg hogy ingyen van, de lehet, hogy fordítva ülök a lovon
A másik meg a pár tíz EUR-os kvantálás: ha ilyen olcsó és könnyű lenne, akkor miért nem csinálta meg senki?

-
5leteseN
őstag
Nem lesz ingyenes..2026. július 21-én megszűnik a free végpont. Utána a normál Hy3 ára jelenleg 0,14 USD / egymillió bemeneti token és 0,58 USD / egymillió kimeneti token. És természetesen, ahogy a qwen3.7-ből, úgy ebből sem lesz kisebb. A 295/21-et meg elég kevesen tudják lokálban futtatni..
Ingyenes/szabad felhasználású!
Elméletileg az csinál belőle kvantált, uncensored, ... változatokat, aki akar!
Pontosítok: ki rászánja az ehhez szükséges pár.tíz €-t, hogy (például a RunPod)felhőben megcsinálja! -
Geller72
veterán
Minden bakija ellenére is összejött nekik a 10 nap alatt a 10(+)T-token!
/


Azért ez szerintem égő ez a "Kínai-fricska" a "Nagy Nyugati Fogyasztói Társadalom"-nak és az Ő "Mindenkinek-is jó lesz" Új-Apostolainak(OpenAI, Musk, Google, ...)!Szerintem is jó egyébként, használgatom, szerintem is az eddigi legjobb ingyenes LLM!
Igazán lehetne belőle Q4/Q5-ös GGUF, ha pedig még az ebből aktív 3-10B MoE (+esetleg MTP) is összejönne, akkor elkezdenék gondolkodni valami ehhez elegendő(na jó: csak az aktív, +kontextus-os) hardveren!
/ 
Nem lesz ingyenes..2026. július 21-én megszűnik a free végpont. Utána a normál Hy3 ára jelenleg 0,14 USD / egymillió bemeneti token és 0,58 USD / egymillió kimeneti token. És természetesen, ahogy a qwen3.7-ből, úgy ebből sem lesz kisebb. A 295/21-et meg elég kevesen tudják lokálban futtatni..
-
5leteseN
őstag
Minden bakija ellenére is összejött nekik a 10 nap alatt a 10(+)T-token!
/


Azért ez szerintem égő ez a "Kínai-fricska" a "Nagy Nyugati Fogyasztói Társadalom"-nak és az Ő "Mindenkinek-is jó lesz" Új-Apostolainak(OpenAI, Musk, Google, ...)!Szerintem is jó egyébként, használgatom, szerintem is az eddigi legjobb ingyenes LLM!
Igazán lehetne belőle Q4/Q5-ös GGUF, ha pedig még az ebből aktív 3-10B MoE (+esetleg MTP) is összejönne, akkor elkezdenék gondolkodni valami ehhez elegendő(na jó: csak az aktív, +kontextus-os) hardveren!
/ 
-
consono
nagyúr
Nem csak azert. Az EU szeretne fuggetlenedni minel tobb teruleten az USA-tol es az AI-t, mint strategiai teruletet jeloltek meg ennek kereteben. Csak hat sajnos itt is sikerult bealudni, mert van az USA-nak, van Kinanak, az oroszoknak meg nem mostansag lesz. Egyebkent meg jo, hogy az EU hetfele osztja a 20 milliardot, ahelyett hogy egy, minden EU-s polgar es vallalkozas altal hasznalhato AI-t fejlesztenenek. Lesz 7 kisebb-nagyobb, amik nem versenyezhetnek az amerikai vagy kinai megoldasokkal - szarnak pofon.
Az Anthropic datacenterére gondoltam ezzel, hogy akarják az EU-s ügyfeleket, vagy legalább az adataikat... A többiben egyetértünk.
-
Komplikato
veterán
Van az Euro LLM, amiről itt is volt szó, na most egy dolog, hogy 14 hónapja semmi frissítés, de nem azért mert olyan marha jó lenne. Nem is használja senki. Kéne lennie legalább féltucatnak, amik legalább alulról kapirgálnák azt a tucatnyit, amik közkézen forognak. És frissülnek pár hetente.
-
S_x96x_S
veterán
"Kimi K3: Evolves for you2.8 trillion parameters, 1M-token context. Agent runs in chat: complex tasks, one go. Kimi evolves with every use — sharper at coding, research, and beyond."
https://www.kimi.com/blog/kimi-k3
( és ez lesz a legdrágább kínai modell )
( benchmark via X ) -
sh4d0w
félisten
Nem csak azert. Az EU szeretne fuggetlenedni minel tobb teruleten az USA-tol es az AI-t, mint strategiai teruletet jeloltek meg ennek kereteben. Csak hat sajnos itt is sikerult bealudni, mert van az USA-nak, van Kinanak, az oroszoknak meg nem mostansag lesz. Egyebkent meg jo, hogy az EU hetfele osztja a 20 milliardot, ahelyett hogy egy, minden EU-s polgar es vallalkozas altal hasznalhato AI-t fejlesztenenek. Lesz 7 kisebb-nagyobb, amik nem versenyezhetnek az amerikai vagy kinai megoldasokkal - szarnak pofon.
-
freeapro
senior tag
-
consono
nagyúr
-
Geller72
veterán
-
consono
nagyúr
-
Rage47
nagyúr
-
Reggie0
titán
-
S_x96x_S
veterán
Amúgy megint nullázta az Anthropic a Claude -os csomagokat
és lehet megint rácuppani a Fable5 -re. -
S_x96x_S
veterán
Ha még aktuális: a 20$ csomag lehúzás a claude-nál. Érzésre (nem bizonyíthatóan) nem 5x ad többet a nagyobb csomag. Elég nagy a fluktuáció token usage és quality szempontból. Vannak napok, hogy többször kell promptolni ugyanazt normális eredményért + gyorsabban ég a token -> 20$ hamar kifut a keretből. Főleg amikor új modellt vezetnek be, előtte 1-2 héttel lerontják a minőséget.
Tapasztalat: 20$ kifutott a múlt héten a keretből kb. 30 perc alatt, ugyanazzal a feladattal megállás nélkül dolgozok a nagyobb 100Euro-s Max csomaggal. Egyébként a Max-al eddig kb. napi 6 órát tudok folyamatosan dolgozni, ritkán fut ki a keretből. Bír többet is per nap, de lesznek holtidők + a heti keret kimerül. De én nem bírok többet
Ha kísérletezni akarsz, skilleket fejleszteni, stb. akkor 1 hónapra érdemes a nagy csomagra váltani a fable miatt. Azzal alakítsd ki a workflow-dat, skilleket, térképezd fel a kódokat, stb. és után válts olcsóbbra, akár másik szolgáltatónál.> Ha kísérletezni akarsz, skilleket fejleszteni, stb. akkor 1 hónapra érdemes a nagy csomagra váltani a fable miatt. Azzal alakítsd ki a workflow-dat, skilleket, térképezd fel a kódokat, stb. és után válts olcsóbbra, akár másik szolgáltatónál.
Nem biztos, hogy előfizetésben 1 hónapig tudod használni a Fable5-öt. Most úgy néz ki, hogy valószínüleg csak 3 napig ( jul19 )
lesz elérhető a csomagokban.
https://support.claude.com/en/articles/15424964-claude-fable-5-promotional-access"""
For a limited time, you can use our newest model—Claude Fable 5—at no extra cost as part of your subscription plan. This article explains what the promotion includes, how to access Claude Fable 5, what happens when you reach your usage limit, and what happens when the promotional period ends.
Note: We’ve extended this promotion through July 19, 2026 at 11:59:59 PM PT. The 50% increase to Claude Code weekly usage limits has also been extended through the same date.
This promotion is available on Pro, Max, Team, and premium seats on seat-based Enterprise plans, where enabled by your organization. If you're on a seat-based Enterprise plan, see Seat-based Enterprise plans below.
"""> Ha még aktuális: a 20$ csomag lehúzás a claude-nál.
számomra olyan értelemben nem lehúzás, hogy a havi $20 -ért
lépes vagyok napi $15-$30 -os tokenhasználatra.
( "ccusage" alapján ) -
Speeedfire
félisten
Ha még aktuális: a 20$ csomag lehúzás a claude-nál. Érzésre (nem bizonyíthatóan) nem 5x ad többet a nagyobb csomag. Elég nagy a fluktuáció token usage és quality szempontból. Vannak napok, hogy többször kell promptolni ugyanazt normális eredményért + gyorsabban ég a token -> 20$ hamar kifut a keretből. Főleg amikor új modellt vezetnek be, előtte 1-2 héttel lerontják a minőséget.
Tapasztalat: 20$ kifutott a múlt héten a keretből kb. 30 perc alatt, ugyanazzal a feladattal megállás nélkül dolgozok a nagyobb 100Euro-s Max csomaggal. Egyébként a Max-al eddig kb. napi 6 órát tudok folyamatosan dolgozni, ritkán fut ki a keretből. Bír többet is per nap, de lesznek holtidők + a heti keret kimerül. De én nem bírok többet
Ha kísérletezni akarsz, skilleket fejleszteni, stb. akkor 1 hónapra érdemes a nagy csomagra váltani a fable miatt. Azzal alakítsd ki a workflow-dat, skilleket, térképezd fel a kódokat, stb. és után válts olcsóbbra, akár másik szolgáltatónál.Jaja, anno el is engedtem. Jelenleg most picit alakítottam a wf-n, már nem eszik ennyi tokent.
Illetve beraktam egy litellm proxy-t, az opus kérés megy deepseek v4 pro-nak, a többi meg a 20-as minimax m3-ra. Így most elég jól elvagyok. -
Reggie0
titán
Ha még aktuális: a 20$ csomag lehúzás a claude-nál. Érzésre (nem bizonyíthatóan) nem 5x ad többet a nagyobb csomag. Elég nagy a fluktuáció token usage és quality szempontból. Vannak napok, hogy többször kell promptolni ugyanazt normális eredményért + gyorsabban ég a token -> 20$ hamar kifut a keretből. Főleg amikor új modellt vezetnek be, előtte 1-2 héttel lerontják a minőséget.
Tapasztalat: 20$ kifutott a múlt héten a keretből kb. 30 perc alatt, ugyanazzal a feladattal megállás nélkül dolgozok a nagyobb 100Euro-s Max csomaggal. Egyébként a Max-al eddig kb. napi 6 órát tudok folyamatosan dolgozni, ritkán fut ki a keretből. Bír többet is per nap, de lesznek holtidők + a heti keret kimerül. De én nem bírok többet
Ha kísérletezni akarsz, skilleket fejleszteni, stb. akkor 1 hónapra érdemes a nagy csomagra váltani a fable miatt. Azzal alakítsd ki a workflow-dat, skilleket, térképezd fel a kódokat, stb. és után válts olcsóbbra, akár másik szolgáltatónál.Erzesre ad 5x tobbet, csak mivel prioritast is kapsz, ezert hamarabb elhasznalod. A $20-as csomag erezhetoen lassabb csucsidoben.
Amugy meg optimalizalni kell a tokenekre, surun nyitni uj session-t, esetleg caveman-t hasznalni.
-
dippe
tag
Sziasztok,
vannak itt olyanok aki kódolásra használják az AI-t?
Próbáltam már a claude code-ot, de hamar elment a 20$ token csomag. Windsurf elég jó volt. Nemrég váltottam a minimax code plan-re, a 2.7 egész sokáig bírta. Most váltottak a 3-asra. Viszont mintha nagyon fogyna a token, és sokszor loopol ez látszik is, hogy a cache hit 90% fölötti. A deepseek v4 elég szimpi, alig eszi a tokent és konzisztens eredményt hoz. Kinek mi a tapasztalata? A claude max 20 lenne az igazi, de az havi 220 euro, ami fájó picit.


Ha még aktuális: a 20$ csomag lehúzás a claude-nál. Érzésre (nem bizonyíthatóan) nem 5x ad többet a nagyobb csomag. Elég nagy a fluktuáció token usage és quality szempontból. Vannak napok, hogy többször kell promptolni ugyanazt normális eredményért + gyorsabban ég a token -> 20$ hamar kifut a keretből. Főleg amikor új modellt vezetnek be, előtte 1-2 héttel lerontják a minőséget.
Tapasztalat: 20$ kifutott a múlt héten a keretből kb. 30 perc alatt, ugyanazzal a feladattal megállás nélkül dolgozok a nagyobb 100Euro-s Max csomaggal. Egyébként a Max-al eddig kb. napi 6 órát tudok folyamatosan dolgozni, ritkán fut ki a keretből. Bír többet is per nap, de lesznek holtidők + a heti keret kimerül. De én nem bírok többet
Ha kísérletezni akarsz, skilleket fejleszteni, stb. akkor 1 hónapra érdemes a nagy csomagra váltani a fable miatt. Azzal alakítsd ki a workflow-dat, skilleket, térképezd fel a kódokat, stb. és után válts olcsóbbra, akár másik szolgáltatónál. -
Reggie0
titán
-
DarkByte
addikt
-
Reggie0
titán
-
S_x96x_S
veterán
(vLLM)
"Intel Arc Pro B70 Review: The Hardware Is Ready, the Stack Needs to Catch Up"
https://www.storagereview.com/review/intel-arc-pro-b70-review
( July 14, 2026 ) -
Komplikato
veterán
Tudom ez nem egy HW topik, de nem jósda, de ki mit szól az elmúlt kb. 2 hét Apple híreihez? Vagy nevezzük pletykáknak.
Első körben jött azt, hogy az M6 szériában nem lesz pro, max és ultra, mert az M7-et akarja az Apple az új AI nagyágyúnak. Közben jött olyan pletyka, hogy lehet a maximum M7 vas röpke 1.5 TB egyesített memóriával jön. Közben volt egy hír, hogy folyamatba van az M8 tervezése.
Viszont nem nagyon vannak várható dátumok. -
S_x96x_S
veterán
Mélyvizes - CPU Mátrixszámítás,
X86: AVX512-VNNI, AMX, ACE ; ARM: SME; SME2
"Is x86 ready to ACE it?" Jul 14, 2026
https://chipsandcheese.com/p/is-x86-ready-to-ace-it----
A lényeg,
hogy a következő években érdemes
- mátrixszámításra optimalizált
X86: ACE vagy ARM:SV2 -es procit preferálni.
( vagy másképpen ne csak a GPU-t nézd ) -
Necroman_Mk2
őstag
A Gemini képgenerálásnál melyik a jobb opció, ha licencelt tartalmakat is bele akarok venni: a 3.5 vagy a 3.1 Pro? A Lite-t nem használgatom, mert nekem nem fontos a leggyorsabb válasz.
-
perempe
veterán
Sonny Rollins St. Thomas számát nem ismerte fel, pedig szerintem jól szolmizáltam.
-
consono
nagyúr
-
Geller72
veterán
Plan módban egy erős modell architect skillekkel megtervezi majd terv split több senior fejlesztőnek utána review majd teszt. Erős modellek terveznek és kódolnak, olcsóbb modellek tesztelnek, bash parancsot futtatnak stb.

Geller72: igen, azt láttam hoy most már ott is csúcsidők vannak.
openroutert használsz? vagy hogy tudod így keverni a modelleket?Nincs szükségem open routerre.(sem). Ha érdekel, privátban megírom a szoftveres/hw-s setupom.
-
kenand
veterán
Esküt nem teszek rá, de ez a Tencent modell annyira olcsó a fizetős változatban is, hogy becsülve: kb. az "Egy sörért egy hétvége" szint.
Ez azért lehet fontos, mert az a korábbi tapasztalatom más hasonló "Ingyenes kontra Fizetős"esetekben az volt, hogy az ingyenes modell lassabb, nem tud minden képességet(mint a fizetős) és sok esetben a kontextus méret is kisebb a gyakorlatban, bár papíron azonos, valós használatban megtapasztalva: DE NEM AZONOS, sokkal kisebb!
Fizetős Gemini pro-t próbáltam jó volt, de 10 USD-t hamar elfogyasztott, a DeepSeek pro 10-ed annyit sem kért, Falsh, meg még olcsóbb. Tencentet is majd megnézem.
-
5leteseN
őstag
Nem egyben 2 oldalanként (DEEPL egyben is tud)
A legjobb a Gemini egyébként, de DEEPL-lel korábban lefordított könyveket gemini segítségével - korábbi részek magyar műfordításait Geminivel átfuttatva promtot+ glossary-t készítve egész jól lehetett korrigálni.Más t5rületen......
Whisper+ Racka jó lenne ha okostíva rendesn le tudna írni/korrigálni orvosi diktált leleteket
Igazából emiatt kezdtem lokál LLM-eket próbálgatni , fordítás csak hobby-kíváncsiság volt#4144
Tencent Hy3-at majd megnézem
De Deepseek chat ablak is "ingyenes Dan Abnett Interceptor City-t lefordítottam vele.Esküt nem teszek rá, de ez a Tencent modell annyira olcsó a fizetős változatban is, hogy becsülve: kb. az "Egy sörért egy hétvége" szint.
Ez azért lehet fontos, mert az a korábbi tapasztalatom más hasonló "Ingyenes kontra Fizetős"esetekben az volt, hogy az ingyenes modell lassabb, nem tud minden képességet(mint a fizetős) és sok esetben a kontextus méret is kisebb a gyakorlatban, bár papíron azonos, valós használatban megtapasztalva: DE NEM AZONOS, sokkal kisebb!
-
consono
nagyúr
Nem egyben 2 oldalanként (DEEPL egyben is tud)
A legjobb a Gemini egyébként, de DEEPL-lel korábban lefordított könyveket gemini segítségével - korábbi részek magyar műfordításait Geminivel átfuttatva promtot+ glossary-t készítve egész jól lehetett korrigálni.Más t5rületen......
Whisper+ Racka jó lenne ha okostíva rendesn le tudna írni/korrigálni orvosi diktált leleteket
Igazából emiatt kezdtem lokál LLM-eket próbálgatni , fordítás csak hobby-kíváncsiság volt#4144
Tencent Hy3-at majd megnézem
De Deepseek chat ablak is "ingyenes Dan Abnett Interceptor City-t lefordítottam vele.A Gemini tényleg jó ebben. Kis adagokban főleg.
Képről szöveg atírására a 9B-s Qwen 3.5 is működött, megér egy próbát a whisperrel összekötni... -
kenand
veterán
Nem egyben 2 oldalanként (DEEPL egyben is tud)
A legjobb a Gemini egyébként, de DEEPL-lel korábban lefordított könyveket gemini segítségével - korábbi részek magyar műfordításait Geminivel átfuttatva promtot+ glossary-t készítve egész jól lehetett korrigálni.Más t5rületen......
Whisper+ Racka jó lenne ha okostíva rendesn le tudna írni/korrigálni orvosi diktált leleteket
Igazából emiatt kezdtem lokál LLM-eket próbálgatni , fordítás csak hobby-kíváncsiság volt#4144
Tencent Hy3-at majd megnézem
De Deepseek chat ablak is "ingyenes Dan Abnett Interceptor City-t lefordítottam vele. -
Speeedfire
félisten
Plan módban egy erős modell architect skillekkel megtervezi majd terv split több senior fejlesztőnek utána review majd teszt. Erős modellek terveznek és kódolnak, olcsóbb modellek tesztelnek, bash parancsot futtatnak stb.

Geller72: igen, azt láttam hoy most már ott is csúcsidők vannak.
openroutert használsz? vagy hogy tudod így keverni a modelleket? -
Geller72
veterán
Sziasztok,
vannak itt olyanok aki kódolásra használják az AI-t?
Próbáltam már a claude code-ot, de hamar elment a 20$ token csomag. Windsurf elég jó volt. Nemrég váltottam a minimax code plan-re, a 2.7 egész sokáig bírta. Most váltottak a 3-asra. Viszont mintha nagyon fogyna a token, és sokszor loopol ez látszik is, hogy a cache hit 90% fölötti. A deepseek v4 elég szimpi, alig eszi a tokent és konzisztens eredményt hoz. Kinek mi a tapasztalata? A claude max 20 lenne az igazi, de az havi 220 euro, ami fájó picit.


A Claude-ot csak auditra, promptkészítésre használd, kódolásra a DeepSeek jó. Most már ott is van csúcsidő és azon kívüli időszak, ezt majd csekkold. Én a V4 Pro-val kezdtem, de kellő keretek/protokollok közé szorítva a flash is elég és az töredéke a Pro-nak, pedig az sem drága a Claude/Codex-hez képest. Hermes Agentel (is) használom a DeepSeek-et (API-val), saját skilleket is definiáltam neki, ezt is a Codex/Claude tartja karban, de a hermes is nagyon szépen fejleszti a meglévő skilleket, amiket megadok neki használatra (toolokat is).

*A DeepSeek esetében a táblázat a teljes (cache-miss) bemeneti tokenek árait mutatja. Ismételt promptok esetén a háttértár-alapú kontextus-kezelés miatt a bemeneti ár akár a töredékére (90-99%-kal) is csökkenhet. -
S_x96x_S
veterán
Ezeknek egy részét ismerem, használtam is. Illetve volt amit ismerős próbált. Redditen is nézelődtem már, illetve openrouter alatt, hogy miket használnak. De mindenütt vegyses leírást találtam.
pl a glm5 is szimpi, de leírások alapján nincs kiforrva még az a csomag.Így nehéz távolról tanácsot adni, hogy mi lehet a probléma.
Talán még a workflow-dat érdemes megvizsgálni.
( mert nem kell mindig Kaviáros Fable5 - vagy high end modell )u.i: A GLM 5.2 - a top open modell (a deepseek v4 gyengébb )
-
Speeedfire
félisten
rengeteg kódolos csomag van.
https://hermesguide.xyz/coding-plans/és speciel most a Fable5 vs. Chatgpt Sol -t tesztelgetem
két 20$ -os csomaggal.
( már amig a Fable5 - engedélyezve lesz, vagy ki nem fogyok a keretből )Ezeknek egy részét ismerem, használtam is. Illetve volt amit ismerős próbált. Redditen is nézelődtem már, illetve openrouter alatt, hogy miket használnak. De mindenütt vegyses leírást találtam.
pl a glm5 is szimpi, de leírások alapján nincs kiforrva még az a csomag. -
S_x96x_S
veterán
De látod, hogy mégis magas a fogyasztás. Pedig ugyanazzal a .claude beállításokkal fut a deepseek és mégis hatákonyabb. Agent alapú a kódolás. Szerintem az M3 llm thinkg módja miatt lehet ez a loop, vagy mert buta. De szintetikus tesztek szerint meg okos. A fene se tudja.
rengeteg kódolos csomag van.
https://hermesguide.xyz/coding-plans/és speciel most a Fable5 vs. Chatgpt Sol -t tesztelgetem
két 20$ -os csomaggal.
( már amig a Fable5 - engedélyezve lesz, vagy ki nem fogyok a keretből ) -
Speeedfire
félisten
De látod, hogy mégis magas a fogyasztás. Pedig ugyanazzal a .claude beállításokkal fut a deepseek és mégis hatákonyabb. Agent alapú a kódolás. Szerintem az M3 llm thinkg módja miatt lehet ez a loop, vagy mert buta. De szintetikus tesztek szerint meg okos. A fene se tudja.
-
Károly85
tag
Apple és OpenAI közötti viszony drámai eszkalálódott egy 2026. július 10-én benyújtott perrel, amelyben az Apple vádat emelt az OpenAI ellen, miszerint a mesterséges intelligencia cég kereskedelmi titkokat lopott, hogy saját AI hardvereket fejlesszen.
-
consono
nagyúr
Sziasztok,
vannak itt olyanok aki kódolásra használják az AI-t?
Próbáltam már a claude code-ot, de hamar elment a 20$ token csomag. Windsurf elég jó volt. Nemrég váltottam a minimax code plan-re, a 2.7 egész sokáig bírta. Most váltottak a 3-asra. Viszont mintha nagyon fogyna a token, és sokszor loopol ez látszik is, hogy a cache hit 90% fölötti. A deepseek v4 elég szimpi, alig eszi a tokent és konzisztens eredményt hoz. Kinek mi a tapasztalata? A claude max 20 lenne az igazi, de az havi 220 euro, ami fájó picit.


A magas cache hit az jó neked, annyival kevesebb token fogy, nem? Nem kell a kontextust mindig újra és újra elküldeni... A loopolás nem hiszem, hogy ettől lenne.
-
Speeedfire
félisten
Sziasztok,
vannak itt olyanok aki kódolásra használják az AI-t?
Próbáltam már a claude code-ot, de hamar elment a 20$ token csomag. Windsurf elég jó volt. Nemrég váltottam a minimax code plan-re, a 2.7 egész sokáig bírta. Most váltottak a 3-asra. Viszont mintha nagyon fogyna a token, és sokszor loopol ez látszik is, hogy a cache hit 90% fölötti. A deepseek v4 elég szimpi, alig eszi a tokent és konzisztens eredményt hoz. Kinek mi a tapasztalata? A claude max 20 lenne az igazi, de az havi 220 euro, ami fájó picit.


-
Komplikato
veterán
Az általános(ított: MI/AI-s
) tapasztalat az, hogy a 20B-s méretű LLM-ektől kezdődik a magyar körüli nemzetközi súlyú nyelvek esetén a használható méretű "segédeszköz"!
Ezekből is a Q5-ös kvantálású!
Javaslatom: Ha nem SzigBiz az anyag, akkor én kisebb darabokban lefordíttatnám az Openrouter-ingyenes Tencent:Hy3(Free)-vel.
Nem véletlenül használja boldog-boldogtalan(köztük és is), többnyire sikeresen.
Négy nap alatt ekkora felhasználás:
...példátlan érték! A Nyugati konkurensek (nem-)kicsit megroggyantak!
"A verseny jó!"
...végre!
Enyhe OFF: Remélem minél előbb belép Kína a VGA-k területére is!
Vagy 10 éve gyártják az Atlas szériát. Most jött ki az új (300i?) 96GB-os kártya, csak hát 2800+ dolcsi. És az nem megy bármilyen szoftver környezetben. Gamer kártyára meg hülyék lennének pazarolni a gyártósort.
-
freeapro
senior tag
Az általános(ított: MI/AI-s
) tapasztalat az, hogy a 20B-s méretű LLM-ektől kezdődik a magyar körüli nemzetközi súlyú nyelvek esetén a használható méretű "segédeszköz"!
Ezekből is a Q5-ös kvantálású!
Javaslatom: Ha nem SzigBiz az anyag, akkor én kisebb darabokban lefordíttatnám az Openrouter-ingyenes Tencent:Hy3(Free)-vel.
Nem véletlenül használja boldog-boldogtalan(köztük és is), többnyire sikeresen.
Négy nap alatt ekkora felhasználás:
...példátlan érték! A Nyugati konkurensek (nem-)kicsit megroggyantak!
"A verseny jó!"
...végre!
Enyhe OFF: Remélem minél előbb belép Kína a VGA-k területére is!
mire használtál el ennyi tokent?

-
5leteseN
őstag
Vagy 7-8-at kipróbáltam, olyanokat amik beleférnek 10GB VRAM-ba. Volt ami működött, de túl tükör volt, meg néha félrefordítás. Legbosszantóbb, viszont fordítás helyett szétesés és félrebeszélés.
Tény regény, volt nem egyszerű szöveggel.
Jól csak a Gemini működött (még Deepseeknek is kellett hozzá egy kis Gemini promtolás). Gemini token hamar elfogyott, ingyenes 10 USD is, emiatt DeepSeek maradt Gemini finomhangolással. Amúgy a Gemini totál képben van az íróval és a regény világával is (Dan Abnett, Horus Heresy és Warhamer 40k)Az általános(ított: MI/AI-s
) tapasztalat az, hogy a 20B-s méretű LLM-ektől kezdődik a magyar körüli nemzetközi súlyú nyelvek esetén a használható méretű "segédeszköz"!
Ezekből is a Q5-ös kvantálású!
Javaslatom: Ha nem SzigBiz az anyag, akkor én kisebb darabokban lefordíttatnám az Openrouter-ingyenes Tencent:Hy3(Free)-vel.
Nem véletlenül használja boldog-boldogtalan(köztük és is), többnyire sikeresen.
Négy nap alatt ekkora felhasználás:
...példátlan érték! A Nyugati konkurensek (nem-)kicsit megroggyantak!
"A verseny jó!"
...végre!
Enyhe OFF: Remélem minél előbb belép Kína a VGA-k területére is!
-
consono
nagyúr
Vagy 7-8-at kipróbáltam, olyanokat amik beleférnek 10GB VRAM-ba. Volt ami működött, de túl tükör volt, meg néha félrefordítás. Legbosszantóbb, viszont fordítás helyett szétesés és félrebeszélés.
Tény regény, volt nem egyszerű szöveggel.
Jól csak a Gemini működött (még Deepseeknek is kellett hozzá egy kis Gemini promtolás). Gemini token hamar elfogyott, ingyenes 10 USD is, emiatt DeepSeek maradt Gemini finomhangolással. Amúgy a Gemini totál képben van az íróval és a regény világával is (Dan Abnett, Horus Heresy és Warhamer 40k)Könyvet akarsz fordítatni vele???
-
kenand
veterán
Vagy 7-8-at kipróbáltam, olyanokat amik beleférnek 10GB VRAM-ba. Volt ami működött, de túl tükör volt, meg néha félrefordítás. Legbosszantóbb, viszont fordítás helyett szétesés és félrebeszélés.
Tény regény, volt nem egyszerű szöveggel.
Jól csak a Gemini működött (még Deepseeknek is kellett hozzá egy kis Gemini promtolás). Gemini token hamar elfogyott, ingyenes 10 USD is, emiatt DeepSeek maradt Gemini finomhangolással. Amúgy a Gemini totál képben van az íróval és a regény világával is (Dan Abnett, Horus Heresy és Warhamer 40k) -
5leteseN
őstag
-
kenand
veterán
sajnos nem mindenkinek elérhető ( hozzáférést kell kérni )
https://huggingface.co/elte-nlp/Racka-4BPróbáltam a rackat fordításra használni, sajna nem volt jó.
-
Komplikato
veterán
A Dianas kamu választási propaganda valószínűleg nagyobb büntetési tétel lehetne. Elvileg fel is lettek miatta jelentve a briteknél.
-
headhunter
addikt
Egy ilyen elkészítésének és közzétételének, mennyi a "büntetési" tétele? [link]
-
5leteseN
őstag
-
Szevam
senior tag
A ChatGPT-s OpenAI -nak van oktató anyaga
https://academy.openai.com/pages/courses?linkMenu=Coursesés azon belül sok gyakorlati tippet is találsz
pl. "marketing"
https://academy.openai.com/public/search?query=marketing&type=allNagyon köszi!
-
5leteseN
őstag
-
5leteseN
őstag
Nagyon beindult az Openrouter-en:

Valaki használta már a "környéken"?
Milyen? -
S_x96x_S
veterán
A ChatGPT-s OpenAI -nak van oktató anyaga
https://academy.openai.com/pages/courses?linkMenu=Coursesés azon belül sok gyakorlati tippet is találsz
pl. "marketing"
https://academy.openai.com/public/search?query=marketing&type=all -
Szevam
senior tag
Mivel ingyenes próbáld ki.
( maximum elavult vagy túl kezdő lehet - és elvesztegetsz pár órát. )( itt a fórumban legtöbben már rég túl vagyunk azon a szinten, őgyhogy nem nagyon van róla véleményünk )
>Tud valaki ingyenes vagy olcsó, de minőségi képzést MI-val kapcsolatosan?
Milyen szinten szeretnéd megismerni az AI-t ?
- Teljesen nulláról?
- próbálgattad már szintről
- programoztál is már szintrőlÉs magyar vagy angol képzés érdekel?
Amúgy kb 1 év alatt az AI tudás durván 80%-a elavul.például itt egy random linkgyüjtemény:
https://github.com/buildonlabs-org/awesome-ai-learningIgazából használni szeretném a munkámhoz, amennyire lehet.
Próbálok minél hamarabb minél magasabb szintre eljutni vele. De lehet csinálok a chatgpt-vel egy szintfelmérőt...
. -
5leteseN
őstag
Mivel ingyenes próbáld ki.
( maximum elavult vagy túl kezdő lehet - és elvesztegetsz pár órát. )( itt a fórumban legtöbben már rég túl vagyunk azon a szinten, őgyhogy nem nagyon van róla véleményünk )
>Tud valaki ingyenes vagy olcsó, de minőségi képzést MI-val kapcsolatosan?
Milyen szinten szeretnéd megismerni az AI-t ?
- Teljesen nulláról?
- próbálgattad már szintről
- programoztál is már szintrőlÉs magyar vagy angol képzés érdekel?
Amúgy kb 1 év alatt az AI tudás durván 80%-a elavul.például itt egy random linkgyüjtemény:
https://github.com/buildonlabs-org/awesome-ai-learning+1, + : Mire a (korábban példátlan gyorsasággal fejlődő) AI/MI tudást szakmailag jó szintan átviszik az ilyen árú oktatásba, addigra a 80%-a elavul! A "naprakész" szint pedig megfizethetetlen, kb. csak a multi-nackó cégeknek.
Az önképzés az egyetlen járható út(szerintem is)jelenleg, ami átlagos magánszemélyként megfizethető árszínvonal.
Nem lehetetlen! -
S_x96x_S
veterán
Sziasztok!
Mi a véleményetek erről a képzésről?
Van valakinek tapasztalata?
Tud valaki ingyenes vagy olcsó, de minőségi képzést MI-val kapcsolatosan?Mivel ingyenes próbáld ki.
( maximum elavult vagy túl kezdő lehet - és elvesztegetsz pár órát. )( itt a fórumban legtöbben már rég túl vagyunk azon a szinten, őgyhogy nem nagyon van róla véleményünk )
>Tud valaki ingyenes vagy olcsó, de minőségi képzést MI-val kapcsolatosan?
Milyen szinten szeretnéd megismerni az AI-t ?
- Teljesen nulláról?
- próbálgattad már szintről
- programoztál is már szintrőlÉs magyar vagy angol képzés érdekel?
Amúgy kb 1 év alatt az AI tudás durván 80%-a elavul.például itt egy random linkgyüjtemény:
https://github.com/buildonlabs-org/awesome-ai-learning -
freeapro
senior tag
-
Szevam
senior tag
Sziasztok!
Mi a véleményetek erről a képzésről?
Van valakinek tapasztalata?
Tud valaki ingyenes vagy olcsó, de minőségi képzést MI-val kapcsolatosan? -
consono
nagyúr
Elképzelhető,
hogy a jövőben a Kínai Top modellek hozzáférhetősége is korlátozva lesz.
"Beijing is looking at curbing overseas access to China's top AI models, sources say"
https://www.reuters.com/world/beijing-is-looking-curbing-overseas-access-chinas-top-ai-models-sources-say-2026-07-07/
"""
Summary:
- Alibaba, ByteDance and Z.ai attended meetings with authorities, sources say
- Officials suggest leaks or thefts of AI could become punishable under national security law, source says
- New restrictions on who can fund domestic AI startups possible, source says
- US has also restricted access to its top AI models on national security concerns
"""Vagy nem, vagy mégis, vagy ki tudja
https://www.reddit.com/r/LocalLLaMA/s/p6z8BujalL -
S_x96x_S
veterán
Elképzelhető,
hogy a jövőben a Kínai Top modellek hozzáférhetősége is korlátozva lesz.
"Beijing is looking at curbing overseas access to China's top AI models, sources say"
https://www.reuters.com/world/beijing-is-looking-curbing-overseas-access-chinas-top-ai-models-sources-say-2026-07-07/
"""
Summary:
- Alibaba, ByteDance and Z.ai attended meetings with authorities, sources say
- Officials suggest leaks or thefts of AI could become punishable under national security law, source says
- New restrictions on who can fund domestic AI startups possible, source says
- US has also restricted access to its top AI models on national security concerns
""" -
S_x96x_S
veterán
Megjelentek ma az "AMD AI Halo" -tesztek
"AMD Ryzen AI Halo Is An Excellent & Powerful Mini PC With Fully Open-Source Software"
https://www.phoronix.com/review/amd-ryzen-ai-haloA Ryzen AI Halo(Strix Halo) vs. RTX SPARK(GB10):
- Az AMD CPU -ban és Linux + Windows + Gaming kompatibilitásban extrém erős.
- Token generálás: nincs akkora nagy eltérés.
- PrompPrcessing: az RTX Spark 2x-3x olyan erős.---
Alex Ziskind értékelése is nagyrészt pozitiv, kiemelve,
hogy most minden müködik ( ellentétben 1 évvel ezelőtt)
https://www.youtube.com/watch?v=DDxnLzO356U -
5leteseN
őstag
Most ugye Karpathy ötlete nyomán elkezdett folyni a kutatás hogyan lehetne létrehozni egy nagyon kis modelt (cognitive core, max. 2-3B méretben), ami nem akarja memorizálni az egész internetet, csak az érvelési logikához és gondolkodáshoz szükséges minimumot tartalmazná disztillállva, és ami már elég ahhoz hogy eszközt tudjon használni mint agent, de ezen túl minden információt úgy kell beszereznie magának.
Ez sem egyszerű feladat, mert nyilván nehéz megmondani mi az a határ ameddig ezt lehet csinálni és hogyan választod le ami "feles".
Azért van első fecske a MiniCPM5 képében. Nyilván még nagyon korai, de a mérete ellenére egész érdekes. Főleg INT4 kvantálva ~500MB csak, ami már embedded eszköz használatot is megenged.
De mindenesetre az irány érdekes, mert a nagy AI modellek halucinálása pont abból ered hogy minden is meg van neki tanítva és egy nagy katyvasz van a fejében. Ráadásul az az információ mindig a múlt egy lenyomata, szóval ígyis-úgyis kell neki odatenni kontextbe releváns friss infót, ha naprakész dolgokat akarsz vele kezelni.
...az én ötletem nyomán!

...és nem is úgy hívnak!

Innen: "... Elméletileg egy csak a döntéseket, válasz-kidolgozó algoritmusokat, és azok kombinációit kereső LLM(ha egyáltalán ez lenne a kategóriája/neve), 1B-be is belefér!
Az európai(+nagyobb ázsiai) nyelvek prompt-értelmezése is kb. 4B méret lenne, max!
A többit meg szedje össze a netről!
...ééés, már meg s van a max 6B-s modell, ami még 8-as kvantálással is belefér egy 8GB-os VGA-ba a Windows mellé.
Asszemezt az 5letet ITT, vagy az Mp3pintyo Discord-on fel is vetettem a kérdést tavaly!Kérdeztem, is, hogy van-e csak erre használható LLM, de nem jött válasz!
Ezek szerint azért, mert nem volt ilyen akkor még! ..."
...megyek bontok egy "Hip-Hip Hurrá"-sört!
-
DarkByte
addikt
Már megkérdeztem (egy fizetős AI "ismerőst": Kimi 2.6 Agent) és azt mondta, hogy pár-% a méretcsökkenés, és (szerinte) nem érné meg, de utólag nem is lehet egyszerűen "kivennl" a feleslegesnek ítélt nyelveket!
Nem tudom, hogy igaz-e?
Annyit megtettem még, hogy háromszor is megkérdeztem, mindháromszor ez volt a válasz lényege!Most ugye Karpathy ötlete nyomán elkezdett folyni a kutatás hogyan lehetne létrehozni egy nagyon kis modelt (cognitive core, max. 2-3B méretben), ami nem akarja memorizálni az egész internetet, csak az érvelési logikához és gondolkodáshoz szükséges minimumot tartalmazná disztillállva, és ami már elég ahhoz hogy eszközt tudjon használni mint agent, de ezen túl minden információt úgy kell beszereznie magának.
Ez sem egyszerű feladat, mert nyilván nehéz megmondani mi az a határ ameddig ezt lehet csinálni és hogyan választod le ami "feles".
Azért van első fecske a MiniCPM5 képében. Nyilván még nagyon korai, de a mérete ellenére egész érdekes. Főleg INT4 kvantálva ~500MB csak, ami már embedded eszköz használatot is megenged.
De mindenesetre az irány érdekes, mert a nagy AI modellek halucinálása pont abból ered hogy minden is meg van neki tanítva és egy nagy katyvasz van a fejében. Ráadásul az az információ mindig a múlt egy lenyomata, szóval ígyis-úgyis kell neki odatenni kontextbe releváns friss infót, ha naprakész dolgokat akarsz vele kezelni.
-
consono
nagyúr
Már megkérdeztem (egy fizetős AI "ismerőst": Kimi 2.6 Agent) és azt mondta, hogy pár-% a méretcsökkenés, és (szerinte) nem érné meg, de utólag nem is lehet egyszerűen "kivennl" a feleslegesnek ítélt nyelveket!
Nem tudom, hogy igaz-e?
Annyit megtettem még, hogy háromszor is megkérdeztem, mindháromszor ez volt a válasz lényege!
Simán lehet, hogy nem lehet kivenni, láttad, hogy beletenni sem egyszerű 
-
5leteseN
őstag
Hát, én úgy érzem dense kell ehhez, de ez csak megérzés. Biztos lehetne használni a MEK könyveit, a stílusát valószínűleg javíthatná is a modellnek, a nyelvtudásával kicsit szkeptikus vagyok.
Az az érdekes, hogy a gemma is meg a qwen is tud magyarul, azokban megvan a magyar nyelvtani képesség is, mert a nagyobb modellek tudnak egész értelmesen beszélni magyarul is. Azt is érdemes lenne megnézni, hogy a nagy dense modellekből nem lehetne e kisebbet gyártani a többi nyelv "kioperálásával".
Már megkérdeztem (egy fizetős AI "ismerőst": Kimi 2.6 Agent) és azt mondta, hogy pár-% a méretcsökkenés, és (szerinte) nem érné meg, de utólag nem is lehet egyszerűen "kivennl" a feleslegesnek ítélt nyelveket!
Nem tudom, hogy igaz-e?
Annyit megtettem még, hogy háromszor is megkérdeztem, mindháromszor ez volt a válasz lényege! -
freeapro
senior tag
Más. Tencent Hy3 vajon tényleg ilyen jó, vagy csak hype?
New open model from Tencent Hy: Hy3 (295B total 21B active - apache 2.0) : r/LocalLLaMA -
freeapro
senior tag
Hát, én úgy érzem dense kell ehhez, de ez csak megérzés. Biztos lehetne használni a MEK könyveit, a stílusát valószínűleg javíthatná is a modellnek, a nyelvtudásával kicsit szkeptikus vagyok.
Az az érdekes, hogy a gemma is meg a qwen is tud magyarul, azokban megvan a magyar nyelvtani képesség is, mert a nagyobb modellek tudnak egész értelmesen beszélni magyarul is. Azt is érdemes lenne megnézni, hogy a nagy dense modellekből nem lehetne e kisebbet gyártani a többi nyelv "kioperálásával".
Én nem operálnék ki semmilyen más nyelvet, mert így tudna fordítani.
-
consono
nagyúr
Hát, én úgy érzem dense kell ehhez, de ez csak megérzés. Biztos lehetne használni a MEK könyveit, a stílusát valószínűleg javíthatná is a modellnek, a nyelvtudásával kicsit szkeptikus vagyok.
Az az érdekes, hogy a gemma is meg a qwen is tud magyarul, azokban megvan a magyar nyelvtani képesség is, mert a nagyobb modellek tudnak egész értelmesen beszélni magyarul is. Azt is érdemes lenne megnézni, hogy a nagy dense modellekből nem lehetne e kisebbet gyártani a többi nyelv "kioperálásával".
-
freeapro
senior tag
Azon gondolkodom valamelyik modellre érdemes lenne ráengedni a MEK könyvtárat. Ha jól láttam van Donato-nak ilyen toolboxa, de még sosem foglalkoztam vele. Vajon MoE modellre is rá lehete engedni, vagy csak valami dense-re? Valamelyik qwen 3.6 jó alap lenne.
-
freeapro
senior tag
> Nem igazán értem, hogy mi volt a fejlesztés célja.
- Tapasztalatszerzés, Tanulás
- Csapatban: referencia, hogy újabb pályázati pénzekhez jussanak.
- Egyénileg: jobb álláslehetőségek ; pl.
hogyha valakinek benne van valami hasonló a CV-jében, akkor az OpenAI/Anthropic felvételi első szűrőjét meg tudja ezzel ugrani.Vajon hány milliárdot nyomhattak el erre.
-
consono
nagyúr
-
S_x96x_S
veterán
> Nem igazán értem, hogy mi volt a fejlesztés célja.
- Tapasztalatszerzés, Tanulás
- Csapatban: referencia, hogy újabb pályázati pénzekhez jussanak.
- Egyénileg: jobb álláslehetőségek ; pl.
hogyha valakinek benne van valami hasonló a CV-jében, akkor az OpenAI/Anthropic felvételi első szűrőjét meg tudja ezzel ugrani. -
5leteseN
őstag
-
consono
nagyúr
-
5leteseN
őstag
-
freeapro
senior tag
Szerintem általános magyarításra nem LoRA való, azt inkább valami specifikus információ hozzáadására használnám.
-
consono
nagyúr
Elismerésem! Egyedül, saját gépen, pár hét alatt!

A másik oldalon (állítólag) egy csapat munkája van, legkevesebb 50-szeres gépi háttérrel kb. 16 hónap alatt!
Nálam -az arányokat és az eredményt is figyelembe véve: magasan- Te nyertél!

A "másik" csapat főnökeinek a számát (min.) megfelezném, a fizetéseik feléből a (valóban) a programon dolgozók létszámát és célprémiumát pedig megdupláznám: kb. 2-3 hónapon belül egy szép eredmény születne!
Ihletet merítettem Szun-Ce írásaiból, amik a hasonló esetekre vonatkoztak!
/ 
Jut eszembe: Próbáltad megcsináltatni az MI-vel?
![;]](//cdn.rios.hu/dl/s/v1.gif)
Egy poént megérne!
Nyilván csak kísérlet volt, hogy van e értelme, és természetesen AI segítséggel. Meg kicsi tanító setekkel, leginkább a "saillab/alpaca-hungarian-cleaned" volt, amivel dolgoztam. Ja és Qwen 2.5, nem 3.5. 3b
Két példa, hogy mennyire(NEM) sikerült javítani:
-
freeapro
senior tag
Nem igazán értem, hogy mi volt a fejlesztés célja. Szerintem a nagy nyelvi modellek tudnak magyarul. A kisebbek roszabbul, a nagyobbak jobban. Szerintem ez minőségi probléma, nem valamilyen szisztematikus hiba.
-
5leteseN
őstag
Elismerésem! Egyedül, saját gépen, pár hét alatt!

A másik oldalon (állítólag) egy csapat munkája van, legkevesebb 50-szeres gépi háttérrel kb. 16 hónap alatt!
Nálam -az arányokat és az eredményt is figyelembe véve: magasan- Te nyertél!

A "másik" csapat főnökeinek a számát (min.) megfelezném, a fizetéseik feléből a (valóban) a programon dolgozók létszámát és célprémiumát pedig megdupláznám: kb. 2-3 hónapon belül egy szép eredmény születne!
Ihletet merítettem Szun-Ce írásaiból, amik a hasonló esetekre vonatkoztak!
/ 
Jut eszembe: Próbáltad megcsináltatni az MI-vel?
![;]](//cdn.rios.hu/dl/s/v1.gif)
Egy poént megérne!
-
consono
nagyúr
Egy másik ezzel foglalkozó oldalon se sokat tudtuk dicsérni! ...sajnos!
Én a felhalmozott anyagokból, tudásból (Q)LoRA-t raknék össze, és abból kis munkával lehet az elkészült kiegészítést konvertálással még jó-pár évig használhatóvá tenni sok következő LLM-hez!
Például, konkrétan: Qwen3.5/Qwen3.6-ok ..., Gemma3/Gemma4-ek...Kevés pénzből szinte mindig használhatót (nem ritkán kiemelkedőt) hozunk létre!
Amikor pedig van pénz, olyankor a felbukkanó hiénáké a "nagy-pénz", és a maradék már csak a nyomokban(se) sikeres eredményre elég.

Én próbáltam ezt kicsiben, lokálisan, sajnos nem annyira triviális az sem... Qwen3.5-öt próbáltam jobb magyarra bírni LoRA-val, mert az legalább alapból is tud, de hát az is kb. azt az eredményt hozta, mint a fenti képen, ami látszik. Vagy még rosszabbat
-
5leteseN
őstag
Egy másik ezzel foglalkozó oldalon se sokat tudtuk dicsérni! ...sajnos!
Én a felhalmozott anyagokból, tudásból (Q)LoRA-t raknék össze, és abból kis munkával lehet az elkészült kiegészítést konvertálással még jó-pár évig használhatóvá tenni sok következő LLM-hez!
Például, konkrétan: Qwen3.5/Qwen3.6-ok ..., Gemma3/Gemma4-ek...Kevés pénzből szinte mindig használhatót (nem ritkán kiemelkedőt) hozunk létre!
Amikor pedig van pénz, olyankor a felbukkanó hiénáké a "nagy-pénz", és a maradék már csak a nyomokban(se) sikeres eredményre elég.

-
DarkByte
addikt
sajnos nem mindenkinek elérhető ( hozzáférést kell kérni )
https://huggingface.co/elte-nlp/Racka-4BEgy Qwen3-4B továbbtanítás lényegében. Annak is elég gyenge ránézésre.
Next.
-
tasiadam
veterán
sajnos nem mindenkinek elérhető ( hozzáférést kell kérni )
https://huggingface.co/elte-nlp/Racka-4BItt a racka tudasa
-
S_x96x_S
veterán
sajnos nem mindenkinek elérhető ( hozzáférést kell kérni )
https://huggingface.co/elte-nlp/Racka-4B
Új hozzászólás Aktív témák
-
Fórumok
PROHARDVER! - hardver fórumok
Notebookok TV & Audió Digitális fényképezés Alaplapok, chipsetek, memóriák Processzorok, tuning Hűtés, házak, tápok, modding Videokártyák Monitorok Adattárolás Multimédia, életmód, 3D nyomtatás Nyomtatók, szkennerek Tabletek, E-bookok PC, mini PC, barebone, szerver Beviteli eszközök Egyéb hardverek PROHARDVER! BlogokMobilarena - mobil fórumok
Okostelefonok Mobiltelefonok Okosórák Autó+mobil Üzlet és Szolgáltatások Mobilalkalmazások Tartozékok, egyebek Mobilarena blogokIT café - infotech fórumok
Infotech Hálózat, szolgáltatók OS, alkalmazások SzoftverfejlesztésGAMEPOD - játék fórumok
PC játékok Konzol játékok MobiljátékokLOGOUT - lépj ki, lépj be!
LOGOUT reakciók Monologoszféra FototrendFÁRADT GŐZ - közösségi tér szinte bármiről
Tudomány, oktatás Sport, életmód, utazás, egészség Kultúra, művészet, média Gazdaság, jog Technika, hobbi, otthon Társadalom, közélet Egyéb Lokál PROHARDVER! interaktív
- Bomba ár! Lenovo ThinkPad L13 Yoga I i5-10210U I 8GB I 256SSD I 13,3" FHD Touch I W11 I 6 hó gari
- Acer Aspire 5 - 15.6"FHD IPS - Ryzen 5 4500U - 8GB - 512GB - Win11 - Radeon RX 640 2GB - MAGYAR
- Bomba ár! Lenovo ThinkPad T580 I i5-8350U I 16GB I 256SSD I 15,6" FHD I W11 I 6 hó gari
- ASUS PCE-AXE5400 WiFi 6E PCI-E Adapter
- Samsung Galaxy A54 5G 256GB Dobozos 12 hónap garanciával

Igazán valahogy azt a működésmódot keresem, amivel az Opus látványosan jó eredményt produkál. Nem csak a nagy modellt, mert nyilván az is számít, hanem azt, hogy jókor és jó kérdéseket tesz fel és, hogy FELTESZI a kérdést, mikor érdemi döntési helyzet van. Persze biztos ennek is ki lehet váltani egy részét promptolással, meg system prompt szerkesztéssel, meg hasonlók...

. Még alfának sem nevezném.

. És ha egy 9B-s modell ezekben a "szinti" tesztekben a qwen3.6-35B szintjén van, az már azért sejtet valamit..








/
( benchmark via







.




