DeepSeek V4 Flash pyörii tuotannossa yhdellä AMD MI300X -kortilla
Kehittäjä on julkaissut GitHub-repositorion, joka sisältää konfiguraation ja korjauspatchit DeepSeek-V4-Flash-0731-mallin ajamiseen yhdellä AMD MI300X -kiihdyttimellä. MI300X:n 192 gigatavun HBM3-muisti riittää koko 304 miljardin parametrin mallin lataamiseen ilman kvantisointia tai layer offload -tekniikkaa. Virallinen vLLM-resepti kattaa NVIDIA-laitteiston ja uudemmat AMD-kortit, mutta ei tätä yksittäisen MI300X:n tuotantokonfiguraatiota, joten repositorio korjaa muun muassa FP8-yhteensopivuusongelman, MoE-reititysvirheet ja CPU-KV-synkronoinnin. Korjaukset eivät ole vielä upstream vLLM:ssä.
github.com ↗
Mistral julkaisi 3B-kokoisen avoimen turvaluokittelijan, joka päihittää 7x suurempia malleja
Mistral julkaisi Shieldstral-mallin, joka luokittelee sisältöä turvallisuuden näkökulmasta sekä tekstille että kuville ilman uudelleenkoulutusta. Malli ottaa vastaan käytännöt luonnollisella kielellä suoraan inferenssiaikana, joten sama checkpoint sopii eri käyttökonteksteihin. 3B-parametrinen malli pyörii yhdellä 16 Gt:n NVIDIA-näytönohjaimella ja julkaistiin Apache 2.0 -lisenssillä.
mistral.ai ↗
Tutkimus: lähes puolet kielimallibenckmarkeista on saturoitunut
Uusi tutkimus analysoi 60 kielimallin benchmark-testiä ja havaitsi, että lähes puolet niistä on saturoitunut eli mallit saavuttavat niin korkeat pisteet, että testit eivät enää erottele niitä toisistaan. Saturaatio yleistyy benchmarkin iän myötä. Tutkijoiden mukaan asiantuntijoiden kuratoimat testit kestävät saturaatiota paremmin, mutta testidatan julkisuus ei vaikuta asiaan. Tulokset viittaavat siihen, että suunnitteluvalinnoilla voi pidentää benchmarkin käyttöikää.
arxiv.org ↗
Computer Anthology julkaisee jatkuvasti päivittyvän agenttivertailuston
Vetto julkaisi Computer Anthology -projektin, joka rakentaa jatkuvasti uusiutuvia benchmark-sarjoja AI-agenteille sen sijaan, että tuottaisi kertaluonteisia testisettejä. Ensimmäinen julkaisu, Terminal Tasks v1.0, sisältää 100 tehtävää, joissa agentti työskentelee terminaalista käsin. Paras mitattu konfiguraatio läpäisee 61,8 % tehtävistä, ja tulokset perustuvat 500 itsenäiseen suoritukseen konfiguraatiota kohden deterministisillä verifikaattoreilla ilman LLM-tuomaria. Projektin keskeinen väite on, että saturaatio-ongelma on hallittavissa vain jos benchmarkin tuotantoinfrastruktuuri säilyy ja kehittyy mallin sijaan.
vetto.ai ↗