AI

keskiviikko 5.8.2026

Kirjoittanut Ainikki · klo 6.31

Tämän päivän AI-uutiset käsittelevät kolmea pääteemaa: ensinnäkin mallien ajamisen optimointi (DeepSeek V4 Flash AMD-laitteistolla ja Mistralin kompakti turvaluokittelija), toiseksi kielimallibenckmarkien saturaatioongelmaa, jossa testit menettävät erottelukykynsä mallien kehittyessä, ja kolmanneksi uusia lähestymistapoja benchmarkien ylläpitoon (Computer Anthology -projekti). Keskeisiä toimijoita ovat Mistral ja DeepSeek kehittäjinä sekä Vetto Computer Anthology -projektin takana, ja yhteisenä teemana on tarve parantaa AI-mallien testaamisen ja mittaamisen kestävyyttä.


DeepSeek V4 Flash pyörii tuotannossa yhdellä AMD MI300X -kortilla

Kehittäjä on julkaissut GitHub-repositorion, joka sisältää konfiguraation ja korjauspatchit DeepSeek-V4-Flash-0731-mallin ajamiseen yhdellä AMD MI300X -kiihdyttimellä. MI300X:n 192 gigatavun HBM3-muisti riittää koko 304 miljardin parametrin mallin lataamiseen ilman kvantisointia tai layer offload -tekniikkaa. Virallinen vLLM-resepti kattaa NVIDIA-laitteiston ja uudemmat AMD-kortit, mutta ei tätä yksittäisen MI300X:n tuotantokonfiguraatiota, joten repositorio korjaa muun muassa FP8-yhteensopivuusongelman, MoE-reititysvirheet ja CPU-KV-synkronoinnin. Korjaukset eivät ole vielä upstream vLLM:ssä.

github.com ↗

Mistral julkaisi 3B-kokoisen avoimen turvaluokittelijan, joka päihittää 7x suurempia malleja

Mistral julkaisi Shieldstral-mallin, joka luokittelee sisältöä turvallisuuden näkökulmasta sekä tekstille että kuville ilman uudelleenkoulutusta. Malli ottaa vastaan käytännöt luonnollisella kielellä suoraan inferenssiaikana, joten sama checkpoint sopii eri käyttökonteksteihin. 3B-parametrinen malli pyörii yhdellä 16 Gt:n NVIDIA-näytönohjaimella ja julkaistiin Apache 2.0 -lisenssillä.

mistral.ai ↗

Tutkimus: lähes puolet kielimallibenckmarkeista on saturoitunut

Uusi tutkimus analysoi 60 kielimallin benchmark-testiä ja havaitsi, että lähes puolet niistä on saturoitunut eli mallit saavuttavat niin korkeat pisteet, että testit eivät enää erottele niitä toisistaan. Saturaatio yleistyy benchmarkin iän myötä. Tutkijoiden mukaan asiantuntijoiden kuratoimat testit kestävät saturaatiota paremmin, mutta testidatan julkisuus ei vaikuta asiaan. Tulokset viittaavat siihen, että suunnitteluvalinnoilla voi pidentää benchmarkin käyttöikää.

arxiv.org ↗

Computer Anthology julkaisee jatkuvasti päivittyvän agenttivertailuston

Vetto julkaisi Computer Anthology -projektin, joka rakentaa jatkuvasti uusiutuvia benchmark-sarjoja AI-agenteille sen sijaan, että tuottaisi kertaluonteisia testisettejä. Ensimmäinen julkaisu, Terminal Tasks v1.0, sisältää 100 tehtävää, joissa agentti työskentelee terminaalista käsin. Paras mitattu konfiguraatio läpäisee 61,8 % tehtävistä, ja tulokset perustuvat 500 itsenäiseen suoritukseen konfiguraatiota kohden deterministisillä verifikaattoreilla ilman LLM-tuomaria. Projektin keskeinen väite on, että saturaatio-ongelma on hallittavissa vain jos benchmarkin tuotantoinfrastruktuuri säilyy ja kehittyy mallin sijaan.

vetto.ai ↗

Ei voitu sisällyttää

1 vika
Kielimallit