AI

torstai 23.7.2026

Kirjoittanut Ainikki · klo 11.26

Tämän päivän AI-uutiset käsittelevät kielimallien arviointimenetelmien ja käytännön soveltamisen haasteita. MIT:n tutkijat osoittivat, että yleisesti käytetyt text-to-SQL-benchmarkit yliarvioivat suorituskykyä verrattuna oikeisiin datavarastoihin, kun taas DOJ:n tapaus paljasti, että tekoäly voi tuottaa keksittyjä oikeustapausviittauksia tuomioistuimille. Samalla kehittyy uusia ratkaisuja: Cactus parantaa Gemma 4 -mallia luottamuspisteillä ja älykkäällä reitityksellä, GigaToken nopeuttaa tokenisointia merkittävästi, ja OpenAI Presence tuo hallitut AI-agentit yritysten asiakaspalveluun, kun taas armeija kohtaa haasteet AI-tokenien hallinnassa.


Text-to-SQL-benchmarkit yliarvioivat suorituskykyä oikeilla datavarastoilla

MIT:n tietojenkäsittelytieteen professori Michael Stonebraker argumentoi, että yleisesti käytetyt text-to-SQL-benchmarkit kuten Spider ja Bird-SQL eivät vastaa oikeiden datavarastojen haasteita: data on julkisesti saatavilla LLM-koulutusta varten, schematkin ovat siistejä ja kyselyt yksinkertaisia. Ryhmä rakensi Beaver-benchmarkin oikeista MIT:n Oracle-datavaraston kyselyistä, joissa on mukana schema rot, idiosynkraattinen data ja monimutkaiset liitokset. Julkiset benchmarkit tuottavat yli 90 prosentin tarkkuuksia, mutta Beaver-benchmarkilla pelkkä LLM-pohjainen ratkaisu saavutti nollatuloksen ja RAG- sekä agentic AI -parannuksilla päästiin vain yli 10 prosentin tasolle. Beaver on julkisesti saatavilla.

cacm.acm.org ↗

DOJ viittasi keksittyyn tapaukseen pitääkseen ICE-pidätetyn vankilassa

Yhdysvaltain oikeusministeriö (DOJ) käytti tekoälyn tuottamaa keksittyä oikeustapausviittausta perustellessaan ICE-pidätetyn vapautuksen estämistä. Tuomari Hala Y. Jarbou totesi, että viittaus Taylor v. Hott -tapaukseen ei vastaa mitään olemassa olevaa Sixth Circuit -ratkaisua, eikä kyseistä lainaustakaan löydy mistään tunnetusta tapauksesta. Tuomari ei asettanut sanktioita, mutta kehotti DOJ:ta varmistamaan, ettei se jatkossa toimita tuomioistuimelle olemattomaan oikeuskäytäntöön nojaavia kirjelmiä.

www.techdirt.com ↗

Cactus lisäsi Gemma 4 -malliin luottamuspistemäärän ja automaattisen reitittimen

Cactus-yhtiö on post-trainannut Gemma 4 E2B Hybrid -mallin sisältämään probe-komponentin, joka palauttaa jokaiselle vastaukselle luottamusarvon välillä 0–1 strukturoituna datana. Kun luottamus jää alle kynnysarvon, sovellus voi reitittää kyselyn isommalle mallille, kuten Gemini 3.1 Flash-Litelle. Yhtiön mukaan malli vastaa itse 65–85 % kyselyistä ja saavuttaa silti vertailutasot Gemini 3.1 Flash-Liteä vastaan. Malli on saatavilla MIT-lisenssillä Hugging Facessa, ja se tukee transformers-, MLX- ja llama.cpp-ympäristöjä.

github.com ↗

GigaToken lupaa jopa tuhatkertaisen nopeuden HuggingFacen tokenizeriin verrattuna

GigaToken on uusi Rust-pohjainen tokenizer-kirjasto, joka toimii drop-in-korvaajana HuggingFace Tokenizerille ja tiktokenille. Nopeus perustuu SIMD-optimoituun pretokenizaatioon, aggressiiviseen pretoken-välimuistiin ja minimaaliin Python-vuorovaikutukseen. Benchmarkeissa AMD EPYC 9565 -prosessorilla saavutettiin noin 989-kertainen nopeus HuggingFaceen verrattuna, Apple M4 Maxilla noin 1353-kertainen. Yhteensopivuustilassa ero on pienempi, koska tulosten täsmäyttäminen HuggingFacen kanssa vaatii lisätyötä.

github.com ↗

Epävirallinen pelikanibenchmark ei näytä merkkejä ylioptimoinnnista

Simon Willisonin tunnettu 'pelican riding a bicycle' -testi on kerännyt niin paljon huomiota, että sen mahdollinen benchmarkmaxxing on herättänyt kysymyksiä. Yksi kehittäjä testasi asiaa systemaattisesti: hän generoi 1 008 SVG-kuvaa seitsemällä frontier-mallilla käyttäen 48 eläin–ajoneuvo-yhdistelmää ja arvioi tulokset LLM-tuomarilla. Pelikan sijoittui kahdeksasta eläimestä kuudenneksi ja polkupyörä toiseksi viimeiseksi ajoneuvoista, eikä pelikan-polkupyörä-yhdistelmä erottunut edukseen muista yhdistelmistä edes vaikeustason huomioivassa regressioanalyysissä.

dylancastillo.co ↗

Yhdysvaltain armeija kulutti vuoden AI-tokenit kuukausissa

Yhdysvaltain armeija ilmoitti toukokuussa 2026 tarjoavansa rajoittamattoman määrän tokeneita Ask Sage -alustalle, mutta kesäkuun puolivälissä token-varanto oli loppunut. Ask Sage on multimodaalinen generatiivinen AI-alusta, jossa käyttäjät voivat ajaa muun muassa Googlen Geminiä, Metan Llamaa ja OpenAI:n ChatGPT:tä. Armeija on aktiivisesti kannustanut henkilöstöään käyttämään generatiivista AI:ta, ja käyttäjille myönnettiin automaattisesti lisää tokeneita alkuperäisen kuukausikiintiön täytyttyä. Nyt on epäselvää, uusitaanko token-varanto lokakuun jälkeen.

arstechnica.com ↗

MUD-pohjainen LLM-evaluointikehys paljastaa LLM-tuomareiden piilohaavoittuvuuden

CrucibleBench käyttää tekstipohjaista MUD-peliympäristöä kielimallien käyttäytymisen mittaamiseen tilanteissa, joissa luottamus täytyy ansaita ja tieto on suhteiden takana. Keskeisin löydös ei ole mallien keskinäinen paremmuusjärjestys vaan se, että yksi LLM-tuomarikomponentti pisteytyspinossa muutti tulostaulukon järjestystä jopa kuudella sijalla aggregaattitason luotettavuustilastojen pysyessä hiljaa. Saman malliperheeseen kuuluvan luokittelijan ja arvioitavan mallin välinen yhteensopivuus vaihteli 21,7 prosentista 84,8 prosenttiin, mitä kokonais-κ-arvo 0,04 ei paljastanut. Tekijät julkaisivat 650 ajotranskriptiä, lähdekoodin ja laskutusvientiä, ja kehittävät nyt vaihetta 2 varsinaista benchmark-kalibrointia varten.

cruciblebench.ai ↗

OpenAI Presence tuo hallitun AI-agentin yritysten asiakaspalveluun

OpenAI julkaisi Presence-tuotteen, joka on suunnattu yrityksille haluaville ottaa AI-agentit käyttöön tuotantoympäristöissä. Tuote yhdistää mallipäättelyn käytäntöihin, guardraileihin ja eskalointisääntöihin, ja sen kehitys perustuu OpenAI:n omiin enterprise-käyttöönottoihin. OpenAI:n oma englanninkielinen puhelintuki toimii Presencen päällä ja ratkaisee 75 % saapuvista yhteydenotoista ilman ihmisapua. Tuote on saatavilla rajoitetussa yleisessä saatavuudessa eikä toistaiseksi itseohjautuvana palveluna.

openai.com ↗

Ei voitu sisällyttää

3 vikaa
Kielimallit