Text-to-SQL-benchmarkit yliarvioivat suorituskykyä oikeilla datavarastoilla
MIT:n tietojenkäsittelytieteen professori Michael Stonebraker argumentoi, että yleisesti käytetyt text-to-SQL-benchmarkit kuten Spider ja Bird-SQL eivät vastaa oikeiden datavarastojen haasteita: data on julkisesti saatavilla LLM-koulutusta varten, schematkin ovat siistejä ja kyselyt yksinkertaisia. Ryhmä rakensi Beaver-benchmarkin oikeista MIT:n Oracle-datavaraston kyselyistä, joissa on mukana schema rot, idiosynkraattinen data ja monimutkaiset liitokset. Julkiset benchmarkit tuottavat yli 90 prosentin tarkkuuksia, mutta Beaver-benchmarkilla pelkkä LLM-pohjainen ratkaisu saavutti nollatuloksen ja RAG- sekä agentic AI -parannuksilla päästiin vain yli 10 prosentin tasolle. Beaver on julkisesti saatavilla.
cacm.acm.org ↗
DOJ viittasi keksittyyn tapaukseen pitääkseen ICE-pidätetyn vankilassa
Yhdysvaltain oikeusministeriö (DOJ) käytti tekoälyn tuottamaa keksittyä oikeustapausviittausta perustellessaan ICE-pidätetyn vapautuksen estämistä. Tuomari Hala Y. Jarbou totesi, että viittaus Taylor v. Hott -tapaukseen ei vastaa mitään olemassa olevaa Sixth Circuit -ratkaisua, eikä kyseistä lainaustakaan löydy mistään tunnetusta tapauksesta. Tuomari ei asettanut sanktioita, mutta kehotti DOJ:ta varmistamaan, ettei se jatkossa toimita tuomioistuimelle olemattomaan oikeuskäytäntöön nojaavia kirjelmiä.
www.techdirt.com ↗
Cactus lisäsi Gemma 4 -malliin luottamuspistemäärän ja automaattisen reitittimen
Cactus-yhtiö on post-trainannut Gemma 4 E2B Hybrid -mallin sisältämään probe-komponentin, joka palauttaa jokaiselle vastaukselle luottamusarvon välillä 0–1 strukturoituna datana. Kun luottamus jää alle kynnysarvon, sovellus voi reitittää kyselyn isommalle mallille, kuten Gemini 3.1 Flash-Litelle. Yhtiön mukaan malli vastaa itse 65–85 % kyselyistä ja saavuttaa silti vertailutasot Gemini 3.1 Flash-Liteä vastaan. Malli on saatavilla MIT-lisenssillä Hugging Facessa, ja se tukee transformers-, MLX- ja llama.cpp-ympäristöjä.
github.com ↗
GigaToken lupaa jopa tuhatkertaisen nopeuden HuggingFacen tokenizeriin verrattuna
GigaToken on uusi Rust-pohjainen tokenizer-kirjasto, joka toimii drop-in-korvaajana HuggingFace Tokenizerille ja tiktokenille. Nopeus perustuu SIMD-optimoituun pretokenizaatioon, aggressiiviseen pretoken-välimuistiin ja minimaaliin Python-vuorovaikutukseen. Benchmarkeissa AMD EPYC 9565 -prosessorilla saavutettiin noin 989-kertainen nopeus HuggingFaceen verrattuna, Apple M4 Maxilla noin 1353-kertainen. Yhteensopivuustilassa ero on pienempi, koska tulosten täsmäyttäminen HuggingFacen kanssa vaatii lisätyötä.
github.com ↗
Epävirallinen pelikanibenchmark ei näytä merkkejä ylioptimoinnnista
Simon Willisonin tunnettu 'pelican riding a bicycle' -testi on kerännyt niin paljon huomiota, että sen mahdollinen benchmarkmaxxing on herättänyt kysymyksiä. Yksi kehittäjä testasi asiaa systemaattisesti: hän generoi 1 008 SVG-kuvaa seitsemällä frontier-mallilla käyttäen 48 eläin–ajoneuvo-yhdistelmää ja arvioi tulokset LLM-tuomarilla. Pelikan sijoittui kahdeksasta eläimestä kuudenneksi ja polkupyörä toiseksi viimeiseksi ajoneuvoista, eikä pelikan-polkupyörä-yhdistelmä erottunut edukseen muista yhdistelmistä edes vaikeustason huomioivassa regressioanalyysissä.
dylancastillo.co ↗
Yhdysvaltain armeija kulutti vuoden AI-tokenit kuukausissa
Yhdysvaltain armeija ilmoitti toukokuussa 2026 tarjoavansa rajoittamattoman määrän tokeneita Ask Sage -alustalle, mutta kesäkuun puolivälissä token-varanto oli loppunut. Ask Sage on multimodaalinen generatiivinen AI-alusta, jossa käyttäjät voivat ajaa muun muassa Googlen Geminiä, Metan Llamaa ja OpenAI:n ChatGPT:tä. Armeija on aktiivisesti kannustanut henkilöstöään käyttämään generatiivista AI:ta, ja käyttäjille myönnettiin automaattisesti lisää tokeneita alkuperäisen kuukausikiintiön täytyttyä. Nyt on epäselvää, uusitaanko token-varanto lokakuun jälkeen.
arstechnica.com ↗
MUD-pohjainen LLM-evaluointikehys paljastaa LLM-tuomareiden piilohaavoittuvuuden
CrucibleBench käyttää tekstipohjaista MUD-peliympäristöä kielimallien käyttäytymisen mittaamiseen tilanteissa, joissa luottamus täytyy ansaita ja tieto on suhteiden takana. Keskeisin löydös ei ole mallien keskinäinen paremmuusjärjestys vaan se, että yksi LLM-tuomarikomponentti pisteytyspinossa muutti tulostaulukon järjestystä jopa kuudella sijalla aggregaattitason luotettavuustilastojen pysyessä hiljaa. Saman malliperheeseen kuuluvan luokittelijan ja arvioitavan mallin välinen yhteensopivuus vaihteli 21,7 prosentista 84,8 prosenttiin, mitä kokonais-κ-arvo 0,04 ei paljastanut. Tekijät julkaisivat 650 ajotranskriptiä, lähdekoodin ja laskutusvientiä, ja kehittävät nyt vaihetta 2 varsinaista benchmark-kalibrointia varten.
cruciblebench.ai ↗
OpenAI Presence tuo hallitun AI-agentin yritysten asiakaspalveluun
OpenAI julkaisi Presence-tuotteen, joka on suunnattu yrityksille haluaville ottaa AI-agentit käyttöön tuotantoympäristöissä. Tuote yhdistää mallipäättelyn käytäntöihin, guardraileihin ja eskalointisääntöihin, ja sen kehitys perustuu OpenAI:n omiin enterprise-käyttöönottoihin. OpenAI:n oma englanninkielinen puhelintuki toimii Presencen päällä ja ratkaisee 75 % saapuvista yhteydenotoista ilman ihmisapua. Tuote on saatavilla rajoitetussa yleisessä saatavuudessa eikä toistaiseksi itseohjautuvana palveluna.
openai.com ↗