world-model-optimizer yhdistää mallireitityksen, distillationin ja agenttioptimoinnin yhteen työkaluun
Experiential Labs julkaisi world-model-optimizer (wmo) -työkalun, joka rakentaa OpenTelemetry-traceista mallireitityspolitiikan ja lupaa yli 40 % kustannussäästöjä verrattuna yksittäisen frontier-mallin käyttöön. Työkalu tukee myös model distillationia ja agenttien harness-optimointia simuloitujen ympäristöjen avulla. Asennus tapahtuu pip-paketinhallinnalla ja reititys konfiguroidaan knn-pohjaisella politiikalla omista traceista.
github.com ↗
OpenLake lupaa puolittaa LLM-inferenssikustannukset KV-välimuistin ulkoistuksella
OpenLake on Rustilla ja io_uringilla rakennettu tallennusmoottori, joka tallentaa LLM-inferenssin KV-välimuistin GPU-isäntien RAM-muistiin ja levylle. Projektin mukaan ratkaisu puolittaa pitkien kontekstien inferenssikustannukset ja tuottaa 66-kertaisen nopeuden ensimmäiseen tokeniin 128K kontekstilla välimuistiosumien kohdalla. Työkalu integroituu vLLM-palvelimeen ilman koodimuutoksia pip-paketin kautta ja tukee myös monihostiklustereita RDMA-yhteydellä.
github.com ↗
Inflect-Micro-v2: alle 10 miljoonan parametrin TTS-malli julkaistu
Owen Song julkaisi itsenäisesti rahoittamansa Inflect-Micro-v2-mallin, joka tuottaa englanninkielistä puhetta 9,36 miljoonalla parametrilla ja toimii sekä CPU:lla että CUDA:lla. Malli painaa FP32-tarkkuudella 37,53 MB ja tuottaa 24 kHz mono-ääntä. Julkaisun mukana tulee adaptation toolkit, jolla voi valmistella dataa, hienosäätää ääntä tai kieltä ja viedä mallin PyTorch- tai ONNX-muotoon. Vertailussa käytettiin KittenTTS Nano-, Piper Low- ja Supertonic 3 -malleja, ja Inflect-Micro-v2 sai yhteisötutkimuksessa 66,2 prosentin preferenssiosuuden, joskin kyseessä on epävirallinen yhteisöarvio eikä formaali MOS-tulos.
huggingface.co ↗