Wichtige Erkenntnisse
- Die QVAC-Einheit von Tether hat am 29. Juli 2026 ein Vision-Modell mit 460 Millionen Parametern als Open-Source-Lösung veröffentlicht.
- Das Modell schlug die Konkurrenten Liquid AI und Hugging Face in 16 von 17 Benchmark-Tests.
- Seine Flash-Version lief bis zu 36-mal schneller als SmolVLM2-500M auf einem iPhone 15.
Veröffentlicht am Mittwoch von der KI-Forschungsabteilung des UnternehmensQVAC, VisionPsy-Nano kann Bilder, Dokumente und Diagramme untersuchen und dann Fragen beantworten, ohne das Quellmaterial an ein Remote-System zu senden. Das Telefon verarbeitet sowohl die Eingabe als auch die Antwort, sodass die Software offline arbeiten und Daten auf dem Gerät speichern kann.
Laut QVAC verzeichnete das Modell von Tether AI Research mit weniger als 500 Millionen Parametern die höchste Gesamtpunktzahl unter den Vision-Language-Systemen. In 17 Benchmarks übertraf es die Konkurrenzmodelle mit 16 Punkten.
Wie es sich schlägt
Das Modell erzielte einen normalisierten Wert von 62,3, verglichen mit 59,6 für den LFM2.5-VL-450M von Liquid AI und 52,5 für den SmolVLM2-500M von Hugging Face. Das frühere Basismodell nanoVLM-460M-8k von QVAC erzielte 54,9 Punkte.
Die Tether-Daten Die Veröffentlichung ist in zwei Versionen erhältlich. Beim Standardaufbau steht die Genauigkeit im Vordergrund, während Flash ein wenig an Qualität einbüßt, um schnellere Antworten zu erhalten. Laut QVAC behält Flash etwa 99 % der Leistung des gesamten Modells bei und erzeugt seine erste Ausgabe bis zu 23-mal schneller als SmolVLM2-500M auf Android-Telefonen und bis zu 36-mal schneller auf einem iPhone 15.
Diese Reaktionszeit ist auf mobiler Hardware wichtig. Ein kompaktes Modell kann im Test gut abschneiden, fühlt sich aber dennoch unpraktisch an, wenn Benutzer warten müssen, während das Gerät ein Bild verarbeitet. Flash wurde entwickelt, um diese anfängliche Verzögerung zu reduzieren.
Das System der künstlichen Intelligenz (KI). Unterstützt auch die Dokumentenanalyse und optische Zeichenerkennung und extrahiert Text und Struktur aus Finanzberichten, Flussdiagrammen und Infografiken.
Laut QVAC schlug das Modell bei Tests zum visuellen Denken durchschnittlich 7,4 % vor Konkurrenten ähnlicher Größe. Es übertraf auch Modelle, die mehr als doppelt so groß waren wie MM-IFEval und POPE, einschließlich Veröffentlichungen von Qwen und InternVL.
Warum der kleine Fußabdruck wichtig ist
Die Verlagerung der Bildverarbeitung von einem Rechenzentrum auf ein Telefon führt zu strengen Einschränkungen hinsichtlich Speicher, Wärme, Batterieverbrauch und Rechenleistung. Kompakte Modelle verarbeiten häufig einfachen Text, verlieren jedoch beim Lesen dichter Diagramme, Tabellen oder gescannter Dokumente an Genauigkeit.
Die Benchmark-Ergebnisse von QVAC deuten darauf hin, dass das Modell einen Großteil dieser Leistungsfähigkeit bewahrt hat und dennoch klein genug für Verbrauchergeräte bleibt. Durch die lokale Verarbeitung ist zudem kein Hochladen von Dokumenten erforderlich und die Software kann auch ohne Netzwerkverbindung weiterarbeiten.
Entwickelt für mehrere Bereitstellungsoptionen
Entwickler können über Hugging Face Transformers, eine quantisierte GGUF-Version für llama.cpp oder ein vLLM-Backend für die Servernutzung mit höherem Volumen auf das Modell zugreifen.
QVAC veröffentlichte seine Benchmark-Konfigurationen auch über VLMEvalKit, sodass externe Forscher die Tests wiederholen konnten. Beide Versionen verwenden die Apache 2.0-Lizenz, die die kommerzielle Nutzung, Änderung und Weiterverbreitung erlaubt.
Teil der umfassenderen KI-Strategie von Tether
Tether-CEO Paolo Ardoino sagte, die Veröffentlichung unterstütze den Vorstoß des Unternehmens hin zu lokalen, effizienten KI-Systemen.
„Das Erreichen erstklassiger Qualität und Leistung bei allgemeinen Sehaufgaben bei nur 460 Millionen Parametern beweist, dass eine lokal ausgerichtete, hocheffiziente KI ein gangbarer Weg ist“, sagte Ardoino.
Das Modell folgt mehreren QVAC-Veröffentlichungen aus dem Oktober 2025, darunter synthetische Trainingsdatensätze, ein plattformübergreifendes Software-Entwicklungskit und medizinische Modelle für Telefone und tragbare Geräte.
Für Entwickler bietet die Version eine Offline-Bildanalyse ohne nutzungsbasierte API-Kosten. Unternehmen können vertrauliche Dokumente auf dem Gerät behalten, während Verbraucher KI-Funktionen ohne Signal nutzen können. Forscher können die Leistungsansprüche des Unternehmens anhand der veröffentlichten Konfigurationen unabhängig testen.
Tether hat seine KI-Erweiterung finanziert mit Gewinnen aus seinem USDT-Stablecoin-Geschäft. Darüber hinaus hat das Unternehmen in KI-Infrastruktur, Biotechnologie und Robotik investiert, darunter eine Serie-C-Investition in NEURA Robotics im Wert von bis zu 1,4 Milliarden US-Dollar.

