{"id":70197,"date":"2026-09-29T10:48:51","date_gmt":"2026-09-29T08:48:51","guid":{"rendered":"https:\/\/www.inovex.de\/?p=70197"},"modified":"2026-09-29T12:50:00","modified_gmt":"2026-09-29T10:50:00","slug":"typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation","status":"publish","type":"post","link":"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/","title":{"rendered":"TypeSafe AI Jev im Test: Wie gut ist das neue Modell f\u00fcr KI-Klassifikation?"},"content":{"rendered":"<p>Am 15. September 2026 hat TypeSafe AI sein erstes \u00f6ffentliches Modell vorgestellt: Jev; zugeschnitten auf Klassifikationsaufgaben (TypeSafe AI, 2026a). Statt mit Text antwortet es mit Zahlen und bei Auswahlfragen zus\u00e4tzlich mit der gew\u00e4hlten Option aus einer vorgegebenen Liste. Typische Fragen sind \u201eIst das Spam?\u201c, \u201eWelches Team ist zust\u00e4ndig?\u201c oder \u201eWie dringend ist das?\u201c. TypeSafe nennt die Zahlen Wahrscheinlichkeiten und Modelle dieser Art \u201eSystem One\u201c, nach dem schnellen, intuitiven Denken, das der Psychologe Daniel Kahneman als System 1 beschrieben hat (Kahneman, 2011).<sup id=\"fnref-1\"><a href=\"#fn-1\">1<\/a><\/sup><!--more--><\/p>\n<p>Klassifikation selbst ist nichts Neues. Klassische Modelle daf\u00fcr gibt es seit Jahrzehnten, allerdings muss man sie f\u00fcr jede Aufgabe eigens trainieren. Sp\u00e4testens seit GPT-3 lassen sich LLMs auch ohne eigenes Training als Klassifikatoren nutzen: Man l\u00e4sst sie eine feste Liste von Antworten bewerten und liest bei Bedarf dabei Wahrscheinlichkeiten ab (Brown et al., 2020). <strong>Technisch erm\u00f6glicht Jev also keine neue Art der Anwendung. Es senkt Kosten und Wartezeit und bietet eine einfachere, direktere Schnittstelle. Damit k\u00f6nnten sich Anwendungen erschlie\u00dfen, die bisher wegen Datenmenge, Kosten oder Wartezeit nicht gut abgedeckt waren.<\/strong><\/p>\n<p>In diesem Beitrag teilen wir die Ergebnisse unserer ersten Experimente mit und unsere Eindr\u00fccke von Jev. Im ersten Teil beschreiben wir, was Jev neu macht, welche Funktionen es vorher schon gab und was wir in eigenen Tests beobachtet haben. Im Anschluss daran ordnen wir nach unserer Einsch\u00e4tzung ein, wo wir Potenzial und Grenzen sehen. Dabei betrachten wir Jev nicht nur als Produkt, sondern als Vertreter einer neuen Modellklasse, die sich etablieren k\u00f6nnte.<\/p>\n<p><strong>Die wichtigsten Einschr\u00e4nkungen vorab:<\/strong><\/p>\n<ul>\n<li>Antworten auf zusammenh\u00e4ngende Fragen k\u00f6nnen sich widersprechen; Jev eignet sich vor allem f\u00fcr einzelne Klassifikationen.<\/li>\n<li>Dieselbe Anfrage liefert \u00fcber mehrere L\u00e4ufe leicht unterschiedliche Zahlen.<\/li>\n<li>Ob die Wahrscheinlichkeiten f\u00fcr die eigenen Daten stimmen, muss man selbst pr\u00fcfen.<\/li>\n<li>Jev ist ein allgemeiner Klassifikator; f\u00fcr sehr eigene Kategorien sollte man nicht zu viel erwarten.<\/li>\n<li>Eine Begr\u00fcndung liefert Jev nicht.<\/li>\n<li>Das Produkt <em>Jev<\/em> gibt es nur als Dienst, gehostet in den USA; offene Nachbauten lassen sich selbst betreiben.<\/li>\n<\/ul>\n<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_88 counter-hierarchy ez-toc-counter ez-toc-custom ez-toc-container-direction\">\n<div class=\"ez-toc-title-container\"><p class=\"ez-toc-title\" style=\"cursor:inherit\"><\/p>\n<\/div><nav><ul class='ez-toc-list ez-toc-list-level-1 ' ><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/#Was-kann-Jev\" >Was kann Jev?<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/#Welche-Funktionen-gab-es-schon-vor-Jev\" >Welche Funktionen gab es schon vor Jev?<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/#Was-macht-Jev-anders\" >Was macht Jev anders?<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/#Offene-Alternativen\" >Offene Alternativen<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/#Wir-haben-Jev-getestet\" >Wir haben Jev getestet<\/a><ul class='ez-toc-list-level-3' ><li class='ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/#Zusammenhaengende-Felder-koennen-sich-widersprechen\" >Zusammenh\u00e4ngende Felder k\u00f6nnen sich widersprechen<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/#Wie-Jevs-Wahrscheinlichkeiten-zu-lesen-sind\" >Wie Jevs Wahrscheinlichkeiten zu lesen sind<\/a><\/li><\/ul><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/#Potenzial\" >Potenzial<\/a><ul class='ez-toc-list-level-3' ><li class='ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-9\" href=\"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/#Wahrscheinlichkeit-oder-Konfidenz\" >Wahrscheinlichkeit oder Konfidenz<\/a><\/li><\/ul><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-10\" href=\"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/#Grenzen\" >Grenzen<\/a><ul class='ez-toc-list-level-3' ><li class='ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-11\" href=\"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/#Grenzen-der-Technologie\" >Grenzen der Technologie<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-3'><a class=\"ez-toc-link ez-toc-heading-12\" href=\"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/#Grenzen-des-Produkts\" >Grenzen des Produkts<\/a><\/li><\/ul><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-13\" href=\"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/#Fazit\" >Fazit<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-14\" href=\"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/#Referenzen\" >Referenzen<\/a><\/li><\/ul><\/nav><\/div>\n<h2><span class=\"ez-toc-section\" id=\"Was-kann-Jev\"><\/span>Was kann Jev?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Bei Jev besteht eine Anfrage aus dem State, also dem, wor\u00fcber entschieden wird (eine Kundennachricht, ein Dokument, ein Datensatz, als Text oder als Objekt mit benannten Feldern), und einer oder mehreren Fragen dazu. TypeSafe beschreibt das als <em>\u201efrontier-intelligence function call: unstructured state in, typed probabilistic decisions out\u201c<\/em> (TypeSafe AI, 2026a). Jede Frage hat einen von drei Typen (TypeSafe AI, 2026b):<\/p>\n<table>\n<thead>\n<tr>\n<th>Fragetyp<\/th>\n<th>Wof\u00fcr<\/th>\n<th>Was zur\u00fcckkommt<\/th>\n<th>Beispiel<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Noul (von Bernoulli, dem Ja-Nein-Zufallsexperiment)<\/td>\n<td>Ja-Nein-Fragen<\/td>\n<td>eine Zahl zwischen 0 und 1: die Wahrscheinlichkeit f\u00fcr \u201eja\u201c<\/td>\n<td>\u201eIst das Spam?\u201c<\/td>\n<\/tr>\n<tr>\n<td>Choice<\/td>\n<td>eine Option aus einer Liste w\u00e4hlen<\/td>\n<td>die gew\u00e4hlte Option und je Option eine Wahrscheinlichkeit<\/td>\n<td>\u201eWelches der folgenden Teams ist zust\u00e4ndig?\u201c<\/td>\n<\/tr>\n<tr>\n<td>Score<\/td>\n<td>auf einer Skala mit beschriebenen Stufen einordnen<\/td>\n<td>einen Wert auf der Skala und je Stufe eine Wahrscheinlichkeit<\/td>\n<td>\u201eWie dringend ist das?\u201c<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Das folgende Beispiel stellt zu einem Support-Ticket je eine Frage jedes Typs, alle drei in einer Anfrage. Ist sich Jev beim Team weniger als 80 % sicher, pr\u00fcft ein Mensch das Ticket.<\/p>\n<pre style=\"background-color: #f6f8fa; padding: 12px; font-size: 13px; line-height: 1.35;\"><code>from typesafe_sdk import Choice, Noul, Score, TypeSafeClient\r\n\r\nclient = TypeSafeClient(model=\"jev-1.13.0\")\r\n\r\nticket = {\r\n    \"betreff\": \"Rechnung falsch?\",\r\n    \"text\": (\"Seit dem App-Update zeigt die Rechnungsseite manchmal \"\r\n             \"einen falschen Betrag an. Wurde mir zu viel berechnet?\"),\r\n}\r\n\r\nantworten = client.system_one(\r\n    state={\"ticket\": ticket},\r\n    questions={\r\n        \"team\": Choice(\r\n            instructions=\"Welches Team soll dieses Ticket bearbeiten?\",\r\n            criteria={\"abrechnung\": \"Zahlungen, Rechnungen\", \"technik\": \"Fehler, App\", \"vertrieb\": \"Neuk\u00e4ufe\"},\r\n        ),\r\n        \"dringlichkeit\": Score(\r\n            instructions=\"Wie dringend ist dieses Ticket?\",\r\n            criteria=[\"Nicht dringend\", \"Etwas dringend\", \"Sehr dringend\"],\r\n        ),\r\n        \"spam\": Noul(instructions=\"Diese Nachricht ist Spam\"),\r\n    },\r\n).answers\r\n\r\nprint(antworten[\"team\"].probabilities)   # {'abrechnung': 0.68, 'technik': 0.32, 'vertrieb': 0.0}\r\nprint(antworten[\"dringlichkeit\"].score)  # 1.03\r\nprint(antworten[\"spam\"].noul)            # 0.04\r\n\r\nteam = antworten[\"team\"].choice\r\nziel = team if antworten[\"team\"].probabilities[team] &gt;= 0.8 else \"manuelle_pruefung\"<\/code><\/pre>\n<table>\n<thead>\n<tr>\n<th>Ticket<\/th>\n<th>Jevs Wahl<\/th>\n<th>Wert<\/th>\n<th>Was passiert<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>\u201eMir wurde im M\u00e4rz derselbe Betrag zweimal abgebucht \u2026\u201c<\/td>\n<td>abrechnung<\/td>\n<td>1,00<\/td>\n<td>automatisch an die Abrechnung<\/td>\n<\/tr>\n<tr>\n<td>\u201eSeit dem Update st\u00fcrzt die App beim Login sofort ab.\u201c<\/td>\n<td>technik<\/td>\n<td>1,00<\/td>\n<td>automatisch an die Technik<\/td>\n<\/tr>\n<tr>\n<td>\u201eIch m\u00f6chte mein Abo auf Premium upgraden \u2026\u201c<\/td>\n<td>vertrieb<\/td>\n<td>0,99<\/td>\n<td>automatisch an den Vertrieb<\/td>\n<\/tr>\n<tr>\n<td>\u201eSeit dem App-Update zeigt die Rechnungsseite manchmal einen falschen Betrag an \u2026\u201c (Codebeispiel)<\/td>\n<td>abrechnung<\/td>\n<td>0,68<\/td>\n<td>manuelle Pr\u00fcfung<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Eindeutige Tickets ordnet Jev mit 0,99 oder 1,00 zu. Das Ticket aus dem Codebeispiel ist absichtlich uneindeutig: Ein falscher Betrag nach einem App-Update kann ein Fehler der App oder der Abrechnung sein. Mit 0,68 f\u00fcr die Abrechnung landet es bei einem Menschen.<\/p>\n<p>Eine solche Anfrage ist billig und schnell: Laut TypeSafe kostet eine Million Token Eingabe 0,042 USD, die Ausgabe nichts. Eine Anfrage darf bis zu 64.000 Token umfassen und dauert 70 bis 500 ms, in unseren Tests rund 300 ms (TypeSafe AI, 2026c). Jev verarbeitet nur Text und bevorzugt Englisch.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Welche-Funktionen-gab-es-schon-vor-Jev\"><\/span><b>Welche Funktionen gab es schon vor Jev?<\/b><span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Keine dieser F\u00e4higkeiten ist f\u00fcr sich neu.<\/p>\n<p><strong>Vor den LLMs<br \/>\n<\/strong>Lange trainierte man f\u00fcr jede Frage ein eigenes Klassifikationsmodell, etwa ein BERT (Devlin et al., 2019), mit Beispielen, deren richtige Antwort bekannt ist. Ein solches Modell l\u00e4uft in Millisekunden auf eigener Hardware und liefert immer dieselbe Antwort, beantwortet aber nur die Frage, f\u00fcr die es trainiert wurde. Erste Verfahren ohne eigenes Training gab es schon damals: Man fragt ein Modell, ob ein Text eine Aussage wie \u201eDieser Text handelt von einer Rechnung\u201c st\u00fctzt, und liest die Wahrscheinlichkeit daf\u00fcr ab (Yin et al., 2019). Das entspricht Jevs Ja-Nein-Frage.<\/p>\n<p><strong>Mit LLMs<\/strong><br \/>\nZero-Shot und Few-Shot. Ein LLM kann eine Klassifikation allein aus der Anweisung l\u00f6sen und st\u00fctzt sich dabei auf sein allgemeines Wissen \u2013 wie Jev. Gibt man im Prompt zus\u00e4tzlich Beispiele mit, wie F\u00e4lle einzuordnen sind, passt es sich an die eigene Dom\u00e4ne an (Brown et al., 2020).<\/p>\n<p><strong>Structured Output<br \/>\n<\/strong>Eine Verfeinerung legt fest, welche Werte die Antwort annehmen darf. Beim Constrained Decoding werden an jeder Stelle alle Token gesperrt, die nicht zu einer erlaubten Antwort passen: Ist nur \u201eabrechnung\u201c, \u201etechnik\u201c oder \u201evertrieb\u201c erlaubt, kann das Modell nichts anderes schreiben \u2013 auf Wunsch mit vorangestellter Begr\u00fcndung. Die gro\u00dfen Anbieter bieten das \u00fcber ihre APIs an (OpenAI, 2024; Anthropic, 2026; Google, 2026a), f\u00fcr selbst betriebene Modelle etwa die Bibliothek Outlines (Willard &amp; Louf, 2023; dottxt, 2026).<sup id=\"fnref-2\"><a href=\"#fn-2\">2<\/a><\/sup> Liest man zus\u00e4tzlich die Logprobs der erlaubten Token aus, also den Logarithmus ihrer Wahrscheinlichkeit, erh\u00e4lt man einen Wert je Label. Bei selbst betriebenen Modellen geht das immer; die aktuellen Gemini-Modelle geben Logprobs \u00fcber ihre API nicht mehr heraus (gepr\u00fcft am 28. September 2026).<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Was-macht-Jev-anders\"><\/span>Was macht Jev anders?<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>LLMs sind in zweierlei Hinsicht Generalisten: in der Aufgabe und im Wissen. Jev ist spezialisiert in der zu erledigenden Aufgabe \u2013 es urteilt nur. In Bezug auf Wissen und Kontext bleibt Jev jedoch ein Generalist.<\/p>\n<p>Die Spezialisierung steckt laut TypeSafe im Training: Jev ist kein angepasstes LLM, sondern ein eigenes, direkt auf Entscheidungen trainiertes Modell; das Verfahren hei\u00dft <em>Reinforcement Learning for Calibrated Decisions <\/em>(RLCD). Ver\u00f6ffentlicht sind weder das Verfahren noch der Aufbau des Modells (TypeSafe AI, 2026a). Verwandt dazu ist das ver\u00f6ffentlichte Verfahren RLCR, das ein Modell nur dann voll belohnt, wenn seine angegebene Sicherheit zu seiner Trefferquote passt (Damani et al., 2025).<\/p>\n<p>Jev macht vor allem aus einem bekannten Verfahren ein Produkt: Wie bei einem LLM legt eine Anweisung die Aufgabe fest \u2013 das Training pro Aufgabe entf\u00e4llt. Das kann die H\u00fcrde f\u00fcr den Einsatz senken. Gegen\u00fcber einem LLM ist Jev g\u00fcnstiger und schneller. Gemini 3.5 Flash-Lite, Googles kleinstes Modell und unser Vergleichsmodell, kostet 0,30 USD pro Million Token Eingabe, gut siebenmal so viel wie Jev, dazu 2,50 USD pro Million Token Ausgabe einschlie\u00dflich der Reasoning-Tokens (Google, 2026c). In unseren Tests antwortete Jev nach rund 0,3 Sekunden, Flash-Lite nach 2 bis 7 Sekunden, zum Teil weil es standardm\u00e4\u00dfig Reasoning-Tokens erzeugt (Google, 2026b).<\/p>\n<p>Der Preis daf\u00fcr ist die Nachvollziehbarkeit: Jev gibt keine Begr\u00fcndung aus. Ein LLM mit Structured Output kann das, wie dasselbe Ticket mit Gemini zeigt (Google, 2026a):<\/p>\n<pre style=\"background-color: #f6f8fa; border: 1px solid #e1e4e8; border-radius: 6px; padding: 16px; font-family: SFMono-Regular, Consolas, 'Liberation Mono', Menlo, monospace; font-size: 13px; line-height: 1.4;\"><code>from typing import Literal\r\nfrom google import genai\r\nfrom pydantic import BaseModel, Field\r\n\r\nclass Einordnung(BaseModel):\r\n    # Reihenfolge: erst Begr\u00fcndung, dann Label, dann Selbsteinsch\u00e4tzung\r\n    begruendung: str = Field(description=\"Kurze Begr\u00fcndung, vor dem Label geschrieben\")\r\n    team: Literal[\"abrechnung\", \"technik\", \"vertrieb\"]\r\n    sicherheit: Literal[\"eindeutig\", \"moeglich\"] = Field(\r\n        description=(\r\n            \"'eindeutig' nur, wenn das Ticket zweifelsfrei zu genau einem Team geh\u00f6rt; \"\r\n            \"'moeglich', sobald es Aspekte aus mehr als einem Team-Bereich enth\u00e4lt\"\r\n        )\r\n    )\r\n\r\nclient = genai.Client()  # ben\u00f6tigt einen GEMINI_API_KEY\r\nantwort = client.models.generate_content(\r\n    model=\"gemini-3.5-flash-lite\",\r\n    contents=f\"Welches Team soll dieses Ticket bearbeiten?\\n{ticket}\",\r\n    config={\r\n        \"response_mime_type\": \"application\/json\",\r\n        \"response_schema\": Einordnung,\r\n        \"temperature\": 0.0,  # Standard w\u00e4re 1.0\r\n        \"seed\": 42,          # f\u00fcr besser reproduzierbare L\u00e4ufe\r\n    },\r\n)\r\n\r\neinordnung = Einordnung.model_validate_json(antwort.text)\r\nprint(einordnung.team)        # abrechnung\r\nprint(einordnung.sicherheit)  # moeglich\r\nprint(einordnung.begruendung) # Das Ticket betrifft sowohl einen Abrechnungsfehler als auch ein technisches Problem nach einem App-Update.\r\n\r\n# Die Selbsteinsch\u00e4tzung entscheidet, ob ein Mensch draufschaut\r\nziel = einordnung.team if einordnung.sicherheit == \"eindeutig\" else \"manuelle_pruefung\"<\/code><\/pre>\n<p>Gemini liefert ein g\u00fcltiges Label, eine lesbare Begr\u00fcndung und hier zus\u00e4tzlich eine Selbsteinsch\u00e4tzung. Das Ticket stuft es als \u201emoeglich\u201c ein und nennt den Grund gleich mit: Abrechnungsfehler und technisches Problem zugleich. Die Anwendung \u00fcbergibt es deshalb, wie Jev, einem Menschen, wenn der Wert unter die Schwelle f\u00e4llt. Eine Wahrscheinlichkeit ist das nicht, wohl aber ein Unsicherheitssignal, das sich direkt aus der Bedeutung der Antwort ergibt. Der Aufwand liegt beim User: Er muss die Stufen der Selbsteinsch\u00e4tzung festlegen und pr\u00fcfen, ob das Modell sie verl\u00e4sslich anwendet.<sup id=\"fnref-3\"><a href=\"#fn-3\">3<\/a><\/sup><\/p>\n<table>\n<thead>\n<tr>\n<th>Ansatz<\/th>\n<th>Wie legt man die Aufgabe fest?<\/th>\n<th>Wahrscheinlichkeiten?<\/th>\n<th>Begr\u00fcndung?<\/th>\n<th>Betrieb<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Eigener Klassifikator (etwa BERT)<\/td>\n<td>Training mit Beispielen, pro Aufgabe<\/td>\n<td>ja<\/td>\n<td>nein<\/td>\n<td>selbst betrieben, Millisekunden<\/td>\n<\/tr>\n<tr>\n<td>Zero-Shot \u00fcber Textfolgerung (Yin et al., 2019)<\/td>\n<td>Aussage beim Aufruf<\/td>\n<td>ja, nicht kalibriert<\/td>\n<td>nein<\/td>\n<td>selbst betrieben, g\u00fcnstig<\/td>\n<\/tr>\n<tr>\n<td>LLM mit Structured Output per API<\/td>\n<td>Anweisung und Beispiele im Prompt<\/td>\n<td>als ausgegebene Kategorie oder Zahl, oft zu hoch (Xiong et al., 2024)<\/td>\n<td>ja<\/td>\n<td>als Dienst, mit Reasoning Sekunden<\/td>\n<\/tr>\n<tr>\n<td>Selbst betriebenes LLM mit Constrained Decoding<\/td>\n<td>Anweisung und Beispiele im Prompt<\/td>\n<td>ja, nachtr\u00e4glich kalibrierbar<\/td>\n<td>ja<\/td>\n<td>selbst betrieben, bei kleinen Modellen g\u00fcnstig<\/td>\n<\/tr>\n<tr>\n<td>Jev<\/td>\n<td>Anweisung in der Frage, Regeln im State<\/td>\n<td>ja, laut Hersteller kalibriert<\/td>\n<td>nein<\/td>\n<td>nur als Dienst in den USA, rund 0,3 s<\/td>\n<\/tr>\n<tr>\n<td>Offene Modelle mit Jev-Schnittstelle (Kev, SemIf)<\/td>\n<td>wie Jev<\/td>\n<td>ja<\/td>\n<td>nein<\/td>\n<td>selbst betrieben<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<h2><span class=\"ez-toc-section\" id=\"Offene-Alternativen\"><\/span><b>Offene Alternativen<\/b><span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Jevs Schnittstelle blieb nicht lange exklusiv: Wenige Tage nach der Ver\u00f6ffentlichung gab es mehrere offene Modelle mit derselben Schnittstelle, die man selbst betreiben kann:<\/p>\n<table>\n<thead>\n<tr>\n<th>Modell<\/th>\n<th>Grundlage<\/th>\n<th>Verf\u00fcgbarkeit<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Kev (Palmer, 2026)<\/td>\n<td>Qwen3.5 in drei Gr\u00f6\u00dfen, nachtrainiert<\/td>\n<td>frei (Apache-2.0), mit dem TypeSafe-SDK nutzbar<\/td>\n<\/tr>\n<tr>\n<td>SemIf, zuvor OpenJev (TheoLeeCJ, 2026)<\/td>\n<td>Qwen3.5 mit 4 Mrd. Parametern<\/td>\n<td>frei, lokal betreibbar<\/td>\n<\/tr>\n<tr>\n<td>djev (Maisa, 2026)<\/td>\n<td>Diffusionsmodell auf Basis von Gemma<\/td>\n<td>frei (Apache-2.0), selbst betreibbar<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<h2><span class=\"ez-toc-section\" id=\"Wir-haben-Jev-getestet\"><\/span><b>Wir haben Jev getestet<\/b><span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Wir haben einige hundert Anfragen an Jev und Gemini 3.5 Flash-Lite gestellt. Die F\u00e4lle sind klein und teils konstruiert.<\/p>\n<h3><span class=\"ez-toc-section\" id=\"Zusammenhaengende-Felder-koennen-sich-widersprechen\"><\/span>Zusammenh\u00e4ngende Felder k\u00f6nnen sich widersprechen<span class=\"ez-toc-section-end\"><\/span><\/h3>\n<p>Jev bewertet jede Frage getrennt; geteilt ist nur der State (TypeSafe AI, 2026d). TypeSafe sieht darin eine St\u00e4rke: Die verl\u00e4sslichsten Workflows bestehen laut TypeSafe aus vielen unabh\u00e4ngigen, zerlegten Fragen (TypeSafe, 2026a). Heikel wird das, sobald Antworten zusammenpassen m\u00fcssen. Ein Beispiel: Aus einem Museum ist \u00fcber Nacht ein Gem\u00e4lde verschwunden, und genau eines von drei Szenarien trifft zu.<\/p>\n<table>\n<thead>\n<tr>\n<th>Szenario<\/th>\n<th>Wahrscheinlichkeit<\/th>\n<th>T\u00e4ter<\/th>\n<th>Weg<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>A<\/td>\n<td>30 %<\/td>\n<td>Nachtw\u00e4chter<\/td>\n<td>Laderampe<\/td>\n<\/tr>\n<tr>\n<td>B<\/td>\n<td>25 %<\/td>\n<td>Nachtw\u00e4chter<\/td>\n<td>Personalausgang<\/td>\n<\/tr>\n<tr>\n<td>C<\/td>\n<td>45 %<\/td>\n<td>Einbrecher von au\u00dfen<\/td>\n<td>Dach<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p>Beide Modelle bekamen dieselben zwei Fragen: \u201eAuf welchem Weg hat das Gem\u00e4lde das Geb\u00e4ude verlassen?\u201c und \u201eWar es ein Innent\u00e4ter?\u201c. Jev beantwortet sie unabh\u00e4ngig voneinander. Gemini beantwortet beide in einer einzigen Anfrage (Request): Mit Reasoning w\u00e4gt es die Fragen gemeinsam ab, bevor es antwortet, und auch ohne Reasoning liest es beim zweiten Feld die erste Antwort mit. Zus\u00e4tzlich fragten wir beide direkt nach dem Szenario.<sup id=\"fnref-4\"><a href=\"#fn-4\">4<\/a><\/sup><\/p>\n<h3><span class=\"ez-toc-section\" id=\"Wie-Jevs-Wahrscheinlichkeiten-zu-lesen-sind\"><\/span>Wie Jevs Wahrscheinlichkeiten zu lesen sind<span class=\"ez-toc-section-end\"><\/span><\/h3>\n<p>Der Museumsfall wirft eine zweite Frage auf: Was bedeutet Jevs 0,96 f\u00fcr das Dach, wenn der Text 45 % nennt? Eine Wahrscheinlichkeit ist kalibriert, wenn von allen Antworten mit 0,8 etwa 80 % stimmen, und das immer bezogen auf eine bestimmte Menge von F\u00e4llen (H\u00e1jek, 2007). Worauf sich Jevs 0,8 beziehen, sagt TypeSafe nicht. Als Ma\u00dfstab dienen ihm aber die Antworten von Frontier-LLMs, der Mittelwert von GPT-6 Astra und Claude Fable 5.1 (TypeSafe AI, 2026a). Jevs Zahl sagt damit am ehesten, wie wahrscheinlich ein Frontier-LLM diese Antwort geben w\u00fcrde, nicht, wie oft sie stimmt.<\/p>\n<p>Ein erster unabh\u00e4ngiger, nicht begutachteter Test fand Jev auf bekannten Benchmarks gut kalibriert, auf 900 neu erzeugten Support-Tickets weniger: bei Auswahlfragen zu selbstsicher, bei Ja-Nein-Fragen zu vorsichtig (scienthoon, 2026). Unser Museumsfall passt zur Beobachtung bei Auswahlfragen: Als Auswahlfrage bekam das Dach 0,96 bis 0,98 statt der im Text genannten 0,45.<\/p>\n<p>Die Zahlen schwanken zudem. Das Rechnungs-Ticket bekam in 20 identischen L\u00e4ufen 0,67 bis 0,76, bei vertauschter Reihenfolge der Optionen rund 0,1 mehr oder weniger, auf Englisch nur 0,5 bis 0,6. Eine Schwelle von 0,70 w\u00fcrde identische Anfragen also mal durchwinken, mal einem Menschen vorlegen.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Potenzial\"><\/span>Potenzial<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Wie gro\u00df Jevs Potenzial ist, h\u00e4ngt davon ab, womit man es vergleicht. TypeSafe misst Jev an Frontier-Modellen (TypeSafe, 2026a). Viele Klassifikationsaufgaben brauchen aber kein Frontier-Modell; daf\u00fcr reichen kleine Modelle wie Claude Haiku oder Gemini Flash-Lite. Diese sind nach unserer Erfahrung aus Kundenprojekten in Unternehmen kein nennenswerter Kostenfaktor, ins Gewicht fallen die Frontier-Modelle. Jevs Kostenvorteil z\u00e4hlt also vor allem dort, wo man f\u00fcr eine Klassifikation bisher ein Frontier-Modell braucht, und dieser Bereich ist wom\u00f6glich recht speziell. Ob Jev dort mith\u00e4lt, zeigt erst ein Benchmark auf der eigenen Aufgabe.<\/p>\n<p>Gegen\u00fcber kleinen Modellen z\u00e4hlt eher die Wartezeit: Mit 0,3 statt 2 bis 7 Sekunden lassen sich Pr\u00fcfungen in laufende Prozesse einbauen, die sonst zu lange dauern w\u00fcrden.<\/p>\n<p>Den gr\u00f6\u00dften Nutzen sehen wir beim Screening gro\u00dfer Datenmengen, wenn man die Nadel im Heuhaufen sucht: Ein Screening mit hohem Recall verkleinert eine lange Liste von Kandidaten drastisch, und erst die wenigen verbleibenden sieht sich ein LLM oder ein Mensch an. In gro\u00dfen Infrastrukturen fallen t\u00e4glich Millionen von Logzeilen und Ereignissen an; ob eine Folge von Eintr\u00e4gen auff\u00e4llig ist, l\u00e4sst sich oft nicht mit festen Regeln entscheiden. Beim Retrieval kann ein Jev-artiges Modell, je nach Wirtschaftlichkeit, eine Frage gegen einige hundert bis wenige tausend Kandidaten einzeln pr\u00fcfen, als semantische Suche oder beim Reranking. Bei diesen Mengen werden auch kleine LLMs teuer und langsam. Profitieren d\u00fcrften vor allem Organisationen mit sehr gro\u00dfen Datenstr\u00f6men, etwa Beh\u00f6rden oder Energieversorger.<\/p>\n<p>Mit Modellen wie Jev unterscheiden sich die Bausteine einer KI-Architektur nicht mehr nur in der Gr\u00f6\u00dfe, sondern auch in der Modellart. Denkbar sind Systeme, in denen jede Modellart die Aufgabe \u00fcbernimmt, die ihr liegt. Ein Jev-artiges Modell stellt die vielen kleinen Weichen: welches Werkzeug, welcher Kontext, welches Modell. Muss eine Klassifikation sp\u00e4ter gepr\u00fcft werden, \u00fcbernimmt ein LLM und schreibt eine Begr\u00fcndung dazu. Am Ende fasst ein gro\u00dfes LLM die Ergebnisse zu einem Bericht zusammen, den Menschen lesen.<\/p>\n<h3><span class=\"ez-toc-section\" id=\"Wahrscheinlichkeit-oder-Konfidenz\"><\/span>Wahrscheinlichkeit oder Konfidenz<span class=\"ez-toc-section-end\"><\/span><\/h3>\n<p>Neben Kosten und Wartezeit wirbt TypeSafe vor allem mit den Wahrscheinlichkeiten. In den Anwendungsf\u00e4llen, die wir aus Projekten kennen, z\u00e4hlt meist etwas anderes: ein Konfidenzwert, an dem man eine Schwelle festmacht. Daf\u00fcr muss die Zahl nicht kalibriert sein. Sie muss nur sichere F\u00e4lle h\u00f6her einstufen als unsichere; wo die Schwelle liegt, legt man ohnehin an eigenen Daten fest. Jev liefert zu Auswahl- und Skalenfragen auch einen solchen Wert. Er wird aber aus den Wahrscheinlichkeiten berechnet, bei drei Optionen als (3 \u00d7 gr\u00f6\u00dfte Wahrscheinlichkeit &#8211; 1) \/ 2 (TypeSafe AI, 2026e), und sagt deshalb nichts dar\u00fcber, wie sicher sich Jev bei den Wahrscheinlichkeiten selbst ist. Echte Wahrscheinlichkeiten braucht man erst, wenn man mit ihnen rechnet, etwa mehrere Einsch\u00e4tzungen nach der Bayes-Regel kombiniert. Ob ein Modell, dessen Aufbau unbekannt ist und das sich \u00fcber den Kontext nur begrenzt steuern l\u00e4sst, f\u00fcr solche Anwendungen taugt, ist offen.<\/p>\n<p>Einen Konfidenzwert bekommt man auch von LLMs, ausdr\u00fccklich oder implizit. Ausdr\u00fccklich, indem das Modell seine Sicherheit selbst angibt, als Wort, Kategorie oder Zahl; solche Angaben sind oft zu hoch (Xiong et al., 2024). Implizit \u00fcber die Logprobs: Die Ausgabeschicht eines LLM berechnet f\u00fcr jedes m\u00f6gliche n\u00e4chste Token eine Wahrscheinlichkeit, nicht nur f\u00fcr das gew\u00e4hlte. Bei selbst betriebenen Modellen kann man sie immer auslesen, bei APIs nicht mehr \u00fcberall. Ob Jevs Zahlen als Wahrscheinlichkeiten stimmen m\u00fcssen oder als Konfidenzwert gen\u00fcgen, muss sich im Einsatz zeigen. Im zweiten Fall ist Jev g\u00fcnstiger und schneller als ein LLM, aber nicht grunds\u00e4tzlich neu.<\/p>\n<p>Ob Wahrscheinlichkeit oder Konfidenzwert: Welche Fehlerquote eine Schwelle auf den eigenen Daten bedeutet, zeigt erst ein Test an einigen hundert eigenen F\u00e4llen mit bekannter Antwort: Wie viele Tickets landen bei 0,8 im falschen Team, wie viele bei 0,9? Mit denselben F\u00e4llen l\u00e4sst sich auch nachtr\u00e4glich kalibrieren (Guo et al., 2017). Die Schwelle w\u00e4hlt man danach, was ein Fehler kostet und was eine Pr\u00fcfung durch einen Menschen kostet; so empfiehlt es auch TypeSafe (TypeSafe AI, 2026e). Bei Auswahlfragen geh\u00f6rt au\u00dferdem eine Option f\u00fcr \u201enicht erkennbar\u201c dazu. Sonst verteilt das Modell die Wahrscheinlichkeit auf die vorhandenen Antworten, auch wenn der Text nichts hergibt.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Grenzen\"><\/span>Grenzen<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<h3><span class=\"ez-toc-section\" id=\"Grenzen-der-Technologie\"><\/span><strong>Grenzen der Technologie<\/strong><span class=\"ez-toc-section-end\"><\/span><\/h3>\n<p>Einige Schw\u00e4chen nennt TypeSafe selbst (TypeSafe AI, 2026f): Jev z\u00e4hlt unzuverl\u00e4ssig und liest Datumsangaben als Text, deshalb vergleicht es Termine schlecht. Doppelte Verneinungen und Schl\u00fcsse \u00fcber mehrere Stufen bereiten ihm M\u00fche, \u00fcberfl\u00fcssige Informationen im State lenken es ab, und in den Daten versteckte Anweisungen k\u00f6nnen seine Antworten beeinflussen. Rechnen, Datumslogik und das Aussortieren \u00fcberfl\u00fcssiger Daten geh\u00f6ren deshalb in den Code.<br \/>\nDiese Schw\u00e4chen haben vermutlich eine gemeinsame Ursache. Ein LLM mit Reasoning kann bei einer schwierigen Frage mehr Tokens erzeugen und so mehr Rechenaufwand einsetzen. Jev erzeugt keine Reasoning-Tokens. Das macht es schnell und g\u00fcnstig, nimmt ihm aber diesen Ausweg. Um ihn zur\u00fcckzugewinnen, ohne wieder zum LLM zu werden, m\u00fcsste ein solches Modell den Aufwand intern an die Schwierigkeit der Frage anpassen, ohne Text zu erzeugen. Ob Jev das kann, ist nicht bekannt.<\/p>\n<p>Der Museumsfall zeigt ein allgemeines Problem: Merkmale, die voneinander abh\u00e4ngen, statistisch gesprochen kovariieren, sind in der Praxis die Regel, nicht die Ausnahme. Wer Jev oder ein Modell derselben Bauart einsetzt, sollte deshalb pr\u00fcfen, ob die abgefragten Kategorien wirklich unabh\u00e4ngig sind. Sind sie es nicht, \u00fcberl\u00e4sst man die Aufgabe besser einem LLM.<br \/>\nEine zweite Grenze betrifft das Wissen, auf das Jev zur\u00fcckgreift. Jev ist ein Klassifikator, der ausschlie\u00dflich allgemeines Wissen nutzt. Er funktioniert, solange die Aufgabe in einer allgemein verst\u00e4ndlichen Dom\u00e4ne liegt. Ist sie eigen, etwa mit Kategorien, die nur im eigenen Unternehmen Sinn ergeben, sollte man von einem Modell wie Jev nicht zu viel erwarten. Bei LLMs hat sich daf\u00fcr In-Context-Learning bew\u00e4hrt: Man gibt im Prompt Beispiele daf\u00fcr, wie F\u00e4lle der eigenen Dom\u00e4ne einzuordnen sind (Brown et al., 2020). Ob Jev Beispiele oder Einordnungsregeln im State ebenso nutzt, haben wir nicht systematisch getestet. Im Museumsfall hat Jev die im State genannten Quoten nicht \u00fcbernommen. Ob TypeSafe eine M\u00f6glichkeit anbieten wird, Jev an die eigene Dom\u00e4ne anzupassen, bleibt abzuwarten.<br \/>\nHinzu kommt die Regulierung: Bewerbungen sollte man einem solchen Modell nicht zur Bewertung geben: Personalauswahl gilt nach dem EU AI Act als Hochrisiko-Bereich (<a href=\"https:\/\/eur-lex.europa.eu\/eli\/reg\/2024\/1689\/oj\">Verordnung (EU) 2024\/1689, Anhang III<\/a>), und ein Modell ohne Begr\u00fcndung l\u00e4sst sich dort kaum rechtfertigen. Beim Produkt Jev kommt hinzu, dass sein Aufbau unbekannt ist. Unter solchen Bedingungen sollte ein Modell wie Jev Entscheidungen eher vorbereiten als verantworten: Es liefert einen Beitrag, die Verantwortung f\u00fcr die Entscheidung liegt woanders. Dazu geh\u00f6rt, jede Antwort mit fester Modellversion (nicht jev-latest) und Zeitpunkt zu protokollieren, zumal die Zahlen schwanken. Nur so l\u00e4sst sich eine Entscheidung sp\u00e4ter pr\u00fcfen.<\/p>\n<h3><span class=\"ez-toc-section\" id=\"Grenzen-des-Produkts\"><\/span><strong>Grenzen des Produkts<\/strong><span class=\"ez-toc-section-end\"><\/span><\/h3>\n<p>Jev ist heute eine L\u00f6sung aus den USA; ein Betrieb in der EU ist nicht dokumentiert (TypeSafe AI, 2026c). F\u00fcr europ\u00e4ische Projekte mit personenbezogenen Daten scheidet das Produkt damit heute oft aus. Zahlt sich die Technologie aus, d\u00fcrfte es aber eine Frage weniger Monate sein, bis es in Europa nutzbar ist: Entweder bietet TypeSafe einen DSGVO-konformen Betrieb an oder es entstehen geschlossene oder offene Alternativen. Offene Modelle mit derselben Schnittstelle gab es schon nach wenigen Tagen; ob sie mithalten, hat noch niemand unabh\u00e4ngig gepr\u00fcft.<\/p>\n<h2><span class=\"ez-toc-section\" id=\"Fazit\"><\/span>Fazit<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<p>Jev macht Klassifikation ohne eigenes Training g\u00fcnstiger, schneller und einfacher zug\u00e4nglich, erfindet sie aber nicht neu. Seine Zahlen sagen vermutlich eher, was ein Frontier-LLM antworten w\u00fcrde, als wie oft die Antwort stimmt; als Konfidenzwert f\u00fcr eine Schwelle gen\u00fcgen sie oft trotzdem. Jev passt, wo mehrere Bedingungen zusammenkommen:<\/p>\n<ul>\n<li>einzelne Fragen, die nicht voneinander abh\u00e4ngen,<\/li>\n<li>eine allgemein verst\u00e4ndliche Dom\u00e4ne,<\/li>\n<li>gro\u00dfe Mengen, f\u00fcr die ein LLM zu teuer oder zu langsam und ein eigener Klassifikator zu aufwendig ist, etwa beim Screening,<\/li>\n<li>Vorentscheidungen oder unkritische Entscheidungen, die nicht im Einzelfall begr\u00fcndet werden m\u00fcssen.<\/li>\n<\/ul>\n<p>Fehlt eine davon, ist meist ein eigener Klassifikator oder ein LLM die bessere Wahl. Auch wo Jev passt, sollte es Entscheidungen vorbereiten, nicht verantworten: Modelle dieser Art bringen dieselben Verzerrungen mit wie LLMs (Kraft, 2021), aber sie lassen sich nur statistisch messen, nicht im Einzelfall an einer Begr\u00fcndung erkennen.<br \/>\nOb sich Jev als eigene Modellklasse etabliert, ist offen. Wenn ja, bestehen KI-Architekturen k\u00fcnftig nicht mehr nur aus gr\u00f6\u00dferen und kleineren LLMs, sondern aus verschiedenen Modellarten.<\/p>\n<hr \/>\n<p id=\"fn-1\"><small><sup>1<\/sup> Die Begriffe System 1 und System 2 \u00fcbernahm Kahneman von Keith Stanovich und Richard West (2000). Mittlerweile sprechen Stanovich und Jonathan Evans pr\u00e4ziser von Typ-1- und Typ-2-Prozessen (Evans &amp; Stanovich, 2013). <a href=\"#fnref-1\">\u21a9<\/a><\/small><\/p>\n<p id=\"fn-2\"><small><sup>2<\/sup> Damit lie\u00dfen sich schon 2023 Kaskaden bauen: Ein kleines, g\u00fcnstiges Modell antwortet, und nur unsichere F\u00e4lle gehen an ein gr\u00f6\u00dferes (Chen et al., 2023). Mit Outlines kann man die Unsicherheit dabei ins Label legen: GPT-3.5 w\u00e4hlt zwischen Labels wie \u201eeindeutig positiv\u201c und \u201evielleicht positiv\u201c, und nur die unsicheren F\u00e4lle gehen an GPT-4 (<a href=\"https:\/\/www.linkedin.com\/posts\/dr-ivan-herreros-b64a204_cascaded-llms-for-sentiment-labelling-a-activity-7140970944268873730-J5L2?utm_source=share&amp;utm_medium=member_desktop&amp;rcm=ACoAADJIWygBa4JaZ_avecM70QCAW3JPhnQVam0\" target=\"_blank\" rel=\"noopener\">Herreros, 2023<\/a>). <a href=\"#fnref-2\">\u21a9<\/a><\/small><\/p>\n<p id=\"fn-3\"><small><sup>3<\/sup> Ausgegebene Selbsteinsch\u00e4tzungen sind oft zu optimistisch (Xiong et al., 2024). <a href=\"#fnref-3\">\u21a9<\/a><\/small><\/p>\n<p id=\"fn-4\"><small><sup>4<\/sup>Jevs Einzelantworten stimmen jede f\u00fcr sich: Ein Innent\u00e4ter ist laut Modell wahrscheinlicher als ein Au\u00dfent\u00e4ter (55 %), und das Dach ist der wahrscheinlichste Weg (45 %). Zusammen ergeben sie jedoch eine Kombination, die in keinem der echten Szenarien vorkommt. Fragte man stattdessen direkt nach dem Gesamtszenario, w\u00e4hlten beide Modelle in allen L\u00e4ufen das korrekte Szenario C. Die erlaubten Kombinationen als eine einzige Auswahlfrage zu stellen, kann also helfen. Dieser Ansatz hat jedoch seine Grenzen: Mehrere einfache Fragen zu einer komplexen zusammenzufassen, widerspricht dem Grundgedanken von Jev. Hinzu kommt, dass die Zahl der m\u00f6glichen Kombinationen mit jedem weiteren Merkmal schnell ins Un\u00fcberschaubare w\u00e4chst. Vor allem aber l\u00f6st der Ansatz das eigentliche Problem nicht: Die jeweils beste Antwort auf separat gestellte Einzelfragen ergibt nicht automatisch die beste Gesamtentscheidung (Dembczy\u0144ski et al., 2012); oder, in Anlehnung an Aristoteles: Was f\u00fcr sich genommen zutrifft, muss in der Verbindung nicht ebenfalls zutreffen (De Interpretatione 11).<a href=\"#fnref-4\">\u21a9<\/a><\/small><\/p>\n<h2><span class=\"ez-toc-section\" id=\"Referenzen\"><\/span>Referenzen<span class=\"ez-toc-section-end\"><\/span><\/h2>\n<ul>\n<li>\n<p data-path-to-node=\"6,0,0\"><b data-path-to-node=\"6,0,0\" data-index-in-node=\"0\">Anthropic. (2026).<\/b> <i data-path-to-node=\"6,0,0\" data-index-in-node=\"19\">Structured outputs<\/i> (Dokumentation). <a class=\"ng-star-inserted\" href=\"https:\/\/docs.anthropic.com\/en\/docs\/build-with-claude\/structured-outputs?utm_source=gemini\" target=\"_blank\" rel=\"noopener\">https:\/\/docs.anthropic.com\/en\/docs\/build-with-claude\/structured-outputs<\/a><\/p>\n<\/li>\n<li><b data-path-to-node=\"8,0,0\" data-index-in-node=\"0\">Aristoteles.<\/b> <i data-path-to-node=\"8,0,0\" data-index-in-node=\"13\">De Interpretatione (Lehre vom Satz)<\/i> (E. Rolf, \u00dcbers., 1995). Meiner Verlag. (Original entstanden ca. 350 v. Chr.)<\/li>\n<li>\n<p data-path-to-node=\"6,1,0\"><b data-path-to-node=\"6,1,0\" data-index-in-node=\"0\">Brown, T., Mann, B., Ryder, N., Subbiah, M., Kaplan, J. D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., Agarwal, S., Herbert-Voss, A., Krueger, G., Henighan, T., Child, R., Ramesh, A., Ziegler, D., Wu, J., Winter, C., \u2026 Amodei, D. (2020).<\/b> Language models are few-shot learners. <i data-path-to-node=\"6,1,0\" data-index-in-node=\"300\">Advances in Neural Information Processing Systems (NeurIPS 2020)<\/i>, 33, 1877\u20131901. <a class=\"ng-star-inserted\" href=\"https:\/\/proceedings.neurips.cc\/paper\/2020\/hash\/1457c0d6bfcb4967418bfb8ac142f64a-Abstract.html?utm_source=gemini\" target=\"_blank\" rel=\"noopener\">https:\/\/proceedings.neurips.cc\/paper\/2020\/hash\/1457c0d6bfcb4967418bfb8ac142f64a-Abstract.html<\/a><\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,2,0\"><b data-path-to-node=\"6,2,0\" data-index-in-node=\"0\">Chen, L., Zaharia, M., &amp; Zou, J. (2023).<\/b> FrugalGPT: How to use large language models while reducing cost and improving performance. <i data-path-to-node=\"6,2,0\" data-index-in-node=\"132\">arXiv preprint arXiv:2305.05176<\/i>. <a class=\"ng-star-inserted\" href=\"https:\/\/arxiv.org\/abs\/2305.05176?utm_source=gemini\" target=\"_blank\" rel=\"noopener\">https:\/\/arxiv.org\/abs\/2305.05176<\/a><\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,3,0\"><b data-path-to-node=\"6,3,0\" data-index-in-node=\"0\">Damani, M., Puri, I., Slocum, S., Shenfeld, I., Choshen, L., Kim, Y., &amp; Andreas, J. (2025).<\/b> Beyond binary rewards: Training LMs to reason about their uncertainty. <i data-path-to-node=\"6,3,0\" data-index-in-node=\"163\">arXiv preprint arXiv:2507.16806<\/i>. <a class=\"ng-star-inserted\" href=\"https:\/\/arxiv.org\/abs\/2507.16806?utm_source=gemini\" target=\"_blank\" rel=\"noopener\">https:\/\/arxiv.org\/abs\/2507.16806<\/a><\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,4,0\"><b data-path-to-node=\"6,4,0\" data-index-in-node=\"0\">Dembczy\u0144ski, K., Waegeman, W., Cheng, W., &amp; H\u00fcllermeier, E. (2012).<\/b> On label dependence and loss minimization in multi-label classification. <i data-path-to-node=\"6,4,0\" data-index-in-node=\"141\">Machine Learning<\/i>, 88(1-2), 5\u201345. <a class=\"ng-star-inserted\" href=\"https:\/\/doi.org\/10.1007\/s10994-012-5292-0?utm_source=gemini\" target=\"_blank\" rel=\"noopener\">https:\/\/doi.org\/10.1007\/s10994-012-5292-0<\/a><\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,5,0\"><b data-path-to-node=\"6,5,0\" data-index-in-node=\"0\">Devlin, J., Chang, M.-W., Lee, K., &amp; Toutanova, K. (2019).<\/b> BERT: Pre-training of deep bidirectional transformers for language understanding. <i data-path-to-node=\"6,5,0\" data-index-in-node=\"141\">NAACL 2019<\/i>, 4171\u20134186. <a class=\"ng-star-inserted\" href=\"https:\/\/aclanthology.org\/N19-1423\/?utm_source=gemini\" target=\"_blank\" rel=\"noopener\">https:\/\/aclanthology.org\/N19-1423\/<\/a><\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,6,0\"><b data-path-to-node=\"6,6,0\" data-index-in-node=\"0\">dottxt. (2026).<\/b> <i data-path-to-node=\"6,6,0\" data-index-in-node=\"16\">Outlines<\/i> (Software, GitHub Repository). <a class=\"ng-star-inserted\" href=\"https:\/\/github.com\/dottxt-ai\/outlines?utm_source=gemini\" target=\"_blank\" rel=\"noopener\">https:\/\/github.com\/dottxt-ai\/outlines<\/a><\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,7,0\"><b data-path-to-node=\"6,7,0\" data-index-in-node=\"0\">Evans, J. S. B. &amp; Stanovich, K. E. (2013).<\/b> Dual-process theories of higher cognition: Advancing the debate. <i data-path-to-node=\"6,7,0\" data-index-in-node=\"108\">Perspectives on Psychological Science<\/i>, 8(3), 223\u2013241. <a class=\"ng-star-inserted\" href=\"https:\/\/doi.org\/10.1177\/1745691612460685?utm_source=gemini\" target=\"_blank\" rel=\"noopener\">https:\/\/doi.org\/10.1177\/1745691612460685<\/a><\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,8,0\"><b data-path-to-node=\"6,8,0\" data-index-in-node=\"0\">Google. (2026a).<\/b> <i data-path-to-node=\"6,8,0\" data-index-in-node=\"17\">Structured outputs<\/i> (Gemini API Dokumentation). <a class=\"ng-star-inserted\" href=\"https:\/\/ai.google.dev\/gemini-api\/docs\/structured-output?utm_source=gemini\" target=\"_blank\" rel=\"noopener\">https:\/\/ai.google.dev\/gemini-api\/docs\/structured-output<\/a><\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,9,0\"><b data-path-to-node=\"6,9,0\" data-index-in-node=\"0\">Google. (2026b).<\/b> <i data-path-to-node=\"6,9,0\" data-index-in-node=\"17\">Gemini thinking \/ Interactions API<\/i> (Gemini API Dokumentation). <a class=\"ng-star-inserted\" href=\"https:\/\/ai.google.dev\/gemini-api\/docs\/thinking?utm_source=gemini\" target=\"_blank\" rel=\"noopener\">https:\/\/ai.google.dev\/gemini-api\/docs\/thinking<\/a><\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,10,0\"><b data-path-to-node=\"6,10,0\" data-index-in-node=\"0\">Google. (2026c).<\/b> <i data-path-to-node=\"6,10,0\" data-index-in-node=\"17\">Gemini Developer API pricing<\/i> (Preisliste, abgerufen am 24. September 2026). <a class=\"ng-star-inserted\" href=\"https:\/\/ai.google.dev\/pricing?utm_source=gemini\" target=\"_blank\" rel=\"noopener\">https:\/\/ai.google.dev\/pricing<\/a><\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,11,0\"><b data-path-to-node=\"6,11,0\" data-index-in-node=\"0\">Guo, C., Pleiss, G., Sun, Y., &amp; Weinberger, K. Q. (2017).<\/b> On calibration of modern neural networks. <i data-path-to-node=\"6,11,0\" data-index-in-node=\"100\">ICML 2017<\/i>, 1321\u20131330. <a class=\"ng-star-inserted\" href=\"https:\/\/proceedings.mlr.press\/v70\/guo17a.html?utm_source=gemini\" target=\"_blank\" rel=\"noopener\">https:\/\/proceedings.mlr.press\/v70\/guo17a.html<\/a><\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,12,0\"><b data-path-to-node=\"6,12,0\" data-index-in-node=\"0\">H\u00e1jek, A. (2007).<\/b> The reference class problem is your problem too. <i data-path-to-node=\"6,12,0\" data-index-in-node=\"67\">Synthese<\/i>, 156(3), 563\u2013585. <a class=\"ng-star-inserted\" href=\"https:\/\/doi.org\/10.1007\/s11229-006-9090-y?utm_source=gemini\" target=\"_blank\" rel=\"noopener\">https:\/\/doi.org\/10.1007\/s11229-006-9090-y<\/a><\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,13,0\"><b data-path-to-node=\"6,13,0\" data-index-in-node=\"0\">Herreros, I. (2023).<\/b> <i data-path-to-node=\"6,13,0\" data-index-in-node=\"21\">Cascaded LLMs for sentiment labelling with Outlines<\/i> [LinkedIn-Post]. LinkedIn. <a class=\"ng-star-inserted\" href=\"https:\/\/www.linkedin.com\/posts\/dr-ivan-herreros-b64a204_cascaded-llms-for-sentiment-labelling-a-activity-7140970944268873730-J5L2?utm_source=gemini\" target=\"_blank\" rel=\"noopener\">https:\/\/www.linkedin.com\/posts\/dr-ivan-herreros-b64a204_cascaded-llms-for-sentiment-labelling-a-activity-7140970944268873730-J5L2<\/a><\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,14,0\"><b data-path-to-node=\"6,14,0\" data-index-in-node=\"0\">Kahneman, D. (2011).<\/b> <i data-path-to-node=\"6,14,0\" data-index-in-node=\"21\">Thinking, fast and slow<\/i>. Farrar, Straus and Giroux.<\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,15,0\"><b data-path-to-node=\"6,15,0\" data-index-in-node=\"0\">Kahneman, D. &amp; Tversky, A. (1973).<\/b> On the psychology of prediction. <i data-path-to-node=\"6,15,0\" data-index-in-node=\"68\">Psychological Review<\/i>, 80(4), 237\u2013251. <a class=\"ng-star-inserted\" href=\"https:\/\/doi.org\/10.1037\/h0034747?utm_source=gemini\" target=\"_blank\" rel=\"noopener\">https:\/\/doi.org\/10.1037\/h0034747<\/a><\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,16,0\"><b data-path-to-node=\"6,16,0\" data-index-in-node=\"0\">Kraft, A. (2021, 9. Dezember).<\/b> <i data-path-to-node=\"6,16,0\" data-index-in-node=\"31\">Social Bias in gro\u00dfen KI-Modellen und wie man damit umgeht<\/i>. inovex Blog. <a class=\"ng-star-inserted\" href=\"https:\/\/www.inovex.de\/de\/blog\/social-bias-in-grossen-ki-modellen\/?utm_source=gemini\" target=\"_blank\" rel=\"noopener\">https:\/\/www.inovex.de\/de\/blog\/social-bias-in-grossen-ki-modellen\/<\/a><\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,17,0\"><b data-path-to-node=\"6,17,0\" data-index-in-node=\"0\">Maisa. (2026).<\/b> <i data-path-to-node=\"6,17,0\" data-index-in-node=\"15\">djev<\/i> (Software, GitHub Repository). https:\/\/github.com\/Davipar\/djev-dev<\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,18,0\"><b data-path-to-node=\"6,18,0\" data-index-in-node=\"0\">OpenAI. (2024, 6. August).<\/b> <i data-path-to-node=\"6,18,0\" data-index-in-node=\"27\">Introducing Structured Outputs in the API<\/i>. OpenAI Blog. <a class=\"ng-star-inserted\" href=\"https:\/\/openai.com\/index\/introducing-structured-outputs-in-the-api\/?utm_source=gemini\" target=\"_blank\" rel=\"noopener\">https:\/\/openai.com\/index\/introducing-structured-outputs-in-the-api\/<\/a><\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,19,0\"><b data-path-to-node=\"6,19,0\" data-index-in-node=\"0\">Palmer, J. (2026).<\/b> <i data-path-to-node=\"6,19,0\" data-index-in-node=\"19\">Kev: Open decision models<\/i> (Software, README). GitHub. https:\/\/github.com\/jaredpalmer\/kev<\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,20,0\"><b data-path-to-node=\"6,20,0\" data-index-in-node=\"0\">scienthoon. (2026).<\/b> <i data-path-to-node=\"6,20,0\" data-index-in-node=\"20\">jev-ood-calibration<\/i> (Software, README). GitHub. Nicht begutachtet.<\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,21,0\"><b data-path-to-node=\"6,21,0\" data-index-in-node=\"0\">Stanovich, K. E. &amp; West, R. F. (2000).<\/b> Individual differences in reasoning: Implications for the rationality debate? <i data-path-to-node=\"6,21,0\" data-index-in-node=\"117\">Behavioral and Brain Sciences<\/i>, 23(5), 645\u2013665. <a class=\"ng-star-inserted\" href=\"https:\/\/doi.org\/10.1017\/S0140525X00003435?utm_source=gemini\" target=\"_blank\" rel=\"noopener\">https:\/\/doi.org\/10.1017\/S0140525X00003435<\/a><\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,22,0\"><b data-path-to-node=\"6,22,0\" data-index-in-node=\"0\">TheoLeeCJ. (2026).<\/b> <i data-path-to-node=\"6,22,0\" data-index-in-node=\"19\">SemIf (fr\u00fcher OpenJev)<\/i> (Software). GitHub.<\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,23,0\"><b data-path-to-node=\"6,23,0\" data-index-in-node=\"0\">TypeSafe AI (2026a).<\/b> <i data-path-to-node=\"6,23,0\" data-index-in-node=\"21\">Introducing System One Models &amp; Jev<\/i>. <a class=\"ng-star-inserted\" href=\"https:\/\/typesafe.ai\/blog\/introducing-system-one-models-and-jev?utm_source=gemini\" target=\"_blank\" rel=\"noopener\">https:\/\/typesafe.ai\/blog\/introducing-system-one-models-and-jev<\/a><\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,24,0\"><b data-path-to-node=\"6,24,0\" data-index-in-node=\"0\">TypeSafe AI (2026b).<\/b> <i data-path-to-node=\"6,24,0\" data-index-in-node=\"21\">The Three Primitives<\/i>. <a class=\"ng-star-inserted\" href=\"https:\/\/docs.typesafe.ai\/primitives?utm_source=gemini\" target=\"_blank\" rel=\"noopener\">https:\/\/docs.typesafe.ai\/primitives<\/a><\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,25,0\"><b data-path-to-node=\"6,25,0\" data-index-in-node=\"0\">TypeSafe AI (2026c).<\/b> <i data-path-to-node=\"6,25,0\" data-index-in-node=\"21\">Models<\/i>. <a class=\"ng-star-inserted\" href=\"https:\/\/docs.typesafe.ai\/models?utm_source=gemini\" target=\"_blank\" rel=\"noopener\">https:\/\/docs.typesafe.ai\/models<\/a><\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,26,0\"><b data-path-to-node=\"6,26,0\" data-index-in-node=\"0\">TypeSafe AI (2026d).<\/b> <i data-path-to-node=\"6,26,0\" data-index-in-node=\"21\">Asking Parallel Questions<\/i> (Cookbook). <a class=\"ng-star-inserted\" href=\"https:\/\/docs.typesafe.ai\/cookbooks\/parallel_questions?utm_source=gemini\" target=\"_blank\" rel=\"noopener\">https:\/\/docs.typesafe.ai\/cookbooks\/parallel_questions<\/a><\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,27,0\"><b data-path-to-node=\"6,27,0\" data-index-in-node=\"0\">TypeSafe AI (2026e).<\/b> <i data-path-to-node=\"6,27,0\" data-index-in-node=\"21\">Confidence<\/i> (Dokumentation). <a class=\"ng-star-inserted\" href=\"https:\/\/docs.typesafe.ai\/confidence?utm_source=gemini\" target=\"_blank\" rel=\"noopener\">https:\/\/docs.typesafe.ai\/confidence<\/a><\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,28,0\"><b data-path-to-node=\"6,28,0\" data-index-in-node=\"0\">TypeSafe AI (2026f).<\/b> <i data-path-to-node=\"6,28,0\" data-index-in-node=\"21\">Known Limitations<\/i> (Dokumentation). <a class=\"ng-star-inserted\" href=\"https:\/\/docs.typesafe.ai\/limitations?utm_source=gemini\" target=\"_blank\" rel=\"noopener\">https:\/\/docs.typesafe.ai\/limitations<\/a><\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,29,0\"><b data-path-to-node=\"6,29,0\" data-index-in-node=\"0\">Verordnung (EU) 2024\/1689 (KI-Verordnung). (2024).<\/b> <i data-path-to-node=\"6,29,0\" data-index-in-node=\"51\">Amtsblatt der Europ\u00e4ischen Union<\/i>, L 2024\/1689. <a class=\"ng-star-inserted\" href=\"http:\/\/data.europa.eu\/eli\/reg\/2024\/1689\/oj?utm_source=gemini\" target=\"_blank\" rel=\"noopener\">http:\/\/data.europa.eu\/eli\/reg\/2024\/1689\/oj<\/a><\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,30,0\"><b data-path-to-node=\"6,30,0\" data-index-in-node=\"0\">Willard, B. T. &amp; Louf, R. (2023).<\/b> Efficient guided generation for large language models. <i data-path-to-node=\"6,30,0\" data-index-in-node=\"89\">arXiv preprint arXiv:2307.09702<\/i>. <a class=\"ng-star-inserted\" href=\"https:\/\/arxiv.org\/abs\/2307.09702?utm_source=gemini\" target=\"_blank\" rel=\"noopener\">https:\/\/arxiv.org\/abs\/2307.09702<\/a><\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,31,0\"><b data-path-to-node=\"6,31,0\" data-index-in-node=\"0\">Xiong, M., Hu, Z., Lu, X., Li, Y., Fu, J., Liu, Y., &amp; Liu, Q. (2024).<\/b> Can LLMs express their uncertainty? An empirical evaluation of confidence elicitation in LLMs. <i data-path-to-node=\"6,31,0\" data-index-in-node=\"165\">ICLR 2024<\/i>. <a class=\"ng-star-inserted\" href=\"https:\/\/openreview.net\/forum?id=1TqD4fF5yJ&amp;utm_source=gemini\" target=\"_blank\" rel=\"noopener\">https:\/\/openreview.net\/forum?id=1TqD4fF5yJ<\/a><\/p>\n<\/li>\n<li>\n<p data-path-to-node=\"6,32,0\"><b data-path-to-node=\"6,32,0\" data-index-in-node=\"0\">Yin, W., Hay, J., &amp; Roth, D. (2019).<\/b> Benchmarking zero-shot text classification: Datasets, evaluation and entailment approach. <i data-path-to-node=\"6,32,0\" data-index-in-node=\"127\">EMNLP-IJCNLP 2019<\/i>, 3914\u20133923. <a class=\"ng-star-inserted\" href=\"https:\/\/aclanthology.org\/D19-1395\/?utm_source=gemini\" target=\"_blank\" rel=\"noopener\">https:\/\/aclanthology.org\/D19-1395\/<\/a><\/p>\n<\/li>\n<\/ul>\n","protected":false},"excerpt":{"rendered":"<p>Am 15. September 2026 hat TypeSafe AI sein erstes \u00f6ffentliches Modell vorgestellt: Jev; zugeschnitten auf Klassifikationsaufgaben (TypeSafe AI, 2026a). Statt mit Text antwortet es mit Zahlen und bei Auswahlfragen zus\u00e4tzlich mit der gew\u00e4hlten Option aus einer vorgegebenen Liste. Typische Fragen sind \u201eIst das Spam?\u201c, \u201eWelches Team ist zust\u00e4ndig?\u201c oder \u201eWie dringend ist das?\u201c. TypeSafe nennt [&hellip;]<\/p>\n","protected":false},"author":464,"featured_media":70276,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"_acf_changed":false,"inline_featured_image":false,"ep_exclude_from_search":false,"footnotes":""},"tags":[],"service":[76],"level":[1280],"coauthors":[{"id":464,"display_name":"Nicolas Werner","user_nicename":"nwerner"},{"id":465,"display_name":"Ivan Herreros Alonso","user_nicename":"iherreros-alonso"}],"class_list":["post-70197","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","service-artificial-intelligence"],"acf":[],"yoast_head":"<!-- This site is optimized with the Yoast SEO plugin v28.5 - https:\/\/yoast.com\/product\/yoast-seo-wordpress\/ -->\n<title>TypeSafe AI Jev im Test: Wie gut ist das neue Modell f\u00fcr KI-Klassifikation? - inovex GmbH<\/title>\n<meta name=\"description\" content=\"Wie schl\u00e4gt sich das System-One-Modell Jev bei Klassifikationen? Praxistest zu Konfidenz, Kosten, Geschwindigkeit.\" \/>\n<meta name=\"robots\" content=\"index, follow, max-snippet:-1, max-image-preview:large, max-video-preview:-1\" \/>\n<link rel=\"canonical\" href=\"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/\" \/>\n<meta property=\"og:locale\" content=\"de_DE\" \/>\n<meta property=\"og:type\" content=\"article\" \/>\n<meta property=\"og:title\" content=\"TypeSafe AI Jev im Test: Wie gut ist das neue Modell f\u00fcr KI-Klassifikation? - inovex GmbH\" \/>\n<meta property=\"og:description\" content=\"Wie schl\u00e4gt sich das System-One-Modell Jev bei Klassifikationen? Praxistest zu Konfidenz, Kosten, Geschwindigkeit.\" \/>\n<meta property=\"og:url\" content=\"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/\" \/>\n<meta property=\"og:site_name\" content=\"inovex GmbH\" \/>\n<meta property=\"article:publisher\" content=\"https:\/\/www.facebook.com\/inovexde\" \/>\n<meta property=\"article:published_time\" content=\"2026-09-29T08:48:51+00:00\" \/>\n<meta property=\"article:modified_time\" content=\"2026-09-29T10:50:00+00:00\" \/>\n<meta property=\"og:image\" content=\"https:\/\/www.inovex.de\/wp-content\/uploads\/Jev_TypeSafe_AI.png\" \/>\n\t<meta property=\"og:image:width\" content=\"1500\" \/>\n\t<meta property=\"og:image:height\" content=\"880\" \/>\n\t<meta property=\"og:image:type\" content=\"image\/png\" \/>\n<meta name=\"author\" content=\"Nicolas Werner, Ivan Herreros Alonso\" \/>\n<meta name=\"twitter:card\" content=\"summary_large_image\" \/>\n<meta name=\"twitter:image\" content=\"https:\/\/www.inovex.de\/wp-content\/uploads\/Jev_TypeSafe_AI-1024x601.png\" \/>\n<meta name=\"twitter:creator\" content=\"@inovexgmbh\" \/>\n<meta name=\"twitter:site\" content=\"@inovexgmbh\" \/>\n<meta name=\"twitter:label1\" content=\"Verfasst von\" \/>\n\t<meta name=\"twitter:data1\" content=\"Nicolas Werner\" \/>\n\t<meta name=\"twitter:label2\" content=\"Gesch\u00e4tzte Lesezeit\" \/>\n\t<meta name=\"twitter:data2\" content=\"22\u00a0Minuten\" \/>\n\t<meta name=\"twitter:label3\" content=\"Written by\" \/>\n\t<meta name=\"twitter:data3\" content=\"Nicolas Werner, Ivan Herreros Alonso\" \/>\n<script type=\"application\/ld+json\" class=\"yoast-schema-graph\">{\"@context\":\"https:\\\/\\\/schema.org\",\"@graph\":[{\"@type\":\"Article\",\"@id\":\"https:\\\/\\\/www.inovex.de\\\/de\\\/blog\\\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\\\/#article\",\"isPartOf\":{\"@id\":\"https:\\\/\\\/www.inovex.de\\\/de\\\/blog\\\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\\\/\"},\"author\":{\"name\":\"Nicolas Werner\",\"@id\":\"https:\\\/\\\/www.inovex.de\\\/de\\\/#\\\/schema\\\/person\\\/dbf2a7628b5fc2149d389512f71d91af\"},\"headline\":\"TypeSafe AI Jev im Test: Wie gut ist das neue Modell f\u00fcr KI-Klassifikation?\",\"datePublished\":\"2026-09-29T08:48:51+00:00\",\"dateModified\":\"2026-09-29T10:50:00+00:00\",\"mainEntityOfPage\":{\"@id\":\"https:\\\/\\\/www.inovex.de\\\/de\\\/blog\\\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\\\/\"},\"wordCount\":4135,\"commentCount\":0,\"publisher\":{\"@id\":\"https:\\\/\\\/www.inovex.de\\\/de\\\/#organization\"},\"image\":{\"@id\":\"https:\\\/\\\/www.inovex.de\\\/de\\\/blog\\\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\\\/#primaryimage\"},\"thumbnailUrl\":\"https:\\\/\\\/www.inovex.de\\\/wp-content\\\/uploads\\\/Jev_TypeSafe_AI.png\",\"inLanguage\":\"de\",\"potentialAction\":[{\"@type\":\"CommentAction\",\"name\":\"Comment\",\"target\":[\"https:\\\/\\\/www.inovex.de\\\/de\\\/blog\\\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\\\/#respond\"]}]},{\"@type\":\"WebPage\",\"@id\":\"https:\\\/\\\/www.inovex.de\\\/de\\\/blog\\\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\\\/\",\"url\":\"https:\\\/\\\/www.inovex.de\\\/de\\\/blog\\\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\\\/\",\"name\":\"TypeSafe AI Jev im Test: Wie gut ist das neue Modell f\u00fcr KI-Klassifikation? - inovex GmbH\",\"isPartOf\":{\"@id\":\"https:\\\/\\\/www.inovex.de\\\/de\\\/#website\"},\"primaryImageOfPage\":{\"@id\":\"https:\\\/\\\/www.inovex.de\\\/de\\\/blog\\\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\\\/#primaryimage\"},\"image\":{\"@id\":\"https:\\\/\\\/www.inovex.de\\\/de\\\/blog\\\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\\\/#primaryimage\"},\"thumbnailUrl\":\"https:\\\/\\\/www.inovex.de\\\/wp-content\\\/uploads\\\/Jev_TypeSafe_AI.png\",\"datePublished\":\"2026-09-29T08:48:51+00:00\",\"dateModified\":\"2026-09-29T10:50:00+00:00\",\"description\":\"Wie schl\u00e4gt sich das System-One-Modell Jev bei Klassifikationen? Praxistest zu Konfidenz, Kosten, Geschwindigkeit.\",\"breadcrumb\":{\"@id\":\"https:\\\/\\\/www.inovex.de\\\/de\\\/blog\\\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\\\/#breadcrumb\"},\"inLanguage\":\"de\",\"potentialAction\":[{\"@type\":\"ReadAction\",\"target\":[\"https:\\\/\\\/www.inovex.de\\\/de\\\/blog\\\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\\\/\"]}]},{\"@type\":\"ImageObject\",\"inLanguage\":\"de\",\"@id\":\"https:\\\/\\\/www.inovex.de\\\/de\\\/blog\\\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\\\/#primaryimage\",\"url\":\"https:\\\/\\\/www.inovex.de\\\/wp-content\\\/uploads\\\/Jev_TypeSafe_AI.png\",\"contentUrl\":\"https:\\\/\\\/www.inovex.de\\\/wp-content\\\/uploads\\\/Jev_TypeSafe_AI.png\",\"width\":1500,\"height\":880},{\"@type\":\"BreadcrumbList\",\"@id\":\"https:\\\/\\\/www.inovex.de\\\/de\\\/blog\\\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\\\/#breadcrumb\",\"itemListElement\":[{\"@type\":\"ListItem\",\"position\":1,\"name\":\"Home\",\"item\":\"https:\\\/\\\/www.inovex.de\\\/de\\\/\"},{\"@type\":\"ListItem\",\"position\":2,\"name\":\"TypeSafe AI Jev im Test: Wie gut ist das neue Modell f\u00fcr KI-Klassifikation?\"}]},{\"@type\":\"WebSite\",\"@id\":\"https:\\\/\\\/www.inovex.de\\\/de\\\/#website\",\"url\":\"https:\\\/\\\/www.inovex.de\\\/de\\\/\",\"name\":\"inovex GmbH\",\"description\":\"\",\"publisher\":{\"@id\":\"https:\\\/\\\/www.inovex.de\\\/de\\\/#organization\"},\"potentialAction\":[{\"@type\":\"SearchAction\",\"target\":{\"@type\":\"EntryPoint\",\"urlTemplate\":\"https:\\\/\\\/www.inovex.de\\\/de\\\/?s={search_term_string}\"},\"query-input\":{\"@type\":\"PropertyValueSpecification\",\"valueRequired\":true,\"valueName\":\"search_term_string\"}}],\"inLanguage\":\"de\"},{\"@type\":\"Organization\",\"@id\":\"https:\\\/\\\/www.inovex.de\\\/de\\\/#organization\",\"name\":\"inovex GmbH\",\"url\":\"https:\\\/\\\/www.inovex.de\\\/de\\\/\",\"logo\":{\"@type\":\"ImageObject\",\"inLanguage\":\"de\",\"@id\":\"https:\\\/\\\/www.inovex.de\\\/de\\\/#\\\/schema\\\/logo\\\/image\\\/\",\"url\":\"https:\\\/\\\/www.inovex.de\\\/wp-content\\\/uploads\\\/2021\\\/03\\\/inovex-logo-16-9-1.png\",\"contentUrl\":\"https:\\\/\\\/www.inovex.de\\\/wp-content\\\/uploads\\\/2021\\\/03\\\/inovex-logo-16-9-1.png\",\"width\":1921,\"height\":1081,\"caption\":\"inovex GmbH\"},\"image\":{\"@id\":\"https:\\\/\\\/www.inovex.de\\\/de\\\/#\\\/schema\\\/logo\\\/image\\\/\"},\"sameAs\":[\"https:\\\/\\\/www.facebook.com\\\/inovexde\",\"https:\\\/\\\/x.com\\\/inovexgmbh\",\"https:\\\/\\\/www.instagram.com\\\/inovexlife\\\/\",\"https:\\\/\\\/www.linkedin.com\\\/company\\\/inovex\",\"https:\\\/\\\/www.youtube.com\\\/channel\\\/UC7r66GT14hROB_RQsQBAQUQ\"]},{\"@type\":\"Person\",\"@id\":\"https:\\\/\\\/www.inovex.de\\\/de\\\/#\\\/schema\\\/person\\\/dbf2a7628b5fc2149d389512f71d91af\",\"name\":\"Nicolas Werner\",\"image\":{\"@type\":\"ImageObject\",\"inLanguage\":\"de\",\"@id\":\"https:\\\/\\\/secure.gravatar.com\\\/avatar\\\/b480bc2f7cc503268b8d04a93557f65cc5cd09840ce62f5f745102f73a3f1b29?s=96&d=retro&r=g8439c5f586fe0e81da8a2c2813b77254\",\"url\":\"https:\\\/\\\/secure.gravatar.com\\\/avatar\\\/b480bc2f7cc503268b8d04a93557f65cc5cd09840ce62f5f745102f73a3f1b29?s=96&d=retro&r=g\",\"contentUrl\":\"https:\\\/\\\/secure.gravatar.com\\\/avatar\\\/b480bc2f7cc503268b8d04a93557f65cc5cd09840ce62f5f745102f73a3f1b29?s=96&d=retro&r=g\",\"caption\":\"Nicolas Werner\"},\"url\":\"https:\\\/\\\/www.inovex.de\\\/de\\\/blog\\\/author\\\/nwerner\\\/\"}]}<\/script>\n<!-- \/ Yoast SEO plugin. -->","yoast_head_json":{"title":"TypeSafe AI Jev im Test: Wie gut ist das neue Modell f\u00fcr KI-Klassifikation? - inovex GmbH","description":"Wie schl\u00e4gt sich das System-One-Modell Jev bei Klassifikationen? Praxistest zu Konfidenz, Kosten, Geschwindigkeit.","robots":{"index":"index","follow":"follow","max-snippet":"max-snippet:-1","max-image-preview":"max-image-preview:large","max-video-preview":"max-video-preview:-1"},"canonical":"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/","og_locale":"de_DE","og_type":"article","og_title":"TypeSafe AI Jev im Test: Wie gut ist das neue Modell f\u00fcr KI-Klassifikation? - inovex GmbH","og_description":"Wie schl\u00e4gt sich das System-One-Modell Jev bei Klassifikationen? Praxistest zu Konfidenz, Kosten, Geschwindigkeit.","og_url":"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/","og_site_name":"inovex GmbH","article_publisher":"https:\/\/www.facebook.com\/inovexde","article_published_time":"2026-09-29T08:48:51+00:00","article_modified_time":"2026-09-29T10:50:00+00:00","og_image":[{"width":1500,"height":880,"url":"https:\/\/www.inovex.de\/wp-content\/uploads\/Jev_TypeSafe_AI.png","type":"image\/png"}],"author":"Nicolas Werner, Ivan Herreros Alonso","twitter_card":"summary_large_image","twitter_image":"https:\/\/www.inovex.de\/wp-content\/uploads\/Jev_TypeSafe_AI-1024x601.png","twitter_creator":"@inovexgmbh","twitter_site":"@inovexgmbh","twitter_misc":{"Verfasst von":"Nicolas Werner","Gesch\u00e4tzte Lesezeit":"22\u00a0Minuten","Written by":"Nicolas Werner, Ivan Herreros Alonso"},"schema":{"@context":"https:\/\/schema.org","@graph":[{"@type":"Article","@id":"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/#article","isPartOf":{"@id":"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/"},"author":{"name":"Nicolas Werner","@id":"https:\/\/www.inovex.de\/de\/#\/schema\/person\/dbf2a7628b5fc2149d389512f71d91af"},"headline":"TypeSafe AI Jev im Test: Wie gut ist das neue Modell f\u00fcr KI-Klassifikation?","datePublished":"2026-09-29T08:48:51+00:00","dateModified":"2026-09-29T10:50:00+00:00","mainEntityOfPage":{"@id":"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/"},"wordCount":4135,"commentCount":0,"publisher":{"@id":"https:\/\/www.inovex.de\/de\/#organization"},"image":{"@id":"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/#primaryimage"},"thumbnailUrl":"https:\/\/www.inovex.de\/wp-content\/uploads\/Jev_TypeSafe_AI.png","inLanguage":"de","potentialAction":[{"@type":"CommentAction","name":"Comment","target":["https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/#respond"]}]},{"@type":"WebPage","@id":"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/","url":"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/","name":"TypeSafe AI Jev im Test: Wie gut ist das neue Modell f\u00fcr KI-Klassifikation? - inovex GmbH","isPartOf":{"@id":"https:\/\/www.inovex.de\/de\/#website"},"primaryImageOfPage":{"@id":"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/#primaryimage"},"image":{"@id":"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/#primaryimage"},"thumbnailUrl":"https:\/\/www.inovex.de\/wp-content\/uploads\/Jev_TypeSafe_AI.png","datePublished":"2026-09-29T08:48:51+00:00","dateModified":"2026-09-29T10:50:00+00:00","description":"Wie schl\u00e4gt sich das System-One-Modell Jev bei Klassifikationen? Praxistest zu Konfidenz, Kosten, Geschwindigkeit.","breadcrumb":{"@id":"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/#breadcrumb"},"inLanguage":"de","potentialAction":[{"@type":"ReadAction","target":["https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/"]}]},{"@type":"ImageObject","inLanguage":"de","@id":"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/#primaryimage","url":"https:\/\/www.inovex.de\/wp-content\/uploads\/Jev_TypeSafe_AI.png","contentUrl":"https:\/\/www.inovex.de\/wp-content\/uploads\/Jev_TypeSafe_AI.png","width":1500,"height":880},{"@type":"BreadcrumbList","@id":"https:\/\/www.inovex.de\/de\/blog\/typesafe-ai-jev-im-test-wie-gut-ist-das-neue-modell-fuer-ki-klassifikation\/#breadcrumb","itemListElement":[{"@type":"ListItem","position":1,"name":"Home","item":"https:\/\/www.inovex.de\/de\/"},{"@type":"ListItem","position":2,"name":"TypeSafe AI Jev im Test: Wie gut ist das neue Modell f\u00fcr KI-Klassifikation?"}]},{"@type":"WebSite","@id":"https:\/\/www.inovex.de\/de\/#website","url":"https:\/\/www.inovex.de\/de\/","name":"inovex GmbH","description":"","publisher":{"@id":"https:\/\/www.inovex.de\/de\/#organization"},"potentialAction":[{"@type":"SearchAction","target":{"@type":"EntryPoint","urlTemplate":"https:\/\/www.inovex.de\/de\/?s={search_term_string}"},"query-input":{"@type":"PropertyValueSpecification","valueRequired":true,"valueName":"search_term_string"}}],"inLanguage":"de"},{"@type":"Organization","@id":"https:\/\/www.inovex.de\/de\/#organization","name":"inovex GmbH","url":"https:\/\/www.inovex.de\/de\/","logo":{"@type":"ImageObject","inLanguage":"de","@id":"https:\/\/www.inovex.de\/de\/#\/schema\/logo\/image\/","url":"https:\/\/www.inovex.de\/wp-content\/uploads\/2021\/03\/inovex-logo-16-9-1.png","contentUrl":"https:\/\/www.inovex.de\/wp-content\/uploads\/2021\/03\/inovex-logo-16-9-1.png","width":1921,"height":1081,"caption":"inovex GmbH"},"image":{"@id":"https:\/\/www.inovex.de\/de\/#\/schema\/logo\/image\/"},"sameAs":["https:\/\/www.facebook.com\/inovexde","https:\/\/x.com\/inovexgmbh","https:\/\/www.instagram.com\/inovexlife\/","https:\/\/www.linkedin.com\/company\/inovex","https:\/\/www.youtube.com\/channel\/UC7r66GT14hROB_RQsQBAQUQ"]},{"@type":"Person","@id":"https:\/\/www.inovex.de\/de\/#\/schema\/person\/dbf2a7628b5fc2149d389512f71d91af","name":"Nicolas Werner","image":{"@type":"ImageObject","inLanguage":"de","@id":"https:\/\/secure.gravatar.com\/avatar\/b480bc2f7cc503268b8d04a93557f65cc5cd09840ce62f5f745102f73a3f1b29?s=96&d=retro&r=g8439c5f586fe0e81da8a2c2813b77254","url":"https:\/\/secure.gravatar.com\/avatar\/b480bc2f7cc503268b8d04a93557f65cc5cd09840ce62f5f745102f73a3f1b29?s=96&d=retro&r=g","contentUrl":"https:\/\/secure.gravatar.com\/avatar\/b480bc2f7cc503268b8d04a93557f65cc5cd09840ce62f5f745102f73a3f1b29?s=96&d=retro&r=g","caption":"Nicolas Werner"},"url":"https:\/\/www.inovex.de\/de\/blog\/author\/nwerner\/"}]}},"_links":{"self":[{"href":"https:\/\/www.inovex.de\/de\/wp-json\/wp\/v2\/posts\/70197","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.inovex.de\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.inovex.de\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.inovex.de\/de\/wp-json\/wp\/v2\/users\/464"}],"replies":[{"embeddable":true,"href":"https:\/\/www.inovex.de\/de\/wp-json\/wp\/v2\/comments?post=70197"}],"version-history":[{"count":5,"href":"https:\/\/www.inovex.de\/de\/wp-json\/wp\/v2\/posts\/70197\/revisions"}],"predecessor-version":[{"id":70302,"href":"https:\/\/www.inovex.de\/de\/wp-json\/wp\/v2\/posts\/70197\/revisions\/70302"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.inovex.de\/de\/wp-json\/wp\/v2\/media\/70276"}],"wp:attachment":[{"href":"https:\/\/www.inovex.de\/de\/wp-json\/wp\/v2\/media?parent=70197"}],"wp:term":[{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.inovex.de\/de\/wp-json\/wp\/v2\/tags?post=70197"},{"taxonomy":"service","embeddable":true,"href":"https:\/\/www.inovex.de\/de\/wp-json\/wp\/v2\/service?post=70197"},{"taxonomy":"level","embeddable":true,"href":"https:\/\/www.inovex.de\/de\/wp-json\/wp\/v2\/level?post=70197"},{"taxonomy":"author","embeddable":true,"href":"https:\/\/www.inovex.de\/de\/wp-json\/wp\/v2\/coauthors?post=70197"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}