Info

  • Hardware
  • Giantommaso Fogli
Lagotto Meter: Transparenz des Modells, Umkehrung der Architektur und was sich ab dem 22. Juli 2026 ändertLagotto Meter: Transparenz des Modells, Umkehrung der Architektur und was sich ab dem 22. Juli 2026 ändert

Lagotto Meter: Transparenz des Modells, Umkehrung der Architektur und was sich ab dem 22. Juli 2026 ändert

Das Problem: zwei Analysen, zwei unterschiedliche Punkte

Am 22. Juli führte ein Benutzer zwei Analysen von google.com in schneller Folge mit Lagotto Meter durch. Die Ergebnisse waren:

  • Erste Analyse: 40/100 — semantische Konsistenz 30/30
  • Zweite Analyse: 18/100 — semantische Konsistenz 8/30

Delta von 22 Punkten. Gleiche URL, gleicher Tag, gleiche Stunde.

Die technischen Punktzahlen waren in beiden Analysen identisch — llms.txt, JSON-LD, robots.txt, sitemap ändern sich nicht von einer Anfrage zur anderen. Alle Abweichungen konzentrierten sich auf die 30 Punkte der semantischen Konsistenz, die einzige Komponente, die von einem Sprachmodell berechnet wird.

Die Ursache war einfach: Die beiden Analysen hatten zwei verschiedene Modelle erfasst. Die erste war Groq (Llama 3.3 70B), die zweite Gemini 2.5 Flash — oder umgekehrt. Der Benutzer wusste es nicht, da das Ergebnis dies nicht erklärte.


Die Architektur vor dem Fix: Groq primär, Gemini Fallback

Bis zum 22. Juli funktionierte Lagotto Meter so:

Groq Llama 3.3 70B → PRIMÄR (kostenlos, beantwortet 95% der Anfragen)
│ bei Fehler/Quota →
Gemini 2.5 Flash → FALLBACK (kostenpflichtig, interveniert selten)

Die Logik war wirtschaftlich: Groq hat eine großzügige kostenlose Stufe und bewältigte nahezu die gesamte Last. Gemini kam nur zum Einsatz, wenn Groq seine täglichen Token erschöpfte.

Das Problem war doppelt.

Erstes: Die beiden Modelle sind in Bezug auf semantische Konsistenz nicht äquivalent. Llama 3.3 70B und Gemini 2.5 Flash haben unterschiediche Architekturen, unterschiedliche Trainingsdaten und unterschiedliche Alignments-Philosophien. Bei einer semantischen Bewertungsaufgabe kann die Abweichung zwischen den beiden bis ±15 Punkte von den verfügbaren 30 erreichen. Die technische Punktzahl ist deterministisch — sie wird von Python-Code berechnet, nicht vom Modell. Aber die semantische Konsistenz ist generativ, und hier divergieren die Modelle.

Zweites: Es gab einen Fehler im Code. Der an Gemini gesendete Payload war der reduzierte für Groq (etwa 12.000 Token), nicht der vollständige. Gemini hat ein Kontextfenster von 1 Million Token und kann ganze Dateien empfangen — aber user_content_gemini wurde erstellt, aber nie verwendet. Der Fallback von Gemini arbeitete mit weniger Informationen, als er hätte haben können.


Der Fix: Umkehrung der Architektur

Die Korrektur hat die Hierarchie umgekehrt und den Payload-Bug behoben:

Gemini 2.5 Flash → PRIMÄR (temp 0.3, erhält vollständige Dateien ~125k char)
│ bei Fehler/Quota →
Groq Llama 3.3 70B → FALLBACK (temp 0.3, erhält reduzierte Payload ~12k Token)

Gemini 2.5 Flash ist nun das Modell, das unter normalen Bedingungen auf jede Analyse antwortet. Groq wird das Sicherheitsnetz, wenn Gemini sein tägliches Kontingent erschöpft.

Die Temperaturen sind für beide identisch: 0.3. Wir haben sie nicht geändert — wir haben sie nur deklariert.


Die Transparenz: Was sieht der Benutzer jetzt

Das ursprüngliche Problem war nicht nur technisch — es war kommunikativ. Der Benutzer, der zwei unterschiedliche Punktzahlen erhielt, hatte keine Möglichkeit zu verstehen, warum.

Wir haben drei Transparenzebenen hinzugefügt.

Im Ergebnis und in der E-Mail ist die Modellzeile jetzt explizit:

Wenn Gemini antwortet (Normalfall):

Modell: gemini-2.5-flash (primär) | Temperatur: 0.3 — lake8.dev Lagotto Meter v1.0

Wenn Groq antwortet (Fallback):

Modell: llama-3.3-70b-versatile via Groq (Fallback) | Temperatur: 0.3 — lake8.dev Lagotto Meter v1.0

Im Falle eines Groq-Fallbacks erscheint zwischen der Modellzeile und den technischen Punkten ein expliziter Warnblock:

--- MODELLNOTIZ ---
⚠ Analyse wurde im Fallbackmodus (Groq — Token Gemini erschöpft) durchgeführt.
Die 30 Punkte der semantischen Konsistenz können um bis zu ±15 Punkte divergieren
im Vergleich zu einer Analyse von Gemini 2.5 Flash (Primärmodell).
Die technischen Punktzahlen sind deterministisch und unverändert,
unabhängig vom Modell. Für maximale Zuverlässigkeit des semantischen Scores wiederholen Sie
die Analyse, wenn der Hauptdienst verfügbar ist.

Auf der Lagotto Meter-Seite beschreibt der Bereich Methodik ausdrücklich die beiden Modelle, die Temperaturen und was sich zwischen Primär- und Fallback ändert. Das Frontend zeigt die Modellzeile immer sichtbar und ein orangefarbenes Warnfeld nur, wenn Groq antwortet.


Warum die Modelle bei der semantischen Konsistenz divergieren

Es ist wertvoll zu erklären, da es kein Fehler ist — es ist eine intrinsische Eigenschaft jedes Systems, das LLM für Bewertungszwecke verwendet.

Die semantische Konsistenz misst, wie gut die vom Agenten wahrgenommene Nachricht mit der vom Standort erklärten Nachricht übereinstimmt. Es ist eine generative Aufgabe: Das Modell liest die Dateien der Website, erstellt eine Darstellung der “wahrgenommenen Nachricht” und bewertet die Distanz zur “erklärten Nachricht”.

Zwei verschiedene Modelle erstellen unterschiedliche Darstellungen desselben Textes. Nicht, weil eines falsch und das andere richtig ist — sondern weil sie gelernt haben, die Welt mit unterschiedlichen Gewichten zu lesen. Llama 3.3 70B und Gemini 2.5 Flash wurden auf unterschiedlichen Korpora trainiert, mit unterschiedlichen Architekturen und teilweise unterschiedlichen Optimierungszielen.

Die technischen Punktzahlen haben dieses Problem nicht: llms.txt existiert oder existiert nicht, robots.txt hat oder hat keine AI-Richtlinien, JSON-LD ist gültig oder nicht. Es sind binäre Überprüfungen oder Zählungen, die von Python-Code ausgeführt werden, unabhängig vom Sprachmodell.

Die semantische Konsistenz ist anders. Es ist die einzige Komponente, bei der das Modell ein interpretatives Urteil ausdrückt. Es ist auch die informativste Komponente — verlangt jedoch, dass das verwendete Modell ausdrücklich deklariert wird, für…

Quellen

Autor: Giantommaso Fogli
Veröffentlichungsdatum: 2026-07-22

Rechte und Quellenangaben

Bilder, Logos und Fotografien sind Eigentum ihrer jeweiligen Inhaber. Verwendet für Kommentarzwecke.


← Back to journal