Neue Agent-Skills für Coding-Agenten verfügbar →
KI Engineering

KI produktiv.

Maßgeschneiderte KI-Systeme für Unternehmen: LLM-Integration, RAG und autonome Agenten, lokal und on-premise betrieben. Ihre Daten bleiben, wo sie sind. Ihre Agenten arbeiten bei Ihnen.

Im Einsatz bei

Leistungen & Ablauf.

KI-Systeme, die in Ihre bestehenden Prozesse passen und produktionsreif laufen — in vier Schritten vom Use Case bis zum produktiven Betrieb.

01

Maßgeschneiderte KI-Workflows

Wir bauen KI-Systeme um Ihre Prozesse herum, nicht andersherum. Vom Use Case bis zur produktiven Pipeline.

02

Produktionsreife Architektur

KI-Pipelines mit Modell-Serving, Monitoring und definierten SLAs. Gebaut für den Dauereinsatz, nicht nur für die Demo.

03

Ihr Lernen bleibt im Haus

On-premise und DSGVO-konform. Und mehr als das: Was Ihre Leute und Prozesse lernen, fließt in Ihre eigenen Systeme zurück. Nicht in das Modell eines Drittanbieters.

04

Agentic Tooling für Dev-Teams

Wir bringen KI-Coding-Agenten in Ihren Entwicklungsalltag: Skills, Extensions und AGENTS.md-Workflows, abgestimmt auf Ihre Codebasis und Prozesse. Grundlage ist skale-skills, unser offenes Pi-Paket.

  1. 1

    Analyse

    Use Cases, Datenlage und Prozesse verstehen. Wir prüfen, ob KI das Problem wirklich löst.

  2. 2

    Prototyp

    Ein MVP mit Ihren echten Daten. Schnell validierbar, bevor teure Infrastruktur entsteht.

  3. 3

    Integration

    Anbindung an bestehende Systeme. Produktionssicher, dokumentiert, mit Monitoring.

  4. 4

    Betrieb & Lern-Loop

    Wartung und Updates inklusive kontinuierlichem Besserwerden: Was im Einsatz auffällt, fließt als Verbesserung zurück. Das System wird mit der Zeit wertvoller, nicht älter.

Alles im Detail auf der SeiteKI Engineering: Leistungen, Technologie und Projektablauf.

Aus der Praxis.

Konkrete Probleme, konkrete Modelle. Zwei Beispiele aus laufenden Implementierungen.

Rechnungserkennung

Rechnungen automatisch strukturieren

Mehrseitige Rechnungen werden gescannt, verstanden und in ein standardisiertes Format überführt. Vollständig lokal, ohne dass Daten das Unternehmen verlassen.

  • Qwen 3.6 35B (lokal)
  • Vision-Layout-Erkennung
  • Strukturierte JSON-Ausgabe
  • On-premise Infrastruktur
Schwierige Dokumente

Auch dort, wo OCR versagt

Formulare, handschriftliche Notizen, eingescannte Akten. Die KI erkennt den Inhalt auch bei schlechter Qualität und liefert strukturierte Daten aus Chaos.

  • Multimodale Dokumentenanalyse
  • Handschriftenerkennung (HTR)
  • Semantische Extraktion
  • Workflow-Integration

Agentic Coding.

Agentic Engineering ist unser Kern: Wir entwickeln Skills und Extensions für Coding-Agenten und bringen sie in Ihren Entwicklungsalltag. Was dabei entsteht, fließt in ein offenes Paket zurück.

Stackpi pi.devHerdr herdr.devder Coding-Agent und die Runtime, auf der er läuft
Agentic Visual SkillsBewege den Zeiger über das Feld — die Figur antwortet.

Visualisierungs-Skills: diese Hairline-Figur — Kernel:hairline (MIT, © Lucas Marques) — und visualize, das aus einer Anfrage eine self-contained HTML mit teilbarer URL baut.

Entwicklung

Skill- & Extension-Entwicklung

Eigene Skills und pi-Extensions für Ihren Agenten-Stack, abgestimmt auf Codebasis und Prozesse. Beispiel: unser offenes Paket

  • Skill-EntwicklungSKILL.md nach agentskills.io-Format
  • Extension-Entwicklungpi-Extensions mit TypeBox-Schema
devskale/skale-skills
pi install git:github.com/devskale/skale-skills
Alle Guides und Details
  • fetch-urlpiLesbaren Text von jeder Webseite holen: Artikel, Docs, Reddit, GitHub, StackOverflow.
  • web-searchpiWebsuche über SearXNG und Duck API. Bilder, News, Videos. Funktioniert ohne Konfiguration.
  • surfpiDein echtes, eingeloggtes Chrome auf macOS steuern: scrapen, klicken, ausfüllen, Screenshots. Ohne Daemon, ohne Debug-Port.
  • impeccable.agentsDesign-Skill: Frontend-UI formen, kritisieren, härten und polieren, mit Anti-Pattern-Detektor. Cross-Harness.
  • improve-architecture.agents/skillsArchitektur-Review-Familie: Deepening-Chancen scannen, HTML-Report, Grill-Durchgang. Installiert 7 Skills (inkl. batch-grill-me) nach .agents/skills/. Von @mattpocock.
  • implement.agents/skillsArbeit aus Spec oder Tickets umsetzen: TDD an den Nähten, Typecheck unterwegs, /code-review am Ende. Installiert implement + tdd + code-review. Von @mattpocock.
  • visualizeJedes Thema als EINE eigenständige HTML-Seite — House-Skin mit 4 Flavors, parallele Quality-Gates, AI-Slop-Lint (fail-closed), stabile Share-URLs (Re-Share editiert in place).
  • webpiDas Web-Recherche-Bundle: fetch-url, web-search und surf in einem Install.
Alle Skills ansehen 8 Skills, je ein Einzeiler-Install

Referenz für Skill-Design: die Familie von @mattpocock (improve-architecture, implement), in dieser Liste enthalten.

LoL — das Leaderboard der Leaderboards.

Modelle sind austauschbar. Was zählt, ist zu wissen, welches Board die Wahrheit misst.

Die Top-Modelle jeder Kategorie — Intelligenz, Terminal-Agents, Decision-Modelle, Speech-to-Text — aus den Boards, die wir selbst für Modellwahl und Architekturempfehlungen heranziehen.

#ModellLLM-IntelligenzAA Intelligence Index v4.3.2
1Claude Opus 5.5 (max)Anthropic58
2Claude Sonnet 5.5 (max)Anthropic56
3Claude Opus 5.5 (high)Anthropic55
4Claude Fable 5.1 (max)Anthropic54
5GPT-6 Astra (max)OpenAI53
6Gemini 4 Argon (high)Google52
7GPT-6.1 Sol (max)OpenAI51
8Claude Opus 5.5 (medium)Anthropic50

Quelle: Artificial Analysis

Embedding-Modelle

MTEB (Overall)

MTEB Leaderboard (Hugging Face)
1Gemini Embedding 001Google68.3
2Qwen3-Embedding-8BAlibabaopen67.9
3NV-Embed-v2NVIDIAopen67.3
4Voyage-Large-2Voyage AI67.0
5Cohere Embed v4Cohere66.7
6text-embedding-3-largeOpenAI66.5
7BGE-Large-v2BAAIopen65.9

Terminal-Agents

Terminal-Bench 4.0

Terminal-Bench (via Artificial Analysis)
1Claude Sonnet 5.5Anthropic70.6
2Claude Opus 5.5Anthropic66.4
3Claude Mythos 5.1Anthropic60.9
4GPT-6 AstraOpenAI58.2
5Claude Fable 5.1Anthropic57.9
6Gemini 4 ArgonGoogle57.4
7GPT-6.1 SolOpenAI56.1
8Claude Opus 5Anthropic53.9
9Claude Fable 5Anthropic44.5
10GPT-6 SolOpenAI43.9
11GLM-5.3Z AIopenbestes Open-Weight-Modell41.8

Decision-Modelle

Requests

OpenRouter
1Jev 1.13typesafeopen+4 %981M
2Span-01 Literespanopen+9 %9.51M
3d1liquidopenneu3.53M
4GPT-6 Luna Decisionsopenaineu3.53M
5Clef Flashcloudflareopenneu3.46M
6Clefcloudflareopenneu2.7M
7Kev 4Bjaredpalmeropen+305 %2.45M
8Decider V1 27Bperplexityneu1.95M

Bildgenerierung

AA-Image-T2I v2.0 (Arena-Elo)

Artificial Analysis
1GPT Image 2.5 SunburstOpenAI1198
2GPT Image 2.5 FlareOpenAI1191
3GPT Image 2OpenAI1172
4Nano Banana 2.1Google1160
5Grok Imagine Image 2.0xAI1156
6MAI-Image-2.6Microsoft1151

Text-to-Speech

Speech Arena (Arena-Elo)

Artificial Analysis
1Eleven v4 TurboElevenLabs1332
2Eleven v4ElevenLabs1324
3Qwen-Audio-3.1-TTS-PlusAlibabaopen1295
4Sonic 3.6Cartesia1279
5Gemini 3.8 Flash TTSGoogle1276
6Qwen-Audio-3.0-TTS-PlusAlibabaopen1263

Speech-to-Text

AA-WER v2

Artificial Analysis
1StepAudio 3 ASRStepFunopen1.7 %
2Fun-Realtime-ASR-previewAlibabaopen1.7 %
3MAI-Transcribe-2Microsoft2.0 %
4Scribe v2ElevenLabs2.2 %
5Grok Voice Transcribe 2.0xAI2.3 %
6Universal-3 ProAssemblyAI3.1 %
7GPT TranscribeOpenAI3.3 %

Stand: 2026-10-08 · Täglich aktualisiert · Alle Boards im Detail →

Häufige Fragen.

Wie läuft das erste Gespräch ab?

Unverbindlich, etwa 30 Minuten. Wir klären, ob Ihr Use Case KI-tauglich ist und was es für eine Umsetzung braucht. Danach erhalten Sie eine ehrliche Einschätzung.

Bleiben meine Daten bei mir?

Ja. Wir realisieren on-premise oder lokal. Daten verlassen Ihr Unternehmen nur dann, wenn Sie es ausdrücklich wollen.

Brauche ich eine Cloud-Infrastruktur?

Nein. Wir betreiben KI auch auf eigener Hardware vor Ort. Cloud ist eine Option, kein Muss.

Welche Modelle setzen Sie ein?

Vorwiegend Open-Source-Modelle wie Qwen, Llama und spezialisierte Vision-Modelle. Die Auswahl hängt vom Use Case und Ihren Anforderungen ab.

Was kostet ein KI-Projekt?

Das hängt vom Umfang ab. Nach dem Erstgespräch erhalten Sie eine klare Einschätzung von Aufwand und Kosten, bevor Sie sich entscheiden.

On-premise oder Cloud: was passt zu uns?

Bei sensiblen Daten, regulatorischen Anforderungen oder hohen Abfragemengen lohnt sich on-premise: Die KI läuft auf eigener Hardware, Daten verlassen das Unternehmen nicht. Für maximale Intelligenz oder seltene Abfragen ist die Cloud die einfachere Wahl. Wir beraten ehrlich, was für Ihren Fall besser ist.

Lohnt sich KI für mein Unternehmen überhaupt?

Nicht für jedes Problem. Im Erstgespräch prüfen wir, ob Ihr Use Case tatsächlich von KI profitiert, oder ob eine einfachere Lösung schlauer ist. Wenn KI nicht das richtige Werkzeug ist, sagen wir das offen.

Können Sie Open-Source-Modelle wie Llama oder Qwen selbst hosten?

Ja. Wir hosten Open-Weight-Modelle wie Llama, Qwen, DeepSeek und GLM auf eigener Hardware, ohne Cloud-Abhängigkeit und ohne pro Token zu zahlen. Die Hardwarekosten stehen fest, die Abrechnung wird berechenbar.

Lass uns reden.

Unverbindliches Erstgespräch, 30 Minuten. Wir prüfen, ob KI Ihr Problem wirklich löst.

oder direkt an dev@skale.dev