Ingenieur für angewandte KI · Forscher

Akshat Gupta

Ich entwickle Machine-Learning-Systeme und verbringe viel Zeit damit herauszufinden, wo sie scheitern.

Aktuell geht es dabei um agentenbasierte KI und Dokumentenintelligenz für Finanz- und Versicherungsanwendungen: Systeme, die uneinheitliche, wichtige Dokumente lesen, ihre Antworten belegen und einer Prüfung standhalten müssen. Mein Alltag reicht vom Lesen wissenschaftlicher Arbeiten über den Entwurf von Evaluationen bis zur Entwicklung produktiver Software.

Vor der Arbeit mit LLMs habe ich mich mit NLP, Sprachverarbeitung, Computer Vision und adversarialem Machine Learning beschäftigt. Ich habe Computerlinguistik an der Universität Stuttgart studiert und arbeite seit 2018 mit Machine Learning.

Porträt von Akshat Gupta
Stuttgart, Deutschland

Drei Projekte zeigen, wie ich arbeite: ein produktives System, eine veröffentlichte Forschungsarbeit und ein noch offenes Experiment.

KI-Systeme für dokumentenintensive Workflows

Finanz- und Versicherungsdokumente sind lang, uneinheitlich und Fehler können teuer werden. Ich entwickle Pipelines, die sie mit OCR, Retrieval, spezialisierten Agenten und Validierung verarbeiten und strukturierte Ergebnisse liefern, die Menschen prüfen können. Die schwierigen Fragen betreffen oft nicht das Modell selbst, sondern die Belege und den richtigen Zeitpunkt für eine Übergabe an Menschen.

Mehr zur Berufserfahrung →

  • Agentic AI
  • Azure OpenAI
  • OCR
  • Evaluation

GlyphNet

Phishing-Domains können wie vertrauenswürdige Websites aussehen: Bei paypa1.com ersetzt etwa eine Ziffer das L. GlyphNet rendert Domainnamen als Bilder und erkennt solche visuellen Täuschungen mit einem aufmerksamkeitsbasierten CNN. Das Paper berichtet eine AUC von 0,93 auf 4 Mio. Bildern; die separat gerenderte öffentliche Version umfasst 1,29 Mio. Domainpaare.

Projektwebsite ↗Paper ↗Code ↗Datensatz ↗

AUC im Paper
0,93
Datensatz im Paper
4 Mio. Bilder

SpeakerDiff

Eine offene Frage: Können Diffusionsmodelle Sprecher-Embeddings erzeugen, die eine Stimme anonymisieren, ohne ihre Qualität zu zerstören? SpeakerDiff ist ein Prototyp dafür, keine abschließende Antwort. Der Datenschutz muss im vollständigen Konvertierungssystem evaluiert werden; Code und Experimente sind öffentlich.

Code und Experimente ↗

  • Diffusionsmodelle
  • Sprache
  • Datenschutz

Zwei Datensätze, die ich veröffentlicht habe, damit andere sie nicht erneut erstellen müssen.

Arbeitsnotizen zu Dingen, die ich lerne, Systemen, die ich entwickle, und offenen Fragen. Die Fachartikel sind derzeit auf Englisch verfügbar.

Alle Artikel →
AI Engineer · additiv

Agentenbasierte KI, Dokumentenintelligenz und Entscheidungssysteme für Finanz- und Versicherungsanwendungen.

Machine Learning Engineer · Validaitor

Modellrobustheit, adversariales ML, Sicherheit sowie Evaluation von Fairness, Bias und Toxizität.

Wissenschaftlicher Mitarbeiter · Universität Stuttgart

Zeitliche und geografische Repräsentationen für Sprachverstehen.

Machine Learning Engineer

NLP, maschinelle Übersetzung, biomedizinische NER, Sprachverarbeitung, Sprecherdiarisierung und multimodales Lernen.

Vollständige Berufserfahrung →

Außerhalb der Arbeit

Ich spiele Tischtennis und Schach und bin gern mit dem Rad in Stuttgart unterwegs.