Alle Projekte 
ST-01502
Cloud Platform Engineer (Automation) (mwd)
Aufgabenbeschreibung
Ziel der Rolle ist es, intelligente Agenten und Automatisierungslösungen nicht nur prototypisch zu entwickeln, sondern sicher und skalierbar in Produktion zu bringen. Die Rolle verbindet AI Engineering, Data Engineering und Cloud Architecture. Gemeinsam mit einem crossfunktionalen Team werden auf Databricks und Azure Lösungen entwickelt, die Daten, Large Language Models und interne Systeme miteinander verbinden.
Zu den Aufgaben gehören insbesondere:
- Konzeption und Entwicklung produktiver Agentic-AI-Lösungen auf Databricks und Azure – vom ersten Prototyp bis zum skalierbaren Betrieb
- Entwicklung von KI-Agenten und Multi-Agent-Workflows, die Large Language Models, Unternehmensdaten, APIs und interne Systeme sicher miteinander verbinden
- Umsetzung von RAG-, Tool-Calling- und Workflow-Architekturen sowie Entwicklung wiederverwendbarer Komponenten für Prompts, Tools, Agenten und Datenzugriffe
- Integration von Azure OpenAI und weiteren geeigneten Foundation Models in die Databricks-Plattform sowie in bestehende Applikations- und Datenlandschaften
- Entwicklung von Daten- und Verarbeitungspipelines auf Databricks, unter anderem mit Python, SQL, Spark und Delta Lake, als verlässliche Datenbasis für KI-Anwendungen
- Nutzung von Databricks Mosaic AI und MLflow zur Entwicklung, Versionierung, Evaluierung, Bereitstellung und Überwachung von Modellen, Prompts und Agenten
- Automatisierung daten- und KI-gestützter Prozesse mit Databricks Workflows sowie deren Integration in bestehende Unternehmensprozesse und Systemlandschaften
- Gestaltung der erforderlichen Azure- und Databricks-Architektur für einen sicheren, skalierbaren und kosteneffizienten Betrieb
- Etablierung von CI/CD- und MLOps-Prozessen für Datenpipelines, Modelle und Agenten, einschließlich automatisierter Tests, Deployment-Pipelines, Infrastructure as Code und Versionierung relevanter Artefakte
- Entwicklung von Qualitäts- und Evaluationsverfahren für KI-Anwendungen, beispielsweise für Antwortqualität, Groundedness, Sicherheit, Latenz, Kosten und Zuverlässigkeit
- Sicherstellung eines sicheren und nachvollziehbaren Betriebs durch Unity Catalog, Secrets Management, Managed Identities, RBAC, Private Endpoints, Logging und Monitoring
- Sichere Anbindung interner Datenquellen, Systeme und APIs sowie Unterstützung der Fachbereiche bei der technischen Umsetzung konkreter AI- und Automatisierungs-Use-Cases
- Enge Zusammenarbeit mit Product Ownern, Fachbereichen, Data- und Cloud-Teams sowie Security, Privacy und Governance; aktive Einbringung der technischen Perspektive in Architekturentscheidungen
- Dokumentation von Architekturen, Datenflüssen, Agentenlogik, Betriebsprozessen und Security Controls, sodass eine nachhaltige Übergabe in den produktiven Betrieb möglich ist.
Profilanforderungen
- Mehrjährige Erfahrung als AI-, ML-, Data- oder Cloud Engineer bzw. vergleichbare technische Rolle
- Praxis in LLM-Entwicklung, ideal mit RAG, Embeddings, Vector Search, Tool Calling, Agentic AI
- Sehr gute Python-/SQL-Kenntnisse; Git, automatisierte Tests, Code Reviews, modulare Entwicklung
- Fundierte Databricks-Erfahrung, z.B. Spark, Delta Lake, Workflows, Unity Catalog, MLflow, Mosaic AI
- Gute Azure-Kenntnisse, v. a. OpenAI, Managed Identities, Key Vault, Storage, Networking, Monitoring
- Produktive Integration: APIs, Datenquellen, Unternehmenssysteme; verteilte/eventbasierte Architektur
- Praxis in CI/CD, MLOps, Infrastructure as Code, z. B. GitHub Actions/Azure DevOps, Terraform/Bicep
- Solide in Cloud Security, Datenschutz, AI Governance: Rechte, Datenklassifizierung, Modellzugriffe
- Monitoring produktiver KI-Lösungen; systematische Bewertung von Prompt-, Retrieval-, Agentenqualität
- Übersetzung fachlicher Anforderungen in robuste, wartbare und skalierbare technische Lösungen
- Interdisziplinäre Zusammenarbeit, Eigenverantwortung, verständliche Vermittlung komplexer Technik
Nice to Have
- Gängige Agenten-/LLM-Frameworks, strukturierte Ausgaben, Guardrails, Human-in-the-Loop-Prozesse
- Kenntnisse in Docker, Kubernetes und im Betrieb containerisierter KI-Anwendungen und APIs
- Erfahrung mit Event Streaming, z. B. Azure Event Hubs oder Apache Kafka
- Verständnis für Kosten-, Latenz- und Skalierungsoptimierung LLM-basierter Anwendungen
- Erfahrung in regulierten oder datenschutzsensiblen Unternehmensumfeldern