[zdalnie] Senior Data Engineer LLM & RAG
🚀 Rozwijamy nasz zespół AI Data Engineering w DS STREAM!
Poszukujemy Senior Data Engineera, który dołączy do naszego zespołu i będzie rozwijał nowoczesne rozwiązania chmurowe zasilające systemy Generative AI, duże modele językowe (LLM) oraz architektury RAG (Retrieval-Augmented Generation).
📍 Praca w 100% zdalna na terenie Polski (z możliwością korzystania z biura w Warszawie).
O projekcie Dołączysz do projektu budującego zaawansowany ekosystem danych w środowisku multicloud (Azure oraz GCP), który stanowi fundament dla produkcyjnych wdrożeń LLM/RAG i wyszukiwania kontekstowego.
Środowisko wykorzystuje m.in. Azure Databricks, GCP Vertex AI (Vector Search), Unity Catalog, Spark Structured Streaming oraz Databricks, zapewniając wysoką wydajność, bezpieczeństwo i skuteczne zarządzanie danymi. Architektura rozwiązania oparta jest na modelu Medallion Architecture, połączonym z nowoczesnym przetwarzaniem danych niestrukturyzowanych (chunking, embeddingi) oraz orkiestracją LLM (LangChain / LlamaIndex).
[zdalnie] Senior Data Engineer LLM & RAG
🚀 Rozwijamy nasz zespół AI Data Engineering w DS STREAM!
Poszukujemy Senior Data Engineera, który dołączy do naszego zespołu i będzie rozwijał nowoczesne rozwiązania chmurowe zasilające systemy Generative AI, duże modele językowe (LLM) oraz architektury RAG (Retrieval-Augmented Generation).
📍 Praca w 100% zdalna na terenie Polski (z możliwością korzystania z biura w Warszawie).
O projekcie Dołączysz do projektu budującego zaawansowany ekosystem danych w środowisku multicloud (Azure oraz GCP), który stanowi fundament dla produkcyjnych wdrożeń LLM/RAG i wyszukiwania kontekstowego.
Środowisko wykorzystuje m.in. Azure Databricks, GCP Vertex AI (Vector Search), Unity Catalog, Spark Structured Streaming oraz Databricks, zapewniając wysoką wydajność, bezpieczeństwo i skuteczne zarządzanie danymi. Architektura rozwiązania oparta jest na modelu Medallion Architecture, połączonym z nowoczesnym przetwarzaniem danych niestrukturyzowanych (chunking, embeddingi) oraz orkiestracją LLM (LangChain / LlamaIndex).
,[Rozwój platformy danych: Rozwój oprogramowania do wydajnego przetwarzania dużych wolumenów danych, zasilających zarówno procesy analityczne, jak i modele AI., Databricks & Spark: Projektowanie oraz rozwój pipeline'ów danych w Databricks z wykorzystaniem PySpark i SQL., Streaming Data: Tworzenie i utrzymywanie pipeline'ów opartych na Spark Structured Streaming., Zarządzanie i Architektura: Projektowanie oraz zarządzanie obiektami w Unity Catalog zgodnie z założeniami Medallion Architecture (Bronze, Silver, Gold)., Integracja systemów: Integracja i optymalne pobieranie danych z różnorodnych interfejsów API, w tym przygotowywanie danych pochodzących z systemów zewnętrznych pod kątem AI., Zasilanie systemów LLM/RAG: Tworzenie procesów ETL/ELT wspierających ekstrakcję, czyszczenie, podział tekstu (chunking) i embeddowanie danych do wektorowych baz danych w chmurze (Azure AI Search / GCP Vertex AI).] Requirements: Python, Docker, SQL, Databricks, PySpark, CI/CD, Spark, GCP, Airflow, BigQuery, API, FastAPI, Azure Databricks, Azure, Kubernetes Tools: Agile, Scrum. Additionally: Remote work, Competitive compensation, Sport subscription, Training budget, Private healthcare, Flat structure, Small teams, International projects, Free coffee, Bike parking, In-house trainings, In-house hack days, Modern office, Startup atmosphere, No dress code, Free beverages.
Data Engineer @ DS STREAM • Poznań, Poland