Talent.com
DS STREAM
Data Engineer @ DS STREAMDS STREAM • Warsaw, Poland
Data Engineer @ DS STREAM

Data Engineer @ DS STREAM

DS STREAM • Warsaw, Poland
21 dni temu
Opis pracy

[zdalnie] Senior Data Engineer LLM & RAG

🚀 Rozwijamy nasz zespół AI Data Engineering w DS STREAM!

Poszukujemy Senior Data Engineera, który dołączy do naszego zespołu i będzie rozwijał nowoczesne rozwiązania chmurowe zasilające systemy Generative AI, duże modele językowe (LLM) oraz architektury RAG (Retrieval-Augmented Generation).

📍 Praca w 100% zdalna na terenie Polski (z możliwością korzystania z biura w Warszawie).

O projekcie Dołączysz do projektu budującego zaawansowany ekosystem danych w środowisku multicloud (Azure oraz GCP), który stanowi fundament dla produkcyjnych wdrożeń LLM/RAG i wyszukiwania kontekstowego.

Środowisko wykorzystuje m.in. Azure Databricks, GCP Vertex AI (Vector Search), Unity Catalog, Spark Structured Streaming oraz Databricks, zapewniając wysoką wydajność, bezpieczeństwo i skuteczne zarządzanie danymi. Architektura rozwiązania oparta jest na modelu Medallion Architecture, połączonym z nowoczesnym przetwarzaniem danych niestrukturyzowanych (chunking, embeddingi) oraz orkiestracją LLM (LangChain / LlamaIndex).



Czego oczekujemy?

  • Python & SQL: Bardzo dobra, zaawansowana znajomość Pythona oraz SQL w kontekście budowania skalowalnych potoków danych.
  • Databricks & Spark: Min. 3 lata praktycznego doświadczenia w pracy z platformą Databricks, PySpark, Delta Lake oraz znajomość Unity Catalog i Databricks Asset Bundles.
  • Orkiestracja: Doświadczenie w tworzeniu i produkcyjnym utrzymaniu DAG-ów w Apache Airflow.
  • Doświadczenie Chmurowe (Azure / GCP): Praktyczna znajomość komponentów danych w Azure (Data Factory, Databricks, Blob/ADLS, AI Search) i/lub GCP (BigQuery, Cloud Composer, Vertex AI, Cloud Storage).
  • Streaming & API: Doświadczenie w integracji danych z interfejsów API oraz przetwarzania danych w czasie rzeczywistym (Spark Structured Streaming).
  • LLM/RAG Znajomość architektur LLM/RAG, technik podziału dokumentów (chunking), pracy z embeddings oraz bazami wektorowymi.
  • Inżynieria Oprogramowania: Znajomość Git, Docker, CI/CD oraz narzędzi IaC (Terraform).

Mile widziane

  • Certyfikaty: Databricks Certified Data Engineer Senior/Associate, Azure Data Engineer Associate (DP-203) lub Google Cloud Professional Data Engineer.

[zdalnie] Senior Data Engineer LLM & RAG

🚀 Rozwijamy nasz zespół AI Data Engineering w DS STREAM!

Poszukujemy Senior Data Engineera, który dołączy do naszego zespołu i będzie rozwijał nowoczesne rozwiązania chmurowe zasilające systemy Generative AI, duże modele językowe (LLM) oraz architektury RAG (Retrieval-Augmented Generation).

📍 Praca w 100% zdalna na terenie Polski (z możliwością korzystania z biura w Warszawie).

O projekcie Dołączysz do projektu budującego zaawansowany ekosystem danych w środowisku multicloud (Azure oraz GCP), który stanowi fundament dla produkcyjnych wdrożeń LLM/RAG i wyszukiwania kontekstowego.

Środowisko wykorzystuje m.in. Azure Databricks, GCP Vertex AI (Vector Search), Unity Catalog, Spark Structured Streaming oraz Databricks, zapewniając wysoką wydajność, bezpieczeństwo i skuteczne zarządzanie danymi. Architektura rozwiązania oparta jest na modelu Medallion Architecture, połączonym z nowoczesnym przetwarzaniem danych niestrukturyzowanych (chunking, embeddingi) oraz orkiestracją LLM (LangChain / LlamaIndex).


,[Rozwój platformy danych: Rozwój oprogramowania do wydajnego przetwarzania dużych wolumenów danych, zasilających zarówno procesy analityczne, jak i modele AI., Databricks & Spark: Projektowanie oraz rozwój pipeline'ów danych w Databricks z wykorzystaniem PySpark i SQL., Streaming Data: Tworzenie i utrzymywanie pipeline'ów opartych na Spark Structured Streaming., Zarządzanie i Architektura: Projektowanie oraz zarządzanie obiektami w Unity Catalog zgodnie z założeniami Medallion Architecture (Bronze, Silver, Gold)., Integracja systemów: Integracja i optymalne pobieranie danych z różnorodnych interfejsów API, w tym przygotowywanie danych pochodzących z systemów zewnętrznych pod kątem AI., Zasilanie systemów LLM/RAG: Tworzenie procesów ETL/ELT wspierających ekstrakcję, czyszczenie, podział tekstu (chunking) i embeddowanie danych do wektorowych baz danych w chmurze (Azure AI Search / GCP Vertex AI).] Requirements: Python, Docker, SQL, Databricks, PySpark, CI/CD, Spark, GCP, Airflow, BigQuery, API, FastAPI, Azure Databricks, Azure, Kubernetes Tools: Agile, Scrum. Additionally: Remote work, Competitive compensation, Sport subscription, Training budget, Private healthcare, Flat structure, Small teams, International projects, Free coffee, Bike parking, In-house trainings, In-house hack days, Modern office, Startup atmosphere, No dress code, Free beverages.

Utwórz powiadomienie o ofertach pracy dla tego wyszukiwania

Data Engineer @ DS STREAM • Warsaw, Poland

Podobne stanowiska

Data Engineer

SCALOWarszawa, PL

W Scalo zajmujemy się dostarczaniem projektów softwareowych i wspieraniem naszych partnerów w rozwijaniu ich biznesu.Tworzymy oprogramowanie, które umożliwia ludziom dokonywanie zmian, działanie w ... Pokaż więcej

 • Promowane

Data Engineer

Talan Groupwarszawa, Polska

Talan is an international consulting group specializing in innovation and business transformation through technology.With over 7,200 consultants in 21 countries and a turnover of €850M, we are comm... Pokaż więcej

 • Promowane

Lead Data Engineer

InnoboWarsaw, Masovian Voivodeship, PL

For our Client we are looking for.Are you ready to lead transformative initiatives in data engineering? This position offers the opportunity to drive innovation and optimization in the development ... Pokaż więcej

Data Engineer - Warsaw

Vantage PointWarsaw, Masovian Voivodeship, Poland

This role combines expertise in.You will architect data pipelines, enforce governance standards, and build tools for extracting and processing data from diverse sources, including websites and exte... Pokaż więcej