מה זה Data Engineering? הסבר + משרות פתוחות בישראל
זמן קריאה: 6 דקות
מהנדס/ת נתונים בונה את התשתית שמביאה נתונים ממקורות שונים למקום אחד אמין שאפשר לשאול ממנו שאלות. התוצר אינו תובנה אלא צינור נתונים שעובד כל יום, בזמן ובלי לאבד רשומות. בלוח HiTakeJob פתוחות כרגע 27 משרות שמזכירות Data Engineering, 25 Kafka, 22 Airflow ו-22 Spark.
מה הבעיה שהתפקיד הזה פותר
בארגון טיפוסי הנתונים מפוזרים: מסד הנתונים של המוצר, מערכת ה-CRM, חשבון הפרסום, קובצי לוג וכלי תמיכה. כל אחד מהם במבנה אחר, עם הגדרות שונות לאותו מושג. השאלה "כמה לקוחות פעילים היו לנו ברבעון" יכולה לקבל שלוש תשובות שונות, כל אחת נכונה במערכת שלה.
מהנדס הנתונים בונה את השכבה שמיישבת את זה: אוספת, מנקה, מאחדת הגדרות, ומגישה טבלאות שאפשר לסמוך עליהן. בלי השכבה הזו, אנליסטים מבזבזים את רוב זמנם על איסוף ולא על ניתוח.
איך נראה pipeline נתונים בפועל
נניח צינור יומי שמזין דוח מכירות:
- מיצוי: שליפת נתונים ממסד הנתונים של המוצר ומ-API חיצוני, לרוב רק מה שהשתנה מאז אתמול.
- נחיתה: שמירת העותק הגולמי כפי שהתקבל, כדי שאפשר יהיה לחשב מחדש אם תתגלה שגיאה.
- טרנספורמציה: ניקוי, איחוד פורמטים של תאריכים ומטבעות, והחלת הגדרות עסקיות אחידות.
- טעינה: כתיבה לטבלאות במחסן הנתונים, במבנה שנוח לשאול ממנו.
- בדיקות איכות: האם מספר השורות סביר, האם יש ערכים חסרים בשדה קריטי, האם סכום מסתדר מול מקור אחר.
- תזמון והתראה: הרצה אוטומטית בשעה קבועה, וניסיון חוזר או התראה כשמשהו נכשל.
שני הסעיפים האחרונים הם מה שמפריד בין סקריפט לבין מערכת. צינור בלי בדיקות איכות יעביר בשקט נתונים שגויים לדוח שההנהלה מסתכלת עליו, וזו התקלה היקרה ביותר בתחום.
Data Engineer, Data Analyst או Data Scientist - מה ההבדל?
| Data Engineer | Data Analyst | Data Scientist | |
|---|---|---|---|
| השאלה המרכזית | איך הנתונים יגיעו אמינים | מה הנתונים אומרים | מה יקרה, ואיך לחזות זאת |
| תוצר | טבלאות וצינורות | דוחות ותובנות | מודלים וניסויים |
| כלים עיקריים | Python, SQL, Airflow, Spark | SQL, Excel, כלי BI | Python, סטטיסטיקה, ML |
| קרוב יותר ל | הנדסת תוכנה | הצד העסקי | מחקר |
בחברות קטנות אותו אדם עושה את שלושת התפקידים. ההשוואה המפורטת בין שני האחרונים נמצאת בData Analyst מול Data Scientist.
אילו כלים מופיעים במשרות Data Engineering בישראל
| כלי | משרות פעילות | לאיזה שלב הוא שייך |
|---|---|---|
| Python | 365 | כתיבת הצינורות והלוגיקה |
| SQL | 133 | טרנספורמציה ושאילתות - הכישור הבסיסי ביותר |
| Kafka | 25 | העברת אירועים בזמן אמת |
| Airflow | 22 | תזמון ותלויות בין משימות |
| Spark | 21 | עיבוד מבוזר של נפחים גדולים |
| BigQuery | 16 | מחסן נתונים בענן של גוגל |
| Snowflake | 13 | מחסן נתונים מנוהל |
| ETL | 14 | המונח עצמו, כשהוא מופיע במפורש |
הנקודה החשובה: SQL ו-Python מופיעים ביותר משרות מכל כלי ייעודי. מי שמתחיל צריך להשקיע בהם ולא במרדף אחרי הכלי החדש. אפשר לראות את המשרות במשרות Data Engineering וב27 משרות דאטה ואנליטיקה.
מה משתבש בצינורות נתונים - וכמה מזה נראה מיד
רוב התקלות בתחום שקטות, וזה מה שהופך אותן למסוכנות:
- שינוי סכימה במקור. צוות אחר הוסיף שדה או שינה שם, והצינור ממשיך לרוץ עם נתון חסר.
- כפילויות. ריצה חוזרת אחרי כשל מכניסה את אותן שורות פעמיים, והמספרים בדוח מנופחים.
- אזורי זמן. הצטברות יומית שמחושבת ב-UTC מול דוח שמוצג בשעון ישראל מייצרת פער קבוע שקשה לאתר.
- נתונים שמגיעים באיחור. אירוע שנרשם היום אך שייך לאתמול - אם הצינור לא מטפל בזה, אתמול יישאר שגוי לנצח.
- עלות. שאילתה לא יעילה על מחסן נתונים בענן יכולה לעלות סכומים משמעותיים בכל ריצה.
מכאן נובע העיקרון המרכזי בתחום: צינור צריך להיות ניתן להרצה חוזרת בלי נזק. כלומר, הרצה של אותו יום פעמיים חייבת להוביל לאותה תוצאה בדיוק.
איך נכנסים לתפקיד Data Engineer
זהו לרוב לא תפקיד ראשון, כי הוא דורש גם תכנות וגם הבנת נתונים. שלושה מסלולי כניסה שעובדים:
- מ-Backend: הדרך הקצרה ביותר - יש כבר קוד, SQL ומערכות; מוסיפים כלי תזמון ועיבוד.
- מאנליסט: יש כבר SQL והבנת המשמעות העסקית; צריך להוסיף תכנות ברמה הנדסית ובקרת גרסאות.
- מ-DBA או מערכות מידע: יש היכרות עמוקה עם מסדי נתונים; מוסיפים ענן ו-Python.
המסלול המלא, כולל סדר הלמידה והפרויקטים שכדאי לבנות, נמצא בקריירה כ-Data Engineer, ושאלות הראיון בשאלות ראיון Data Engineer.
למה איכות נתונים היא חלק מהתפקיד ולא תוספת
ההבדל בין צינור לבין מערכת נתונים הוא שכבת הבדיקות. בדיקה טובה היא לא "האם התהליך רץ" אלא "האם התוצאה סבירה": האם מספר השורות בטווח המצופה, האם שדה מזהה ייחודי באמת ייחודי, האם סכום ההכנסות תואם למקור שני, והאם הנתון האחרון עדכני. צינור שרץ בהצלחה ומעביר טבלה ריקה הוא הכשל המסוכן ביותר, כי הוא לא מדליק שום נורה אדומה עד שמישהו שם לב שהדוח נראה מוזר - לרוב שבועות מאוחר מדי.
מה בודקים בראיון ל-Data Engineer
הראיונות בתחום בנויים כמעט תמיד משלושה חלקים, ולכל אחד יש כשל אופייני:
- SQL מתקדם: פונקציות חלון, דה-דופליקציה, חישוב שימור לפי חודש. הכישלון הנפוץ הוא שאילתה שנותנת תוצאה נכונה על דוגמה קטנה ומכפילה שורות על נתונים אמיתיים.
- תכנון צינור: "איך היית מביא נתונים מ-API שמוגבל בקצב". מחפשים טיפול בכשל, עמידות להרצה חוזרת וטעינה מצטברת - לא את הקוד המהיר ביותר.
- מודל נתונים: תכנון טבלאות לשאלה עסקית נתונה, כולל מה שומרים גולמי ומה מחשבים מראש.
שאלה שכמעט תמיד מגיעה בסוף היא "מה עשית כשגילית שנתון בדוח היה שגוי שבועיים". התשובה הטובה כוללת גם תיקון היסטורי וגם בדיקה שמונעת הישנות - לא רק תיקון נקודתי.
שאלות נפוצות
צריך לדעת Spark כדי להיכנס לתחום?
לא כתנאי כניסה. Spark מופיע ב-21 משרות ורלוונטי בעיקר לנפחים גדולים; SQL מופיע ב-133 ו-Python ב-365. עדיף להגיע עם שליטה חזקה בשניים האלה ולהכיר את Spark ברמת מושגים, מאשר להפך.
מה ההבדל בין ETL ל-ELT?
ב-ETL הנתונים עוברים טרנספורמציה לפני הטעינה למחסן; ב-ELT הם נטענים גולמיים והטרנספורמציה קורית בתוך המחסן, בעזרת כוח החישוב שלו. הגישה השנייה נפוצה יותר היום עם מחסנים בענן.
האם Data Engineer צריך להבין את התחום העסקי?
כן, יותר משנדמה. הגדרה של "משתמש פעיל" או "עסקה שהושלמה" היא החלטה עסקית שנצרבת בקוד הצינור. מהנדס שמממש אותה בלי להבין אותה מייצר טבלה שנראית תקינה ומחזירה תשובות שגויות.
כמה משרות Data Engineering פתוחות בישראל?
בלוח שלנו 27 משרות מזכירות Data Engineering במפורש, מתוך 1,952 משרות פעילות, ועוד עשרות מזכירות את הכלים - 25 Kafka, 22 Airflow ו-22 Spark. קטגוריית הדאטה כולה מונה 35 משרות פתוחות.
כמה חשוב ניסיון בענן לתפקיד הזה?
מאוד. כמעט כל תשתית נתונים חדשה בישראל יושבת על ענן ציבורי - 123 משרות פעילות מזכירות AWS ו-42 מזכירות GCP. מה שחשוב הוא להבין את שירותי האחסון והחישוב ואת מודל התמחור שלהם, לא לשנן שמות שירותים.
מה ההבדל בין Data Engineer ל-Analytics Engineer?
מהנדס נתונים אחראי על הבאת הנתונים ועל התשתית; Analytics Engineer יושב שכבה מעל ובונה את המודלים והטבלאות שהאנליסטים צורכים, לרוב ב-SQL. התפקיד השני חדש יחסית בישראל ומתאים למעבר מאנליסט.