HiTakeJobHiTakeJob

מה זה Big Data? הסבר פשוט + משרות פתוחות בישראל

זמן קריאה: 6 דקות

Big Data מתאר נתונים בנפח, בקצב או בגיוון שמחייבים לפצל את העיבוד בין מכונות רבות, כי מכונה אחת כבר לא מספיקה. זו הגדרה תפעולית ולא כמות קבועה. בלוח HiTakeJob פתוחות כרגע 25 משרות שמזכירות Kafka, 25 שמזכירות Spark ו-30 שמזכירות הנדסת נתונים.

מתי נתונים באמת נחשבים "גדולים"?

הסף אינו מספר טרה-בייטים אלא נקודה שבה הגישה הרגילה מפסיקה לעבוד. שלוש שאלות מעשיות שמגדירות זאת:

  • האם השאילתה עדיין מסתיימת בזמן סביר על מסד נתונים יחיד?
  • האם הנתונים נכנסים לזיכרון של מכונה חזקה אחת?
  • האם קצב ההגעה נמוך מקצב העיבוד, או שנוצר פיגור שמצטבר?

אם התשובה לכל השלוש חיובית - זה לא Big Data, וזה בסדר גמור. הטעות היקרה ביותר בתחום היא בניית ארכיטקטורה מבוזרת לנפח שטבלה יחידה ב-PostgreSQL הייתה מטפלת בו. מערכת מבוזרת מוסיפה מורכבות תפעולית שצריך להצדיק.

שלושת ה-V ומה באמת חשוב מהם

ממדמה הוא מתארמה זה מחייב
נפחכמות הנתונים המצטברתאחסון זול והפרדה בין אחסון לחישוב
קצבמהירות ההגעה של נתונים חדשיםמערכת זרימה במקום עיבוד יומי
גיווןמבנים שונים - טבלאות, לוגים, טקסט, תמונותאחסון גמיש וסכימה בקריאה

מבין השלושה, הקצב הוא זה שמשנה הכי הרבה בארכיטקטורה. מעבר מעיבוד יומי לזמן אמת אינו שדרוג של אותה מערכת אלא בנייה מחדש של רוב השרשרת.

עיבוד באצווה מול עיבוד בזרימה - מה ההבדל?

זו ההחלטה הראשונה בכל ארכיטקטורת נתונים, ויש לה השלכה ישירה על עלות ועל מורכבות:

אצווה (Batch)זרימה (Streaming)
מתי רץבזמנים קבועים - שעה, יוםברציפות, לפי אירועים
טיפוסי לדוחות, חישובי סיכוםזיהוי הונאה, התראות, המלצות חיות
כלי נפוץSpark, AirflowKafka
מורכבות תפעולבינונית - כשל מטופל בהרצה חוזרתגבוהה - אין "להריץ שוב את אתמול"

רוב הארגונים בישראל מריצים את שניהם: זרימה למה שחייב להיות מיידי, ואצווה לכל השאר. 25 משרות פעילות מזכירות Kafka - מספר שמלמד שעיבוד אירועים כבר אינו נחלת חברות ענק בלבד.

איפה הנתונים נשמרים - אגם, מחסן, או שניהם

שלוש הארכיטקטורות שמופיעות בפועל במשרות:

  • מחסן נתונים: נתונים מסודרים בטבלאות, מוכנים לשאילתות. מצוין לדיווח, פחות גמיש לנתונים לא מובנים.
  • אגם נתונים: אחסון זול של הכול במבנה המקורי, כולל לוגים, תמונות וטקסט. גמיש, אבל בלי משמעת הופך למה שמכונה "ביצת נתונים" - הכול בפנים ואיש לא מוצא כלום.
  • גישה משולבת: אחסון גולמי זול, ומעליו שכבת טבלאות שמתנהגת כמו מחסן. זו הגישה שהשתלטה על השוק בשנים האחרונות.

בין הכלים המנוהלים, BigQuery מופיע ב-16 משרות ו-Snowflake ב-13. הרחבנו על ההבדל במה זה מחסן נתונים ובמה זה Data Lake.

מה שמפספסים: העלות היא חלק מהארכיטקטורה

בעולם שבו האחסון והחישוב נמכרים לפי שימוש, החלטה טכנית היא מיד החלטה כספית. דוגמאות קונקרטיות שכל מי שעובד בתחום נתקל בהן:

  • שאילתה שסורקת טבלה שלמה במקום מחיצה אחת יכולה לעלות פי עשרות, על אותה תוצאה בדיוק.
  • דשבורד שמתרענן כל חמש דקות ואיש לא מסתכל עליו ממשיך לצבור עלות בכל שעה.
  • שמירת כל הלוגים לנצח היא ברירת מחדל נוחה שהופכת לסעיף תקציב משמעותי בתוך שנה.
  • חלוקה נכונה למחיצות לפי תאריך היא הטכניקה היחידה שחוסכת הכי הרבה בהכי מעט מאמץ.

בראיון לתפקיד בתחום, שאלה על עלות היא סימן טוב: היא מעידה שהצוות מפעיל מערכת אמיתית ולא רק בונה אותה. מהצד השני, מועמד שיודע לתאר החלטה שבה ויתר על רזולוציה או על טווח היסטורי כדי לחסוך עלות - ולהסביר מה נשקל מול מה - מדגים בדיוק את שיקול הדעת שמחפשים ברמות הבכירות.

מה זה אומר שעיבוד הוא מבוזר

הרעיון פשוט: מפצלים את הנתונים לחלקים, כל מכונה מעבדת חלק, ואז מאחדים. המחיר הוא שכל שלב שדורש להזיז נתונים בין מכונות - למשל צירוף טבלאות לפי מפתח - הופך ליקר, כי הוא כרוך בהעברה ברשת. מכאן נובעות הטעויות הקלאסיות: מפתח לא מאוזן שגורם למכונה אחת לקבל את רוב הנתונים בעוד השאר ממתינות, וצירוף של טבלת ענק עם טבלה קטנה בלי לנצל את העובדה שהקטנה נכנסת לזיכרון. מי שמבין את שתי הנקודות האלה כבר מבין את רוב מה שנשאל בראיון על עיבוד מבוזר.

הפרט הטכני שמשפיע הכי הרבה: פורמט האחסון

שאלה שנשמעת שולית - באיזה פורמט שומרים את הקבצים - קובעת בפועל את המהירות ואת העלות:

סוגאיך שומרמתי מתאים
לפי שורות (CSV, JSON)כל השדות של רשומה יחדקליטה גולמית, החלפת נתונים בין מערכות
לפי עמודותכל עמודה בנפרד, דחוסהאנליטיקה - קוראים שלוש עמודות מתוך מאה

ההבדל מעשי מאוד: שאילתה שמבקשת שתי עמודות מתוך טבלה רחבה תקרא בפורמט עמודי חלק זעיר מהנתונים, ובפורמט שורות תסרוק את הכול. יחד עם חלוקה למחיצות לפי תאריך, אלה שתי ההחלטות שמשפיעות על הביצועים יותר מכל כוונון אחר.

אילו תפקידים עוסקים ב-Big Data

אין תפקיד שנקרא "Big Data" - זו תכונה של המערכת, לא משרה. התפקידים שנוגעים בה:

  • Data Engineer: בונה את הצינורות ואת התשתית. 33 משרות פעילות.
  • Data Platform Engineer: מתחזק את הכלים עצמם - אשכולות, אחסון, הרשאות.
  • Analytics Engineer: הופך את הנתונים הגולמיים לטבלאות שאפשר לנתח.
  • Data Scientist: משתמש בנפחים האלה לאימון מודלים.

נקודת הכניסה המעשית לרובם היא SQL ו-Python - 133 ו-365 משרות פעילות בהתאמה. פירטנו את המסלול במה זה Data Engineering, ואפשר לסרוק את משרות Kafka ואת משרות Spark.

שאלות נפוצות

Big Data זה עדיין מונח רלוונטי?

פחות כמונח שיווקי, יותר כמציאות טכנית. היום פשוט אומרים "הנדסת נתונים" או "פלטפורמת נתונים", כי היכולת לעבד נפחים גדולים הפכה לחלק סטנדרטי מהתשתית ולא לפרויקט נפרד.

מה ההבדל בין Spark ל-Kafka?

Kafka מעביר אירועים בין מערכות ושומר אותם לזמן מוגבל; Spark מעבד נתונים בנפח גדול, באצווה או בזרימה. הם משלימים ולא מתחרים - Kafka מביא, Spark מחשב. בלוח 21 משרות מזכירות Kafka ו-25 מזכירות Spark.

צריך Hadoop כדי להיכנס לתחום?

לא. Hadoop היה הבסיס של הדור הראשון, והיום רוב העבודה החדשה נעשית על אחסון אובייקטים בענן עם Spark מעליו. כדאי להכיר את המושגים כי הם עדיין מופיעים במערכות ותיקות, אבל לא ללמוד אותו כנקודת כניסה.

כמה משרות Big Data יש בישראל?

המאגר לא מתייג "Big Data" כטכנולוגיה, אבל הכלים האופייניים מופיעים ב-25 משרות Kafka, 25 Spark, 22 Airflow ו-30 הנדסת נתונים, מתוך 1,952 משרות פעילות בלוח.

מה ההבדל בין Big Data ל-Data Warehouse?

מחסן נתונים הוא ארכיטקטורה לאחסון מסודר לצורכי ניתוח; Big Data מתאר סדר גודל שמחייב עיבוד מבוזר. מחסן מודרני בענן מטפל היום בנפחים שפעם חייבו מערכת נפרדת, ולכן הגבול בין השניים היטשטש.

איך מתרגלים עבודה עם נפחים גדולים בלי גישה לארגון?

אפשר לעבוד עם מאגרי נתונים ציבוריים גדולים ולהריץ עליהם Spark מקומית או בשכבה החינמית של ספק ענן. מה שחשוב להדגים אינו הנפח אלא ההחלטות: חלוקה למחיצות, פורמט קובץ, וטיפול בנתונים שמגיעים באיחור.

מאמרים נוספים

המשרות באתר