HiTakeJobHiTakeJob

מה זה Data Science ומה דאטה סיינטיסט עושה

זמן קריאה: 7 דקות

Data Science הוא השימוש בשיטות סטטיסטיות ובלמידת מכונה כדי להוציא החלטות מתוך נתונים. דאטה סיינטיסט לא רק מתאר מה קרה - הוא בונה מודל שמנבא או ממליץ. בלוח HiTakeJob פתוחות כרגע 61 משרות שדורשות ניתוח נתונים ו-27 משרות הנדסת דאטה.

מה דאטה סיינטיסט עושה בפועל

הציפייה הנפוצה היא אימון מודלים. המציאות שונה: רוב הזמן הולך על השגת הנתונים, ניקוי שלהם והבנה למה הם לא נראים כמו שציפינו. שלב המידול הוא לרוב החלק הקצר בפרויקט.

פרויקט טיפוסי מתחיל בשאלה עסקית מעורפלת - "למה לקוחות עוזבים?" - וההמרה שלה לשאלה שאפשר לענות עליה עם הנתונים הקיימים היא עיקר העבודה. אחר כך מגיעים איסוף, בדיקת איכות, בניית מאפיינים, אימון, מדידה, ולבסוף החלק שהכי הרבה מודלים נכשלים בו: להעביר את זה לייצור ולהוכיח שזה עובד גם על נתונים חדשים.

Data Scientist מול Data Analyst מול Data Engineer

שלושת התפקידים חולקים כלים אבל עונים על שאלות שונות:

תפקידהשאלה המרכזיתתוצרכלים טיפוסיים
Data Analystמה קרה ולמה?דוח, דשבורד, המלצהSQL, Excel, BI
Data Scientistמה יקרה ומה כדאי לעשות?מודל, ניסוי, תחזיתPython, סטטיסטיקה, ML
Data Engineerאיך הנתונים יגיעו לכאן באופן אמין?Pipeline, מחסן נתוניםSQL, Airflow, Kafka

בחברות קטנות אדם אחד עושה את שלושתם. בחברות גדולות ההפרדה חדה. אם אתם בתחילת הדרך, תפקיד אנליסט הוא לרוב נקודת הכניסה הריאלית ביותר - הביקוש גדול יותר ורף הכניסה נמוך יותר.

הכלים שמופיעים במשרות עצמן

במקום רשימת "מה ללמוד" תיאורטית, אלו המספרים מהמשרות הפתוחות בלוח כרגע:

כלימשרות פעילותלמה זה נדרש
Python365שפת ברירת המחדל של התחום
SQL133שליפת הנתונים - לפני כל מודל
ניתוח נתונים61הליבה של רוב תפקידי הדאטה
הנדסת דאטה27בניית ה-pipeline
Airflow22תזמון תהליכי נתונים
PyTorch27למידה עמוקה

יש כאן לקח שקל לפספס: SQL מופיע בפי שמונה יותר משרות מ-PyTorch. מי שמשקיע חודשים ברשתות נוירונים לפני ששולט ב-SQL מתכונן לשוק שלא קיים. הבסיס הסטטיסטי ו-SQL הם מה שנבדק בראיונות בפועל.

מה נדרש כדי להיכנס

שלושה רבדים, לפי סדר החשיבות המעשי:

  • סטטיסטיקה והסתברות. להבין מה זה מובהקות, הטיה, ו-overfitting. זה מה שמפריד בין מי שמריץ ספרייה למי שיודע אם התוצאה אמיתית.
  • Python ו-SQL ברמה עובדת. לא ברמת תחביר - ברמה של לקחת קובץ מלוכלך ולהוציא ממנו תשובה.
  • יכולת הסבר. מודל שאף אחד בעסק לא מבין לא ייושם. חלק גדול מהתפקיד הוא לתרגם תוצאה סטטיסטית להחלטה.

תואר מתקדם עוזר, במיוחד למשרות מחקריות, אבל אינו תנאי בכל מקום. תיק עבודות עם שניים-שלושה פרויקטים על נתונים אמיתיים - לא על דאטהסט הדגמה מוכר - מדבר חזק יותר.

שכר - הערכת שוק

אין נתוני שכר בלוח שלנו. הטווחים הבאים הם הערכת שוק על בסיס מקורות פומביים, לא נתונים שלנו:

תפקיד וותקטווח חודשי ברוטו (הערכת שוק)
Data Analyst ג'וניורכ-14,000-20,000 ₪
Data Scientist ג'וניורכ-18,000-26,000 ₪
Data Scientist מנוסהכ-30,000-48,000 ₪

איפה מחפשים

קטגוריית דאטה ואנליטיקה בלוח מרכזת 35 משרות פעילות, ומעבר לה יש משרות דאטה רבות שמשויכות לפיתוח ומחקר (377 משרות). כדאי לחפש בשתי הקטגוריות ולא רק באחת.

להעמקה: המדריך המלא לכישורי דאטה ולמידת מכונה, ומה זה למידת מכונה למי שרוצה להבין את הרובד הטכני.

איך נראה פרויקט מקצה לקצה

פרויקט דאטה טיפוסי עובר שישה שלבים. ההפתעה לרוב הנכנסים לתחום היא כמה מעט זמן הולך על החלק שנחשב מעניין:

שלבמה קורה בונתח מהזמן (הערכה)
הגדרת השאלהתרגום צורך עסקי לשאלה שאפשר לענות עליה10%
איסוף נתוניםשליפה ממקורות, חיבור בין טבלאות20%
ניקוי והכנהערכים חסרים, כפילויות, בניית מאפיינים35%
מידולאימון והשוואת מודלים15%
הערכהבחירת מדד, בדיקה על נתונים שלא נראו10%
העלאה לייצורשילוב במערכת וניטור לאורך זמן10%

השלב שהכי הרבה פרויקטים נתקעים בו הוא האחרון. מודל שנשאר במחברת ולא הגיע לייצור לא ייצר ערך, וזו הסיבה שחברות מחפשות דאטה סיינטיסטים עם רקע הנדסי ולא רק סטטיסטי.

איך נראה ראיון ל-Data Scientist

בניגוד לראיון פיתוח, הראיון כאן נשען על ארבעה צירים ולא על אחד:

  • SQL. כמעט תמיד. שאילתה עם JOIN, GROUP BY ופונקציית חלון. זהו הסינון הראשון והוא מפיל רבים.
  • סטטיסטיקה. מה זה p-value, איך מזהים overfitting, מתי ממוצע מטעה ומה עושים במקומו.
  • מקרה בוחן. "איך היית בונה מודל שמזהה לקוחות שעומדים לעזוב?" - השאלה בודקת חשיבה ולא ידע. הצגת ההנחות והמגבלות חשובה מהתשובה עצמה.
  • הפרויקטים שלכם. תישאלו למה בחרתם מודל מסוים, מה לא עבד, ואיך ידעתם שהתוצאה טובה.

הצירוף שמפיל הכי הרבה מועמדים הוא ידע תיאורטי חזק לצד SQL חלש. שווה להשקיע דווקא שם.

שלוש טעויות שחוזרות בתחום

  • בחירת מדד הצלחה לא נכון. מודל שמזהה הונאה עם 99% דיוק חסר ערך אם רק אחוז אחד מהעסקאות הן הונאה - הוא פשוט אומר תמיד "הכל תקין".
  • דליפת מידע. מאפיין שנוצר אחרי האירוע שמנסים לחזות נכנס לאימון, המודל מקבל ציון מצוין, ובייצור הוא קורס.
  • מודל מסובך מהנדרש. רגרסיה שאפשר להסביר עדיפה לעיתים קרובות על רשת נוירונים שאיש בעסק לא סומך עליה.

איך נכנסים לתחום בפועל

המסלול הריאלי לרוב האנשים אינו קפיצה ישירה לתפקיד סיינטיסט. הוא נראה כך: שליטה בSQL ובPython, כניסה לתפקיד ניתוח נתונים, שנה עד שנתיים של עבודה עם נתונים אמיתיים ובעלי עניין אמיתיים, ורק אז מעבר. הדרך הזו איטית יותר מקורס, אבל היא זו שעובדת בשוק הישראלי.

למי שרוצה לקצר: תיק עבודות עם שניים או שלושה פרויקטים על נתונים ציבוריים אמיתיים - לא דאטהסטים להדגמה שכולם מכירים - שמוצגים עם השאלה, ההנחות, מה לא עבד והמסקנה. זה מדבר חזק יותר מכל תעודה.

הכלים היומיומיים - מה באמת פתוח על המסך

כלילמה משמשנוכחות בשוק
SQLשליפת הנתונים - השלב שלפני הכל133 משרות פעילות
Python עם pandasניקוי, עיבוד וניתוח365 משרות
מחברות Jupyterחקירה ראשונית ושיתוף ממצאיםסטנדרט דה-פקטו
כלי BIהצגת תוצאות לבעלי ענייןנפוץ בתפקידי אנליסט
Gitניהול גרסאות של קוד וניתוחיםנדרש כמעט תמיד
Airflowתזמון תהליכי נתונים חוזרים22 משרות פעילות

שימו לב מה לא ברשימה: כלי AutoML וספריות למידה עמוקה. הם מופיעים במשרות ספציפיות, אבל הם לא מה שפותח את היום.

איך מציגים ממצא לבעלי עניין לא טכניים

זהו הכישור שהכי מפריד בין דאטה סיינטיסט טוב למצוין, והוא כמעט לא נלמד. ארבעה עקרונות מעשיים:

  • להתחיל מהמסקנה. לא מהמתודולוגיה. "מומלץ לעצור את הקמפיין הזה" ואז ההסבר - לא ההפך.
  • לתרגם לכסף או לזמן. "שיפור של 3% ב-recall" אינו אומר דבר. "נזהה עוד כ-40 מקרי הונאה בחודש" כן.
  • לומר בפירוש מה לא יודעים. טווח אי-ודאות מגביר אמון ולא מוריד אותו. מודל שמוצג כוודאי ואז טועה שורף את הקרדיט לשנה.
  • גרף אחד לכל מסקנה. דשבורד עם שנים-עשר גרפים אינו מעביר מסר, הוא מבקש מהקורא לעשות את העבודה בעצמו.

בראיונות זה נבדק דרך שאלת מקרה הבוחן. מועמד שמסביר איך יציג את התוצאה, ולא רק איך יגיע אליה, בולט מיד.

שאלות נפוצות

מה זה data science בפשטות?

הוצאת החלטות מתוך נתונים בעזרת סטטיסטיקה ולמידת מכונה. בניגוד לניתוח נתונים שמתאר מה קרה, Data Science בונה מודל שמנבא מה יקרה או ממליץ מה לעשות.

מה ההבדל בין Data Scientist ל-Data Analyst?

אנליסט עונה על "מה קרה ולמה" ומייצר דוחות ודשבורדים. סיינטיסט עונה על "מה יקרה" ומייצר מודלים וניסויים. אנליסט הוא בדרך כלל נקודת הכניסה הריאלית יותר לתחום.

מה צריך לדעת כדי להיכנס ל-Data Science?

סטטיסטיקה והסתברות, Python ו-SQL ברמה עובדת, ויכולת להסביר תוצאה לאנשים לא טכניים. לפי המשרות הפעילות בלוח, SQL מופיע ב-133 משרות לעומת PyTorch ב-27 - הבסיס חשוב יותר מהכלים המתקדמים.

כמה משרות דאטה יש בישראל כרגע?

בלוח HiTakeJob פתוחות 61 משרות שדורשות ניתוח נתונים ו-27 משרות הנדסת דאטה, מתוך 1,952 משרות פעילות. קטגוריית דאטה ואנליטיקה מרכזת 35 משרות.

צריך תואר שני ל-Data Science?

לא בכל מקום. תואר מתקדם עוזר למשרות מחקריות ולחברות גדולות, אבל בשוק הישראלי מתקבלים גם עם תואר ראשון או הסבה, בתנאי שיש תיק עבודות על נתונים אמיתיים.

מאמרים נוספים

המשרות באתר