מה זה Data Science ומה דאטה סיינטיסט עושה
זמן קריאה: 7 דקות
Data Science הוא השימוש בשיטות סטטיסטיות ובלמידת מכונה כדי להוציא החלטות מתוך נתונים. דאטה סיינטיסט לא רק מתאר מה קרה - הוא בונה מודל שמנבא או ממליץ. בלוח HiTakeJob פתוחות כרגע 61 משרות שדורשות ניתוח נתונים ו-27 משרות הנדסת דאטה.
מה דאטה סיינטיסט עושה בפועל
הציפייה הנפוצה היא אימון מודלים. המציאות שונה: רוב הזמן הולך על השגת הנתונים, ניקוי שלהם והבנה למה הם לא נראים כמו שציפינו. שלב המידול הוא לרוב החלק הקצר בפרויקט.
פרויקט טיפוסי מתחיל בשאלה עסקית מעורפלת - "למה לקוחות עוזבים?" - וההמרה שלה לשאלה שאפשר לענות עליה עם הנתונים הקיימים היא עיקר העבודה. אחר כך מגיעים איסוף, בדיקת איכות, בניית מאפיינים, אימון, מדידה, ולבסוף החלק שהכי הרבה מודלים נכשלים בו: להעביר את זה לייצור ולהוכיח שזה עובד גם על נתונים חדשים.
Data Scientist מול Data Analyst מול Data Engineer
שלושת התפקידים חולקים כלים אבל עונים על שאלות שונות:
| תפקיד | השאלה המרכזית | תוצר | כלים טיפוסיים |
|---|---|---|---|
| Data Analyst | מה קרה ולמה? | דוח, דשבורד, המלצה | SQL, Excel, BI |
| Data Scientist | מה יקרה ומה כדאי לעשות? | מודל, ניסוי, תחזית | Python, סטטיסטיקה, ML |
| Data Engineer | איך הנתונים יגיעו לכאן באופן אמין? | Pipeline, מחסן נתונים | SQL, Airflow, Kafka |
בחברות קטנות אדם אחד עושה את שלושתם. בחברות גדולות ההפרדה חדה. אם אתם בתחילת הדרך, תפקיד אנליסט הוא לרוב נקודת הכניסה הריאלית ביותר - הביקוש גדול יותר ורף הכניסה נמוך יותר.
הכלים שמופיעים במשרות עצמן
במקום רשימת "מה ללמוד" תיאורטית, אלו המספרים מהמשרות הפתוחות בלוח כרגע:
| כלי | משרות פעילות | למה זה נדרש |
|---|---|---|
| Python | 365 | שפת ברירת המחדל של התחום |
| SQL | 133 | שליפת הנתונים - לפני כל מודל |
| ניתוח נתונים | 61 | הליבה של רוב תפקידי הדאטה |
| הנדסת דאטה | 27 | בניית ה-pipeline |
| Airflow | 22 | תזמון תהליכי נתונים |
| PyTorch | 27 | למידה עמוקה |
יש כאן לקח שקל לפספס: SQL מופיע בפי שמונה יותר משרות מ-PyTorch. מי שמשקיע חודשים ברשתות נוירונים לפני ששולט ב-SQL מתכונן לשוק שלא קיים. הבסיס הסטטיסטי ו-SQL הם מה שנבדק בראיונות בפועל.
מה נדרש כדי להיכנס
שלושה רבדים, לפי סדר החשיבות המעשי:
- סטטיסטיקה והסתברות. להבין מה זה מובהקות, הטיה, ו-overfitting. זה מה שמפריד בין מי שמריץ ספרייה למי שיודע אם התוצאה אמיתית.
- Python ו-SQL ברמה עובדת. לא ברמת תחביר - ברמה של לקחת קובץ מלוכלך ולהוציא ממנו תשובה.
- יכולת הסבר. מודל שאף אחד בעסק לא מבין לא ייושם. חלק גדול מהתפקיד הוא לתרגם תוצאה סטטיסטית להחלטה.
תואר מתקדם עוזר, במיוחד למשרות מחקריות, אבל אינו תנאי בכל מקום. תיק עבודות עם שניים-שלושה פרויקטים על נתונים אמיתיים - לא על דאטהסט הדגמה מוכר - מדבר חזק יותר.
שכר - הערכת שוק
אין נתוני שכר בלוח שלנו. הטווחים הבאים הם הערכת שוק על בסיס מקורות פומביים, לא נתונים שלנו:
| תפקיד וותק | טווח חודשי ברוטו (הערכת שוק) |
|---|---|
| Data Analyst ג'וניור | כ-14,000-20,000 ₪ |
| Data Scientist ג'וניור | כ-18,000-26,000 ₪ |
| Data Scientist מנוסה | כ-30,000-48,000 ₪ |
איפה מחפשים
קטגוריית דאטה ואנליטיקה בלוח מרכזת 35 משרות פעילות, ומעבר לה יש משרות דאטה רבות שמשויכות לפיתוח ומחקר (377 משרות). כדאי לחפש בשתי הקטגוריות ולא רק באחת.
להעמקה: המדריך המלא לכישורי דאטה ולמידת מכונה, ומה זה למידת מכונה למי שרוצה להבין את הרובד הטכני.
איך נראה פרויקט מקצה לקצה
פרויקט דאטה טיפוסי עובר שישה שלבים. ההפתעה לרוב הנכנסים לתחום היא כמה מעט זמן הולך על החלק שנחשב מעניין:
| שלב | מה קורה בו | נתח מהזמן (הערכה) |
|---|---|---|
| הגדרת השאלה | תרגום צורך עסקי לשאלה שאפשר לענות עליה | 10% |
| איסוף נתונים | שליפה ממקורות, חיבור בין טבלאות | 20% |
| ניקוי והכנה | ערכים חסרים, כפילויות, בניית מאפיינים | 35% |
| מידול | אימון והשוואת מודלים | 15% |
| הערכה | בחירת מדד, בדיקה על נתונים שלא נראו | 10% |
| העלאה לייצור | שילוב במערכת וניטור לאורך זמן | 10% |
השלב שהכי הרבה פרויקטים נתקעים בו הוא האחרון. מודל שנשאר במחברת ולא הגיע לייצור לא ייצר ערך, וזו הסיבה שחברות מחפשות דאטה סיינטיסטים עם רקע הנדסי ולא רק סטטיסטי.
איך נראה ראיון ל-Data Scientist
בניגוד לראיון פיתוח, הראיון כאן נשען על ארבעה צירים ולא על אחד:
- SQL. כמעט תמיד. שאילתה עם JOIN, GROUP BY ופונקציית חלון. זהו הסינון הראשון והוא מפיל רבים.
- סטטיסטיקה. מה זה p-value, איך מזהים overfitting, מתי ממוצע מטעה ומה עושים במקומו.
- מקרה בוחן. "איך היית בונה מודל שמזהה לקוחות שעומדים לעזוב?" - השאלה בודקת חשיבה ולא ידע. הצגת ההנחות והמגבלות חשובה מהתשובה עצמה.
- הפרויקטים שלכם. תישאלו למה בחרתם מודל מסוים, מה לא עבד, ואיך ידעתם שהתוצאה טובה.
הצירוף שמפיל הכי הרבה מועמדים הוא ידע תיאורטי חזק לצד SQL חלש. שווה להשקיע דווקא שם.
שלוש טעויות שחוזרות בתחום
- בחירת מדד הצלחה לא נכון. מודל שמזהה הונאה עם 99% דיוק חסר ערך אם רק אחוז אחד מהעסקאות הן הונאה - הוא פשוט אומר תמיד "הכל תקין".
- דליפת מידע. מאפיין שנוצר אחרי האירוע שמנסים לחזות נכנס לאימון, המודל מקבל ציון מצוין, ובייצור הוא קורס.
- מודל מסובך מהנדרש. רגרסיה שאפשר להסביר עדיפה לעיתים קרובות על רשת נוירונים שאיש בעסק לא סומך עליה.
איך נכנסים לתחום בפועל
המסלול הריאלי לרוב האנשים אינו קפיצה ישירה לתפקיד סיינטיסט. הוא נראה כך: שליטה בSQL ובPython, כניסה לתפקיד ניתוח נתונים, שנה עד שנתיים של עבודה עם נתונים אמיתיים ובעלי עניין אמיתיים, ורק אז מעבר. הדרך הזו איטית יותר מקורס, אבל היא זו שעובדת בשוק הישראלי.
למי שרוצה לקצר: תיק עבודות עם שניים או שלושה פרויקטים על נתונים ציבוריים אמיתיים - לא דאטהסטים להדגמה שכולם מכירים - שמוצגים עם השאלה, ההנחות, מה לא עבד והמסקנה. זה מדבר חזק יותר מכל תעודה.
הכלים היומיומיים - מה באמת פתוח על המסך
| כלי | למה משמש | נוכחות בשוק |
|---|---|---|
| SQL | שליפת הנתונים - השלב שלפני הכל | 133 משרות פעילות |
| Python עם pandas | ניקוי, עיבוד וניתוח | 365 משרות |
| מחברות Jupyter | חקירה ראשונית ושיתוף ממצאים | סטנדרט דה-פקטו |
| כלי BI | הצגת תוצאות לבעלי עניין | נפוץ בתפקידי אנליסט |
| Git | ניהול גרסאות של קוד וניתוחים | נדרש כמעט תמיד |
| Airflow | תזמון תהליכי נתונים חוזרים | 22 משרות פעילות |
שימו לב מה לא ברשימה: כלי AutoML וספריות למידה עמוקה. הם מופיעים במשרות ספציפיות, אבל הם לא מה שפותח את היום.
איך מציגים ממצא לבעלי עניין לא טכניים
זהו הכישור שהכי מפריד בין דאטה סיינטיסט טוב למצוין, והוא כמעט לא נלמד. ארבעה עקרונות מעשיים:
- להתחיל מהמסקנה. לא מהמתודולוגיה. "מומלץ לעצור את הקמפיין הזה" ואז ההסבר - לא ההפך.
- לתרגם לכסף או לזמן. "שיפור של 3% ב-recall" אינו אומר דבר. "נזהה עוד כ-40 מקרי הונאה בחודש" כן.
- לומר בפירוש מה לא יודעים. טווח אי-ודאות מגביר אמון ולא מוריד אותו. מודל שמוצג כוודאי ואז טועה שורף את הקרדיט לשנה.
- גרף אחד לכל מסקנה. דשבורד עם שנים-עשר גרפים אינו מעביר מסר, הוא מבקש מהקורא לעשות את העבודה בעצמו.
בראיונות זה נבדק דרך שאלת מקרה הבוחן. מועמד שמסביר איך יציג את התוצאה, ולא רק איך יגיע אליה, בולט מיד.
שאלות נפוצות
מה זה data science בפשטות?
הוצאת החלטות מתוך נתונים בעזרת סטטיסטיקה ולמידת מכונה. בניגוד לניתוח נתונים שמתאר מה קרה, Data Science בונה מודל שמנבא מה יקרה או ממליץ מה לעשות.
מה ההבדל בין Data Scientist ל-Data Analyst?
אנליסט עונה על "מה קרה ולמה" ומייצר דוחות ודשבורדים. סיינטיסט עונה על "מה יקרה" ומייצר מודלים וניסויים. אנליסט הוא בדרך כלל נקודת הכניסה הריאלית יותר לתחום.
מה צריך לדעת כדי להיכנס ל-Data Science?
סטטיסטיקה והסתברות, Python ו-SQL ברמה עובדת, ויכולת להסביר תוצאה לאנשים לא טכניים. לפי המשרות הפעילות בלוח, SQL מופיע ב-133 משרות לעומת PyTorch ב-27 - הבסיס חשוב יותר מהכלים המתקדמים.
כמה משרות דאטה יש בישראל כרגע?
בלוח HiTakeJob פתוחות 61 משרות שדורשות ניתוח נתונים ו-27 משרות הנדסת דאטה, מתוך 1,952 משרות פעילות. קטגוריית דאטה ואנליטיקה מרכזת 35 משרות.
צריך תואר שני ל-Data Science?
לא בכל מקום. תואר מתקדם עוזר למשרות מחקריות ולחברות גדולות, אבל בשוק הישראלי מתקבלים גם עם תואר ראשון או הסבה, בתנאי שיש תיק עבודות על נתונים אמיתיים.