GPT
E

EconomicIndex

קוד פתוח

Anthropicmit2025-02-06

  • AI
  • LLM
  • Economic Impacts
  • Anthropic

מאגר נתונים של אנתרופיק שממפה שימוש במודלי בינה מלאכותית למשימות בעולם העבודה. הוא מתאים למי שחוקר חשיפה של מקצועות לאוטומציה לפי מדדים אמיתיים.

  • 18,965הורדות בחודש
  • 565לייקים

מה זה

המאגר מכיל קובצי נתונים שמציגים חיתוכים שונים של פעילות מודלים מול שוק העבודה. בפנים תמצאו קבצים שעוסקים בהשפעה על שוק התעסוקה, רמות חדירה למשימות שונות, וחלוקות לפי מקצועות ומבנה תקן התעסוקה האמריקאי.

התוכן מחולק לגרסאות שפורסמו לאורך זמן, החל מהשחרור הראשוני של פברואר 2025 ועד אמצע 2026. כל שחרור מביא זווית אחרת, כמו שילוב מידע ממודלים ספציפיים מסדרת סונט ואופוס, ניתוחים של החלפת עובדים לעומת סיוע לעובדים, ומיפויים מול מאגר המקצועות האמריקאי ונתוני הלשכה לסטטיסטיקה של משרד העבודה האמריקאי ממאי 2023.

מתאים ל

  • מחקר השפעות תעסוקה

    ניתוח מקצועות שחשופים לאוטומציה מול משימות שבהן מודלים רק מסייעים לעובד.

  • בניית מדדי חשיפה לחברות

    הערכת הסיכון והפוטנציאל הכלכלי של שילוב כלי בינה מלאכותית בצוותים קיימים.

  • השוואת ביצועי מודלים

    בדיקת מגמות האימוץ והיכולות של סדרות שונות של מודלים לאורך זמן.

איפה זה נופל

זה לא מאגר טקסט גולמי שמאמנים עליו מודל שפה, אלא טבלאות ניתוח ומחקר כלכלי. כל הנתונים מתמקדים בכלכלה ובשוק העבודה האמריקאי, סביב תקני סיווג מקצועות של ארצות הברית, והשפה היחידה בדאטהסט היא אנגלית. מי שמחפש מידע על השוק המקומי בישראל יצטרך לבצע התאמות ידניות מורכבות. בנוסף, המדדים נשענים על הנתונים והמודלים הפנימיים של אנתרופיק, כך שיש פה הטיה מובנית לאופן שבו אנשים משתמשים בכלים שלהם ולא בכלים של חברות אחרות.

שאלות
נפוצות

האם מותר להשתמש בנתונים לפיתוח מוצר מסחרי?

כן, הנתונים פורסמו תחת רישיון פתוח שמתיר שימוש מסחרי מלא. הדרישה העיקרית היא מתן קרדיט מתאים ליוצרים לפי תנאי הרישיון. אפשר לשלב את המידע במערכות פנימיות או במוצרים שמוכרים ללקוחות.

האם הדאטהסט כולל נתונים בעברית או על שוק העבודה הישראלי?

לא, המאגר כולו באנגלית ומוגדר כך במפורש. הנתונים מתבססים על סיווג המקצועות של משרד העבודה האמריקאי ונתוני התעסוקה בארצות הברית. כדי להשליך מזה על ישראל תצטרכו למפות את המקצועות לשוק המקומי באופן עצמאי.

איך הנתונים האלה נאספו בפועל?

החוקרים של אנתרופיק ניתחו מיליוני שיחות ושימושים אמיתיים במודלים שלהם, כמו קלוד סונט ואופוס. הם מיפו את הפעולות שבוצעו מול מאגרי משימות ומקצועות רשמיים בארצות הברית. התוצאה היא טבלאות מרוכזות שמציגות את רמת החדירה וההשפעה של המודל על כל תחום.

האם המאגר הזה מתאים לאימון מודל שפה חדש?

המאגר אינו מכיל טקסטים חופשיים או דוגמאות שיחה לאימון. הוא בנוי מקובצי נתונים טבלאיים שמיועדים למחקר, הערכה וניתוח סטטיסטי. אם המטרה שלכם היא פיין-טיונינג של מודל כתיבה, תצטרכו לחפש מאגר אחר.

איך טוענים

אין כאן צורך באישור גישה מיוחד. אפשר להוריד את הקבצים ישירות מהמאגר או למשוך אותם דרך ספריית הדאטהסטים הרגילה, כשבסך הכל מדובר על 83 קבצים. רוב המידע שמור בפורמט טבלאי פשוט של קובצי פסיקים, כך שאפשר לפתוח אותם ישירות בפנדס או בכל כלי עיבוד נתונים. כדאי לשים לב לנתיבים הפנימיים, כי הנתונים מפוזרים בתיקיות נפרדות לפי תאריכי שחרור ונושאים כמו השפעה על תעסוקה.

from datasets import load_dataset

ds = load_dataset("Anthropic/EconomicIndex")

הרישיון

הרישיון המוצהר בכרטיס הוא רישיון MIT לקוד, והנתונים עצמם שוחררו תחת רישיון CC-BY לפי עמוד הפרויקט. הרישיונות האלה מתירים שימוש מסחרי, שינוי והפצה, בתנאי שנותנים קרדיט מתאים ליוצרים. אין כאן חובת שיתוף תחת אותו רישיון, ומבחינה משפטית מותר לבנות על זה כלים ומודלים מסחריים בלי לחשוף את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗