GPT
D

DataScience-Instruct-500K

קוד פתוח

RUC-DataLabmit2025-10-17

מאגר הוראות שמכוון ישירות לאימון סוכני מדע נתונים עצמאיים. הוא כולל משימות ניתוח, כתיבת קוד, שאילתות מחקר ועיבוד נתונים לאורך כל הצינור של עבודת אנליסט.

  • 942הורדות בחודש
  • 76לייקים

מה זה

המאגר מיועד לאימון מודלים שצריכים לבצע משימות נתונים מקצה לקצה, החל מהכנת המידע, דרך מידול וניתוח, ועד הפקת דוחות ויזואליים. הנתונים מתמקדים בעבודה מול מקורות שונים כמו טבלאות, קובצי אקסל, בסיסי נתונים ופורמטים חצי מובנים או חופשיים כמו קובצי טקסט וג'ייסון.

מבנה הקבצים במאגר כולל חלוקה לתיקיית למידת חיזוק עם קובצי פרקט ייעודיים כמו שאלות ותשובות, משימות נתונים ומחקר, לצד קובצי ארכיון דחוסים. החוקרים שיצרו את המאגר פיתחו באמצעותו את המודל שלהם, אך כרטיס הדאטהסט לא מפרט במדויק איך הרשומות עצמן סוננו או נוצרו במקור.

מתאים ל

  • אימון סוכני ניתוח נתונים

    כוונון עדין של מודלי שפה לביצוע אוטונומי של ניתוח נתונים, החל מניקוי ועד הסקת מסקנות.

  • למידת חיזוק למשימות קוד

    שימוש בקובצי הפרקט הייעודיים לשיפור היכולת של מודלים לחקור מאגרי מידע ולכתוב קוד אנליטי מדויק.

  • הפקת דוחות מחקר אוטומטיים

    אימון מודל לחקור קבצים מגוונים כמו טבלאות ומסמכים ולהפיק מהם סיכומים ותובנות.

איפה זה נופל

כרטיס המאגר כמעט ריק מפרטים טכניים מהותיים. אין שום מידע על הטיות אפשריות, לא ברור באילו שפות המשימות כתובות מעבר לאנגלית, ואין פירוט לגבי מקור הנתונים או תהליך הסינון והבדיקה שלהם. לפני שאתם זורקים את זה לתוך אימון של מודל, תצטרכו לדגום ידנית את קובצי הפרקט כדי לוודא שאיכות הטקסט והקוד עומדת בסטנדרטים שלכם.

שאלות
נפוצות

האם מותר להשתמש במאגר כדי לאמן מודל למוצר מסחרי?

כן. הרישיון המדווח הוא אם איי טי, שמתיר שימוש מסחרי מלא ללא הגבלות על תוצרי האימון, בתנאי ששומרים על תנאי הרישיון והייחוס המקוריים.

האם יש במאגר משימות בשפה העברית?

הכרטיס לא מציין תמיכה בעברית או בשפות נוספות מעבר לאנגלית. אם אתם בונים כלי שמיועד לשוק המקומי, תצטרכו לבדוק את הדגימות בעצמכם או לתרגם את הנתונים.

איך הנתונים נאספו ונבדקו?

מפרסמי המאגר לא פירטו בכרטיס את שיטת האיסוף או הסינון. הם הפנו למאמר ולפרויקט שלהם, כך שחובת הבדיקה לגבי איכות הדוגמאות והאמינות שלהן היא עליכם לפני שאתם מתחילים לאמן.

איך טוענים

טוענים את המאגר ישירות דרך ספריית הדאטהסטים של הגינג פייס בעזרת המזהה שלו, בלי צורך בבקשת אישור גישה מוקדמת. המאגר מכיל שלושים ושמונה קבצים שכוללים קובצי פרקט וארכיון זיפ שמחזיק מידע נלווה למשימות, ולכן תצטרכו להוריד ולפתוח את הקבצים הללו מקומית אם אתם מתכננים להריץ את שלבי האימון המלאים.

from datasets import load_dataset

ds = load_dataset("RUC-DataLab/DataScience-Instruct-500K")

הרישיון

המאגר מופץ תחת רישיון אם איי טי, שזה הרישיון הכי פתוח ונוח שיש. אתם יכולים להשתמש בו לצרכים מסחריים, לשנות אותו, לאמן עליו מודלים פנימיים או מסחריים ולהפיץ אותם בלי דרישה לפתוח את הקוד שלכם, כל עוד אתם שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗