GPT
G

gitskills

קוד פתוח

mvaccargiucc-by-4.02026-08-10

  • mining-software-repositories
  • msr
  • llm-agents
  • agent-skills
  • github

המאגר מרכז כמעט 3.8 מיליון קובצי הוראות לסוכני בינה מלאכותית שנאספו מגיטהאב. הוא מיועד למי שרוצה לנתח או לאמן מודלים על פרומפטים מובנים, סקריפטים נלווים והיסטוריית גרסאות בעולם האמיתי.

  • 4,385הורדות בחודש
  • 34לייקים

מה זה

הנתונים כוללים קובצי הוראות בפורמט שהציגה אנתרופיק, שנכרו מתוך 282,200 מאגרים ציבוריים בגיטהאב במהלך יולי 2026. כל רשומה מייצגת קובץ הוראות לסוכן, כולל ניתוח של שדות המבנה כמו שם ותיאור, גודל הטקסט, נתיב הקובץ וההאש שלו. מתוך כלל המופעים, כמחצית הם שכפולים מדויקים, ולכן החוקרים חילקו אותם לקבוצות תוכן זהה והעשירו נציג בודד מכל קבוצה בטקסט המלא ובהיסטוריית הקומיטים שלו.

המבנה מחולק לארבע תצורות שונות. הראשונה מכילה את קובצי ההוראות עצמם, השנייה מרכזת מעל 7.2 מיליון קובצי סקריפטים ומסמכי עזר שנשמרו באותן תיקיות לצד ההוראות, השלישית מספקת מטא דאטה על המאגרים עצמם כמו כוכבים, שפת פיתוח ורישיונות מקוריים, והרביעית מתעדת את ריצות הכרייה בפועל.

מתאים ל

  • אימון מודלים לכתיבת מיומנויות

    לימוד מודל שפה כיצד לנסח הנחיות מדויקות, תיאורי הפעלה וסקריפטים נלווים עבור סוכנים אוטונומיים.

  • ניתוח אבטחה בשרשרת אספקה

    זיהוי שינויים זדוניים, הרצת פקודות או גישה לרשת שנוספו בעותקים משוכפלים של הוראות קיימות.

  • מחקר על שכפול פרומפטים

    בדיקת דפוסי העתקה והתפתחות של קובצי הנחיות ברחבי גיטהאב ללא מנהל חבילות מרכזי.

איפה זה נופל

האיסוף נשען כולו על מנוע החיפוש של גיטהאב, ולכן הוא מייצג רק מאגרים פעילים עם פחות מחצי מיליון קבצים, קבצים שגודלם מתחת ל־384 קילובייט, ורק את הענף הראשי. מעבר לכך, החיפוש אסף כל קובץ שתואם לשם ללא תלות בתוכן, כך שנכללים גם קבצים ישנים שלא קשורים לסוכנים. טקסט מלא והיסטוריית קומיטים נשמרו רק עבור קובץ מייצג מכל קבוצת כפילויות ולא עבור כל המופעים. בנוסף, הנתונים משקפים תמונת מצב מיולי 2026, ללא מידע ממאגרים פרטיים או פיצולים שאינם פופולריים מהמקור, ורובו המוחלט של התוכן כתוב באנגלית טכנית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

המאגר עצמו מופץ ברישיון חופשי עם ייחוס, אבל הטקסטים של הקבצים שייכים למאגרים שמהם נאספו. לפני אימון מודל מסחרי עליכם לבדוק את שדה הרישיון של המאגר המקורי בנתונים, ולסנן החוצה פרויקטים ללא רישיון מסחרי מתאים.

האם המאגר כולל הוראות בעברית?

כרטיס המאגר אינו מציין חלוקה לפי שפות טבעיות של הטקסט, אך מאחר שהמקור הוא גיטהאב והפורמט נשען על קוד, הרוב המכריע כתוב באנגלית. ייתכנו מקרים בודדים של הוראות בעברית בפרויקטים מקומיים, אך לא כדאי להסתמך עליו כמקור נתונים לעברית.

איך נאספו הקבצים בפועל?

החוקרים כרו את הנתונים דרך ממשקי ה־API של גיטהאב וחילקו את שאילתות החיפוש לפי גודל קובץ כדי לעקוף את מגבלת אלף התוצאות של החיפוש. כל קובץ בעל שם תואם נשמר, קובץ לפי האש התוכן שלו, ועותק אחד מכל קבוצה נבחר להורדת הטקסט המלא והיסטוריית הגרסאות.

מה ההבדל בין קובצי ההוראות לקובצי העזר במאגר?

טבלת ההוראות מכילה את קובץ ההנחיות המרכזי של הסוכן, בעוד שטבלת קובצי העזר מכילה קוד ומסמכים נוספים שישבו באותה תיקייה. קובצי העזר מאפשרים לבחון לא רק את ההוראה המילולית אלא גם את הסקריפטים שהסוכן אמור להריץ בפועל כדי לבצע את המשימה.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets בפייתון באמצעות load_dataset עם המזהה mvaccargiu/gitskills, תוך בחירת אחת מארבע התצורות הרצויות. הגישה פתוחה ואינה דורשת אישור מיוחד. המאגר מאוחסן בקובצי Parquet מחולקים, כאשר טבלאות המכילות מיליוני שורות כמו ההוראות וקבצי העזר דורשות זיכרון עבודה משמעותי. שדות המפתח לעבודה שוטפת הם תוכן הטקסט המלא, תיאור המשימה, מזהה ההאש לזיהוי כפילויות, ושדה הרישיון של מאגר המקור שמגדיר מה מותר לעשות עם הטקסט עצמו.

from datasets import load_dataset

ds = load_dataset("mvaccargiu/gitskills")

הרישיון

המטא דאטה והאיגוד של המאגר מפורסמים תחת רישיון CC-BY-4.0, שמאפשר שימוש מסחרי, שינוי ושיתוף בכפוף למתן קרדיט. עם זאת, תוכן הקבצים עצמם נלקח ישירות ממאגרים ציבוריים וכפוף לרישיון המקורי של כל פרויקט. אם אתם מאמנים מודל מסחרי על הטקסט, חובה לסנן את השורות לפי שדה רישיון המקור בטבלת המאגרים כדי לוודא שאינכם משתמשים בקוד תחת רישיון מגביל או הדדי.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗