GPT
E

Everything_Instruct

קוד פתוח

rombodawgapache-2.02024-10-08

  • Num_Rows = 5,685,816
  • Max_length = 8180

אוסף ענק של הוראות בפורמט אלפקה שמיועד לאימון מודלים ללא צנזורה. המאגר מרכז מיליוני דוגמאות בנושאי תכנות, שיחה כללית, מתמטיקה ועוד עשרות תחומים.

  • 88הורדות בחודש
  • 54לייקים

מה זה

המאגר מאגד נתונים ממקורות קהילתיים רבים ברשת לתוך קובץ מרכזי אחד בפורמט אלפקה. החלק הארי שבו מוקדש לקוד עם קרוב לשלושה מיליון שורות, כשאחריו נמצאים ידע כללי והוראות כלליות עם כמיליון שורות לכל תחום. שאר החומר מכסה נושאים ממוקדים כמו כתיבה יוצרת, משחקי תפקידים, מתמטיקה, הפעלת פונקציות, חדשות, משפטים, רפואה, בישול ומדע.

המקורות מגוונים מאוד ומגיעים מדאטהסטים מוכרים כמו מאגרי קוד שונים, פוסטים מרדיט, שאלות רפואיות ומאמרי חדשות. המפרסם חיבר את הנתונים ישירות ללא סינון בטיחותי או התאמות יישור, במטרה ליצור בסיס אימון שלא יסרב לפניות המשתמש.

מתאים ל

  • אימון סייעני תכנות

    אימון מודלים לכתיבת קוד ופתרון בעיות בעזרת קרוב לשלושה מיליון רשומות של סקריפטים והוראות פיתוח.

  • פיתוח מודלי שיחה פתוחים

    בניית צ'אטבוטים לשיחה ומשחקי תפקידים ללא מנגנוני סירוב או צנזורה מובנים.

  • לימוד הפעלת פונקציות

    כוונון עדין של מודלים לקריאה לכלים חיצוניים בעזרת מעל מאה אלף דוגמאות ייעודיות לנושא.

איפה זה נופל

היוצר מצהיר מראש שהחומר נטול צנזורה לחלוטין, מה שאומר שהמודל שלכם לא יסרב לבקשות ולא יכלול מנגנוני בטיחות מובנים. בנוסף, הדאטהסט כולו באנגלית בלבד ואין בו תמיכה בשפות אחרות. לא מפורט בכרטיס תהליך של בדיקת איכות, ניקוי כפילויות או וידוא עובדות, ולכן חובה לסנן את התוכן בעצמכם לפני שמכניסים אותו למערכת מבצעית אמיתית.

שאלות
נפוצות

האם מותר להשתמש במאגר למטרות מסחריות?

הרישיון המוצהר של המאגר הוא apache-2.0, שמתיר שימוש מסחרי מלא ללא תמלוגים. עם זאת, כיוון שהוא מורכב ממאגרים חיצוניים רבים, כדאי לוודא שכל מקור בנפרד אכן מאפשר שימוש כזה. האחריות על בדיקת מקורות המידע נשארת אצל מי שמאמן את המודל.

האם המאגר כולל תוכן בעברית?

לא, הדאטהסט מוגדר באנגלית בלבד. כל המקורות המפורטים בכרטיס, החל מחדשות ה־BBC ועד מאגרי הקוד, נאספו באנגלית. אם אתם מכוונים למודל בעברית, תצטרכו לתרגם את הנתונים או לשלב מקורות נוספים.

איך נאסף המידע שבתוך הקובץ?

היוצר ליקט ואיחד סדרה ארוכה של מאגרי נתונים פתוחים שפורסמו ברשת על ידי צוותים שונים. בין המקורות תמצאו דאטהסטים של קוד, רדיט, טוויטר ומאמרים רפואיים. החומרים חוברו יחד לפורמט אחיד מבלי לבצע סינון של תכנים רגישים.

מה מייחד אותו בהשוואה למאגרי הוראות אחרים?

השילוב של גודל עצום יחד עם היעדר מוחלט של צנזורה יוצר בסיס ייחודי לאימון. הוא מכיל מגוון רחב מאוד של נושאים, החל מתכנות ועד בישול, תחת קורת גג אחת. המטרה המוצהרת שלו היא לתת מענה פתוח מול מודלים מסחריים סגורים שמסרבים לענות על נושאים מסוימים.

איך טוענים

הנתונים יושבים בקובץ בודד בשם Everything_Instruct.json בתוך המאגר, ללא צורך באישור גישה מיוחד. בגלל שמדובר במיליוני רשומות, מומלץ לוודא שיש לכם מספיק זיכרון עבודה ואחסון לפני שאתם מנסים לטעון את כל הקובץ לזיכרון בבת אחת. מבנה הרשומות מבוסס על פורמט אלפקה הרגיל, כך שהוא כולל שדות של הוראה, קלט ופלט.

from datasets import load_dataset

ds = load_dataset("rombodawg/Everything_Instruct")

הרישיון

המאגר מפורסם תחת רישיון apache-2.0, שמאפשר שימוש מסחרי, שינוי והפצה של הנתונים והמודלים שתאמנו עליהם. הרישיון דורש מתן קרדיט מתאים ושמירה על הודעות זכויות היוצרים המקוריות. עם זאת, מכיוון שהאוסף מורכב ממאגרים רבים ושונים, כדאי לבדוק את התנאים של מקורות המקור כדי לוודא שאין ביניהם סתירות משפטיות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗