GPT
C

cosmopedia

קוד פתוח

HuggingFaceTBapache-2.02024-02-18

  • synthetic

זהו מאגר עצום של טקסטים סינתטיים שנכתבו על ידי Mixtral למטרות אימון. הוא נועד לספק תוכן לימודי נקי במקום גרידה גולמית ורועשת של הרשת.

  • 26,940הורדות בחודש
  • 743לייקים

מה זה

כל רשומה מכילה קטע טקסט סינתטי יחד עם הפרומפט שייצר אותו, מקור המידע ששימש כבסיס, קהל היעד, הפורמט וכמות הטוקנים. התוכן נוצר על ידי Mixtral-8x7B-Instruct-v0.1 שקיבל קטעי מקור ממגוון מאגרים ונתבקש לכתוב אותם מחדש כספרי לימוד, פוסטים, סיפורים או מאמרי הדרכה.

המאגר מחולק לשמונה חלקים לפי מקורות המידע. שני החלקים הגדולים מבוססים על דגימות רשת שעברו חלוקה לאשכולות נושאיים וסינון של תכנים לא לימודיים. שאר החלקים מבוססים על סילבוסים מסטנפורד, חומרי לימוד מ־OpenStax ומ־Khan Academy, שאלות מ־UltraChat ו־OpenHermes עבור סיפורים, וטקסטים מדעיים מ־AutoMathText. היוצרים הפעילו סינון כפילויות של MinHash והסירו דליפות של מבחני ביצועים מוכרים כמו MMLU ו־ARC.

מתאים ל

  • אימון מודלי שפה קטנים

    טקסט סינתטי מובנה מספק איכות למידה גבוהה ומאפשר לבנות מודלים קומפקטיים יעילים.

  • העשרת ידע מדעי ולימודי

    החלקים של סטנפורד ו־OpenStax מתאימים לחיזוק יכולות הוראה, פתרון בעיות והסבר מושגים.

  • מחקר על דאטה סינתטי

    השוואת ביצועי אימון מול נתוני רשת גולמיים ובדיקת תופעות כמו חזרתיות והזיות.

איפה זה נופל

החומר כולו באנגלית בלבד. אין כאן עברית ולא תמצאו פה נתונים מקומיים. מעבר לכך, כל הטקסט מיוצר על ידי מודל שפה, ולכן הוא כולל הטיות סגנוניות של מודלים, טעויות עובדתיות סמויות והזיות פוטנציאליות. למרות מאמצי הגיוון בפרומפטים, קיימת חזרתיות מבנית בחלק מהטקסטים. המאגר מוגדר כגרסה v0.1 ולא כולל בקרת איכות אנושית על כל קובץ.

אותה משפחה

cosmopedia יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

כן. הרישיון הוא Apache 2.0, שמאפשר שימוש מסחרי מלא, כולל אימון מודלים סגורים או פיתוח מוצרים, בתנאי ששומרים על תנאי הייחוס של הרישיון.

האם יש בדאטהסט טקסטים בעברית?

לא. המאגר מוגדר ומכיל טקסטים באנגלית בלבד. אם אתם צריכים לאמן מודל לעברית, החומר הזה לא מתאים.

איך נאסף המידע?

החוקרים אספו קטעי מקור מסילבוסים אקדמיים, ספרי לימוד, מאגרים מתמטיים ודגימות רשת מסוננות. לאחר מכן הם הזינו את הקטעים האלה למודל Mixtral-8x7B וביקשו ממנו לכתוב אותם מחדש בפורמטים שונים.

במה הוא שונה ממאגרי רשת רגילים?

מאגרי רשת רגילים מכילים טקסט גולמי, פרסומות ושפה יומיומית. כאן כל הטקסט עבר שכתוב מודרך על ידי מודל שפה כדי לייצר מבנה לימודי נקי, ממוקד ומותאם לרמות קריאה שונות.

איך טוענים

טוענים תת-מאגר ספציפי דרך ספריית datasets בפייתון בעזרת הפקודה load_dataset עם ציון שם החלק, למשל stories, וחלוקת train. אין צורך באישור גישה או בהרשמה מיוחדת. הנתונים שמורים בקובצי parquet המחולקים לקבוצות. בכל רשומה חשוב לשים לב לשדות text שמכיל את התוכן, seed_data שמציין את המקור, ו־audience שמגדיר את רמת המורכבות. אם המאגר המלא כבד מדי, היוצרים שחררו גרסה מוקטנת של מאה אלף דוגמאות.

from datasets import load_dataset

ds = load_dataset("HuggingFaceTB/cosmopedia")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי, הפצה ואימון מודלים ללא תשלום תמלוגים. אתם נדרשים לשמור על הודעת זכויות היוצרים והרישיון המקורי. אין חובה לשתף נגזרות או מודלים שתאמנו תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗