GPT
F

FLAN

קוד פתוח

Open-Orcacc-by-4.02023-07-21

המאגר כולל את אוסף FLAN המלא של גוגל בפורמט קבצי Parquet מוכנים לשימוש. הוא חוסך תהליך עיבוד ידני מורכב ומשאבי מחשוב כבדים שנדרשים לחילוץ המקורי.

  • 16,370הורדות בחודש
  • 195לייקים

מה זה

הנתונים הם מימוש מלא של The FLAN Collection לפי התבניות הרשמיות של גוגל ממאגר ה־seqio שלהם, ללא סינון, צמצום או עריכה מצד המפרסמים. המאגר מורכב מחמישה אוספי ליבה הכוללים את CoT, Dialog, NIv2, T0 ו־flan2021. רשומות אלו משמשות לאימון מודלים על משימות מגוונות של מילוי הוראות ופתרון בעיות.

האוספים מחולקים לארבע תצורות שונות לפי אופי הפנייה והתשובה. יש הבחנה בין Zero-Shot שמציג הנחיה ישירה לבין Few-Shot שמקדים לה דוגמאות פתורות. בנוסף, קיימת חלוקה בין Options שמציע שאלות סגורות מרובות ברירות לבין No-Options שמחייב מענה חופשי. כל תת-מאגר כולל רק את התצורות שגוגל הגדירה עבורו במקור.

קבצי ה־JSON ברמת השורש שימשו את הצוות לדגימת נתונים עבור פרויקט OpenOrca. כל שאר הנתונים מחולקים לתיקיות משנה לפי האוסף והתצורה, ומכילים קבצי Parquet שנוצרו באמצעות Dask מתוך קובצי מקור בפורמט jsonl.

מתאים ל

  • אימון מודלים למילוי הוראות

    שימוש בתצורות Zero-Shot ו־Few-Shot כדי ללמד מודלים להתמודד עם משימות מגוונות ללא צורך בהכנת תבניות ייעודיות.

  • אימון שרשרת חשיבה

    טעינת תת-האוסף של CoT לצורך שיפור יכולות ההסקה והלוגיקה של המודל שלב אחר שלב.

  • בניית מודלים לשאלות ברירה

    שימוש בתצורות ה־Options של T0 ו־NIv2 כדי לאמן מודלים על שאלות סגורות ומבחנים מרובי תשובות.

איפה זה נופל

המאגר מכיל נתונים בשפה האנגלית בלבד, ואין בו ייצוג לשפות אחרות או התאמה לעברית. בנוסף, הנתונים הם תוצר ישיר של המרות תבניות ולא עברו בדיקת איכות ידנית או ניקוי רעלים מצד מעלי המאגר. כרטיס הדאטהסט לא מפרט אילו הטיות קיימות בתוך אוספי המקור של גוגל, ולכן חובה לבדוק את התכנים עצמם לפני שמשלבים אותם במודל שמיועד לייצור.

שאלות
נפוצות

האם המאגר כולל עברית?

לא. המאגר מוגדר ומכיל טקסטים באנגלית בלבד. אם המטרה היא אימון מודל לעברית, החומרים כאן לא יסייעו באופן ישיר.

האם מותר להשתמש בדאטהסט לאימון מודל מסחרי?

המאגר עצמו מפורסם תחת רישיון cc-by-4.0, אך הוא כולל אוספים רבים ממקורות שונים. היוצרים מציינים שהנתונים כפופים לרישיונות של רכיבי המקור המקוריים, כך שחובה לוודא את הרישיונות הפרטניים לפני הפצה מסחרית של מודל שאומן עליהם.

כמה נפח אחסון נדרש כדי להוריד את הנתונים?

האוסף המלא תופס כ־296 גיגה-בייט בפורמט Parquet. אין חובה להוריד את הכל, ואפשר למשוך רק תיקיות ספציפיות שנעות בין עשרות מגה-בייט לקבצים בודדים ועד כ־101 גיגה-בייט עבור התיקייה הגדולה ביותר.

איך המאגר הזה שונה מהורדה ישירה מגוגל?

החוקרים של גוגל שחררו את הקוד והתבניות ב־seqio, מה שדורש הורדה של מעל 400 גיגה-בייט ושרת עם 512 גיגה-בייט זיכרון כדי להריץ את העיבוד. המאגר של Open-Orca כבר ביצע את כל העבודה הכבדה ומספק את התוצאה המוגמרת כקבצי Parquet מוכנים לקריאה.

איך טוענים

אין צורך בבקשת גישה מיוחדת, המאגר פתוח להורדה ישירה. עם זאת, הוא שוקל כ־300 גיגה-בייט ומחולק ליותר מאלפיים קבצי Parquet ששוקלים כ־160 מגה-בייט כל אחד, כך שמומלץ להוריד רק את התיקייה הספציפית שמעניינת אתכם במקום את המאגר כולו. התיקייה הגדולה ביותר היא t0_fsopt_data שתופסת 101 גיגה-בייט, בעוד תיקיות כמו cot_zsopt_data שוקלות 20 מגה-בייט בלבד. טעינת הנתונים מתבצעת ישירות מקבצי ה־Parquet בחלוקה לפי תצורות הפרומפטים שמתאימות למבנה האימון שלכם.

from datasets import load_dataset

ds = load_dataset("Open-Orca/FLAN")

הרישיון

המאגר מדווח תחת רישיון cc-by-4.0 שמתיר שימוש מסחרי, שינוי והפצה תחת מתן קרדיט מתאים. יחד עם זאת, הכרטיס מציין במפורש שהנתונים כפופים לרישיונות של כל אחד ממאגרי המקור המרכיבים את האוסף. המשמעות היא שעליכם לבדוק את תנאי השימוש של כל תת-מאגר בנפרד לפני אימון מודל מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗