GPT
F

flan_v2

קוד פתוח

SirNeuralapache-2.02023-02-13

  • flan
  • flan 2022
  • flan v2

גרסה מוכנה לשימוש של Flan V2 בקובצי JSONL דחוסים. המאגר חוסך את הצורך לבנות ידנית עשרות משימות מבוססות הוראות דרך TensorFlow Datasets.

  • 1,097הורדות בחודש
  • 200לייקים

מה זה

המאגר מבוסס על אוסף Flan V2 של גוגל, ומכיל נתונים ממקורות שונים ובהם Flan 2021, אוסף T0 של P3, משימות Super-Natural Instructions, שרשראות חשיבה ושיחות. המפרסם אינו קשור למחקר המקורי, אלא הרכיב את הנתונים ומסר אותם בפורמט קריא יותר לאחר פתרון בעיות גרסה והורדות ידניות.

כל רשומה בנויה ממבנה אחיד של שלושה שדות: input, target, ו־task. הנתונים מחולקים לקבצים נפרדים לפי שילובים שונים של הגדרות. החלוקה כוללת משימות Zero-Shot או Few-Shot, וכן מקרים שבהם אפשרויות התשובה מופיעות בתוך ההקשר כשאלות רב-ברירה לעומת מקרים ללא אפשרויות מובנות.

לפי הכרטיס, יוצרי האוסף ממליצים לבדוק יחסי ערבוב שונים בין המשימות כדי לקבל תוצאות מיטביות באימון. כל המידע במאגר מוגדר כחלק מאימון, ללא חלוקות רשמיות לוולידציה או למבחן בתוך הקבצים עצמם.

מתאים ל

  • אימון מודל לעקיבה אחר הוראות

    כוונון עדין של מודלים פתוחים על מגוון פורמטים של שאלות, הנחיות ואפשרויות בחירה.

  • שיפור שרשראות חשיבה

    שימוש בקובצי Chain-of-thought כדי ללמד מודל לפרק בעיות מורכבות לשלבים.

  • בניית סוכני שיחה

    אימון על קובצי dialog_fs ו־dialog_zs לשיפור התנהגות מודלים בדיאלוג מרובה צעדים.

איפה זה נופל

הכרטיס לא מפרט שפות מלבד משימות ספציפיות כמו CzEng הצ'כי או Yandex 1M, כך שרוב המוחלט של התוכן הוא באנגלית ואין עדות לטקסטים בעברית. בנוסף, מדובר בעיבוד צד שלישי שנשען על תיקוני גרסאות ידניים של חבילות ישנות מ־2023. אין במאגר פיצול מובנה לבדיקה אלא רק נתוני אימון, ולכן חובה להפריד דוגמאות עצמאית כדי לא לגרום לזליגת מידע בהערכת המודל שלכם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן. הרישיון המדווח הוא Apache 2.0 שמתיר שימוש מסחרי מלא. עליכם לכלול את תנאי הרישיון וייחוס מתאים בקוד או בתוצר.

האם הדאטהסט כולל נתונים בעברית?

הכרטיס אינו מציין עברית כלל. רוב המשימות מגיעות ממקורות NLP סטנדרטיים באנגלית, לצד קורפוסים ספציפיים כמו CzEng ותרגומי Yandex, כך שאינו מתאים לאימון ייעודי בעברית.

כמה המאגר שוקל בפועל?

הנפח המדויק הכולל לא צוין, אך מדובר במאות גיגה-בייט. חלק אחד בלבד פוצל למספר קבצים דחוסים בגודל 45GB כל אחד, ולכן נדרש נפח אחסון גדול מאוד לפריקה ועיבוד.

איך המאגר הזה שונה מ־Flan V2 המקורי של גוגל?

גוגל פרסמה קוד לבנייה ידנית שדרש תיקוני גרסאות והורדות נפרדות. המשתמש SirNeural בנה את המשימות, ייצא אותן לקובצי JSONL דחוסים, והעלה אותם כדי לחסוך את תהליך ההפקה.

איך טוענים

הנתונים מחולקים ל־23 קבצי jsonl.gz ישירים שאינם דורשים אישור גישה. יש לקחת בחשבון שמדובר בנפחים משמעותיים, כאשר הקובץ של משימות Few-Shot עם אפשרויות פוצל לחלקים של 45GB כל אחד. כדי לפתוח אותו יש לאחד את החלקים בטרמינל באמצעות פקודת cat אל gunzip ולקבל קובץ JSONL מלא. השדות שמעניינים אתכם בקריאה הם input להוראה, target לתשובה, ו־task לסינון המשימות שמתאימות לכם.

from datasets import load_dataset

ds = load_dataset("SirNeural/flan_v2")

הרישיון

המאגר מפורסם תחת רישיון apache-2.0. הרישיון מאפשר שימוש מסחרי, שינוי והפצה, ומתיר לאמן מודלים על הנתונים לכל מטרה. התנאי המרכזי הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי, ללא דרישה להפיץ תוצרי המשך תחת אותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗