GPT
L

LongAlpaca-12k

קוד פתוח

Yukangרישיון לא דווח2023-10-09

המאגר מכיל דוגמאות עוקבות הוראה באורך גבוה שנועדו לאימון מודלים על חלונות הקשר רחבים. הוא מספק שילוב מובנה של שאלות ותשובות ארוכות לצד דגימות קצרות כדי למנוע שחיקה בביצועים רגילים.

  • 1,106הורדות בחודש
  • 87לייקים

מה זה

המאגר בנוי משני חלקים עיקריים שכוללים יחד 12 אלף דוגמאות של הוראה ומענה. תשעת אלפים רשומות מתוכן הן שאלות ותשובות על טקסטים ארוכים, שנאספו מתוך ספרים ומאמרים אקדמיים. שלושת אלפים הרשומות הנותרות נדגמו ישירות מתוך הדאטהסט המקורי של סטנפורד אלפקה, במטרה לשמר את היכולת של המודל לענות על פרומפטים קצרים ופשוטים מבלי לאבד חדות.

המבנה הפנימי של הרשומות שונה מפורמט האלפקה המוכר בכך שנמחק ממנו השדה הנפרד לקלט. כל דוגמה מורכבת משני שדות בלבד, הוראה ומענה, כאשר תוכן המקור של הספר או המאמר מוטמע ישירות בתוך שדה ההוראה עצמו. תהליך חילוץ הטקסט מהספרים והמאמרים התבסס על כלי המרה ייעודי מקובצי פידיאף תוך שימוש במודלים של זיהוי תווים ומקטעים.

מתאים ל

  • אימון מודל להקשר ארוך

    כוונון עדין של מודלי שפה להבנת מסמכים, ספרים או מאמרים ארוכים במיוחד.

  • בדיקת הסקת מסקנות מטקסט

    בחינת יכולת המודל לשלוף פרטים ולענות על שאלות מתוך פסקאות רבות ברצף.

  • שימור יכולות בסיס

    אימון משולב שמונע התדרדרות במענה להוראות קצרות במקביל להרחבת ההקשר.

איפה זה נופל

הנתונים נשענים על סריקות של ספרים ומאמרים באנגלית, ללא ייצוג לשפות אחרות וללא כיסוי לעברית. תהליך ההפקה התבסס על כלי פענוח טקסט ממסמכים סרוקים, מה שעלול להכניס שגיאות זיהוי תווים או שיבושים במבנה הטקסט המקורי. בנוסף, הכרטיס מציג רק משימות קריאה ומענה ומזניח מטלות ארוכות אחרות כמו כתיבת קוד מורכב או סיכום דו-שיח רב שלבי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, השימוש המסחרי אסור לחלוטין. לפי כרטיס הדגם והפרויקט בגיטהאב, הנתונים שוחררו תחת רישיון CC-BY-NC 4.0 למטרות מחקר בלבד. הגבלה זו חלה גם על המודלים שתאמנו בעזרת המאגר הזה.

האם הדאטהסט כולל תוכן בעברית?

המאגר אינו מכיל דוגמאות בעברית. כל הטקסטים שנאספו מבוססים על מאמרים וספרים באנגלית, לצד דגימות ממאגר אלפקה המקורי. כדי לעבוד בעברית תידרשו לתרגם את הנתונים או לייצר דוגמאות מקומיות באותו פורמט.

איך נאסף המידע של הדוגמאות הארוכות?

המחברים השתמשו בכלי ייעודי שפיתחו להמרת קובצי פידיאף של ספרים ומאמרים לטקסט נקי. הטקסטים האלה חוברו לשאלות ומשימות באורכים שונים כדי לייצר את תבנית ההוראות. בסך הכל הופקו בדרך זו תשעת אלפים דוגמאות ארוכות.

במה הוא שונה ממאגר אלפקה המקורי של סטנפורד?

אלפקה המקורי מכיל בעיקר הוראות קצרות מאוד שלא מאפשרות ניצול חלונות הקשר גדולים. המאגר הזה לוקח שלושת אלפים דוגמאות מאלפקה ומוסיף להן תשעת אלפים דוגמאות ארוכות ומורכבות. בנוסף, מבנה הרשומה צומצם לשני שדות בלבד ללא שדה קלט נפרד.

איך טוענים

הנתונים מרוכזים בקובץ ג'ייסון בודד בשם LongAlpaca-12k.json, שזמין להורדה ישירה מתוך המאגר ללא צורך בהרשאה מיוחדת או בחשבון מאושר. כל רשומה כוללת את המחרוזות instruction ו־output, כך שניתן לטעון את הקובץ ישירות בפייתון או דרך ספריית הדאטהסטים של האגינג פייס. לפני שרצים לאמן, צריך לקחת בחשבון שאורך ההוראות בחלק הארוך דורש חלוקה מותאמת למקטעים ותמיכה בזיכרון גרפי גבוה, במיוחד אם עובדים עם ארכיטקטורות של שלושים ושניים אלף טוקנים ומעלה כפי שהמחברים מציעים.

from datasets import load_dataset

ds = load_dataset("Yukang/LongAlpaca-12k")

הרישיון

למרות שבדף הראשי של המאגר הרישיון מסומן כלא מדווח, הטקסט והפרויקט בגיטהאב קובעים רישיון מסוג CC-BY-NC 4.0 עבור הנתונים והמשקולות. המשמעות היא שהשימוש מותר למטרות מחקר בלבד, ואסור לכל פעילות מסחרית. מודל שיאומן על הדאטהסט הזה כפוף למגבלות האלה ולא יוכל לשרת מוצר מסחרי.

הרישיון המלא ב־Hugging Face ↗