GPT
L

LongAlign-10k

קוד פתוח

zai-orgרישיון לא דווח2024-01-29

  • Long Context
  • sft

עשרת אלפים הוראות באורך שנע בין 8k ל־64k טוקנים שנועדו לאימון מודלים על הקשר ארוך במיוחד. מי שבונה מודל שיחה ומגלה שהוא קורס כשהמסמך מתארך מעבר לכמה עמודים ימצא פה מענה ישיר.

  • 4,873הורדות בחודש
  • 100לייקים

מה זה

המאגר כולל עשרת אלפים דוגמאות של מעקב אחר הוראות ומענה על שאלות בהקשרים ארוכים, בטווח שבין שמונת אלפים לשישים וארבעה אלף טוקנים. הנתונים מיועדים למשימות יישור של מודלי שפה, במטרה לשמור על יכולת שיחה ודיוק גם כשהקלט מכיל מסמכים כבדים במיוחד, מבלי לאבד את הקשר או לסטות מההנחיות של המשתמש לאורך הדרך.

התוכן עצמו כתוב באנגלית ובסינית, ומבוסס על המחקר שפרסם צוות THUDM שפיתח במקביל גם את מודלי הסדרה על בסיס Llama ו־ChatGLM3. כרטיס המאגר לא מפרט את אופן איסוף הדוגמאות, תהליכי הסינון או המקורות המדויקים שמהם נוצר הטקסט, ומפנה ישירות למאמר האקדמי ולקוד הפרויקט בגיטהאב כדי להבין את אסטרטגיות האימון שיושמו עליו.

מתאים ל

  • אימון הקשר ארוך

    כוונון עדין של מודלי שפה לעבודה יציבה עם טקסטים באורך של עד 64k טוקנים.

  • מענה על שאלות ממסמכים

    לימוד המודל לחלץ תשובות מדויקות מתוך קבצים ארוכים באנגלית ובסינית.

  • מחקר על אסטרטגיות אימון

    בדיקת שיטות חלוקה לקבוצות ואיזון שגיאות באימון על הקשרים כבדים במיוחד.

איפה זה נופל

אם אתם מכוונים למוצר בעברית, המאגר הזה פשוט לא מתאים לכם כי הוא כולל רק אנגלית וסינית. מעבר למחסום השפה, כרטיס הדאטהסט לא מפרט כיצד הטקסטים סוננו, האם יש בהם עובדות שגויות, או מה מידת ההטיה של המידע. מי שמתכנן לאמן מודל פרודקשן יצטרך לבצע בדיקות איכות עצמאיות על הדגימות לפני שדוחפים אותן לתהליך האימון.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה לפיתוח מוצר מסחרי?

לא כדאי להסתכן כרגע. היוצרים לא ציינו שום רישיון בעמוד הרשמי, וללא היתר מפורש אין לכם זכות חוקית להשתמש בנתונים למטרות רווח. יש לבדוק את הרישיון במאגר הגיטהאב או במאמר לפני שמתחילים לעבוד איתו.

האם הדאטהסט מכיל נתונים בעברית?

לא. המאגר מוגדר רשמית רק עבור אנגלית וסינית, ואין בו תמיכה בשפות אחרות. אם אתם בונים מודל לעברית תצטרכו לתרגם את החומר בעצמכם או לחפש מקורות מקבילים.

מאיפה נאספו עשרת אלפים הדוגמאות שבמאגר?

כרטיס המאגר לא מסביר מאיזה מקורות הגיע הטקסט או איך סיננו אותו. כל המידע המחקרי נמצא במאמר האקדמי של LongAlign, כך שלא ניתן לדעת מהעמוד עצמו האם מדובר בטקסטים סינתטיים או אמיתיים.

איך טוענים

טוענים את הקובץ long.jsonl ישירות מספריית הדאטהסטים או מורידים אותו מהמאגר הפתוח, שכולל שלושה קבצים בלבד. אין צורך לבקש אישור גישה מוקדם כדי להוריד את הנתונים, אך בגלל אורכי ההקשר הקיצוניים של עשרות אלפי טוקנים, תצטרכו להכין מראש ארכיטקטורת אימון מתאימה, כמו שרשור דגימות או קיבוץ לפי אורך, כדי למנוע קריסת זיכרון במעבדים הגרפיים.

from datasets import load_dataset

ds = load_dataset("zai-org/LongAlign-10k")

הרישיון

היוצרים לא דיווחו על רישיון שימוש בעמוד המאגר. מבחינה משפטית, היעדר רישיון אומר שאין לכם היתר מפורש להשתמש בנתונים, בטח שלא במוצר מסחרי. כל אימון של מודל על בסיס הדאטהסט הזה חושף אתכם לסיכון משפטי, ומומלץ לבדוק את הרישיון במאמר המקורי או במאגר הקוד בגיטהאב לפני שנוגעים בקבצים.

הרישיון המלא ב־Hugging Face ↗