GPT
G

guanaco-llama2-1k

קוד פתוח

mlabonneרישיון לא דווח2023-07-23

המאגר כולל אלף דוגמאות שיחה שעברו התאמה מדויקת למבנה הפרומפטים של מודלי Llama 2. הוא חוסך את הצורך לפרמט ידנית נתונים מורכבים כשרוצים להריץ אימון קצר ומהיר.

  • 1,243הורדות בחודש
  • 167לייקים

מה זה

המאגר מכיל תת קבוצה של אלף דוגמאות בלבד, שנלקחו ישירות מתוך הדאטהסט המוכר timdettmers/openassistant-guanaco. במקור מדובר בשיחות מגוונות שנאספו ונוצרו במסגרת פרויקט OpenAssistant, אך כאן הן עברו עיבוד מחדש כדי להתאים לתבנית הפנייה והתשובה הנדרשת עבור מודלי Llama 2 צ'אט, כפי שהוגדרה בפרסומים של Hugging Face.

היוצר בנה את הקובץ באמצעות מחברת Colab ייעודית, במטרה ללוות מדריך מעשי לאימון מודל בסביבת עבודה חינמית או קלה. הרשומות כוללות את רצף השיחה כשהוא כבר עטוף בתגיות המיוחדות של המודל, כך שאין צורך להתעסק בבניית סקריפטים של חיתוך וסידור טקסט לפני שמתחילים לאמן.

מבחינת חלוקה, המאגר מציג קובץ אימון יחיד ואינו מחולק מראש לחלקי אימות או בדיקה נפרדים. כל החומר מרוכז במקום אחד, במטרה לספק נקודת התחלה מיידית למי שרוצה לבדוק תהליך של כוונון עדין בלי להמתין שעות לקריאה ועיבוד של קבצי ענק.

מתאים ל

  • בדיקת תהליך אימון ב־Colab

    הרצה מהירה של אימון ניסיון כדי לוודא שהקוד, הזיכרון והספריות עובדים חלק לפני מעבר לדאטהסט מלא.

  • כוונון עדין למודלי צ'אט

    אימון ראשוני על פורמט התגיות הייעודי של Llama 2 כדי לראות איך המודל מגיב למבנה השיחה.

  • הדגמות ומדריכים

    שימוש בקובץ קל ומוכן מראש לכתיבת פוסטים טכניים או סדנאות בלי להסתבך בהכנת נתונים.

איפה זה נופל

אלף דוגמאות זה מעט מאוד, וזה לא יספיק לבניית מודל יציב לייצור או לכיסוי רחב של משימות מורכבות. הדאטהסט נבנה מתוך מקור חיצוני ולא עבר סינון נוסף מעבר להתאמת הפורמט, כך שהטיות או שגיאות שהיו במקור נשארו גם כאן. בנוסף, אין בכרטיס שום פירוט על תמיכה בעברית, וסביר להניח שרובו המוחלט באנגלית ובשפות נפוצות אחרות.

אותה משפחה

guanaco-llama2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

לא מומלץ להסתמך עליו למוצר מסחרי מכיוון שלא הוגדר לו רישיון רשמי בעמוד. בנוסף, צריך לבדוק את תנאי השימוש של דאטהסט המקור של Guanaco ולוודא שהם מתירים את הפעילות שלכם.

האם יש במאגר שיחות בעברית?

כרטיס הנתונים לא מדווח על קיום שפות שאינן אנגלית. מאחר שמדובר בדגימה קטנה של אלף רשומות מפרויקט בינלאומי, הסיכוי למצוא שם עברית איכותית אפסי, ולא הייתי בונה עליו למשימות בשפה זו.

כמה המאגר שוקל וכמה זמן לוקח להוריד אותו?

הוא כולל אלף רשומות בלבד המאוחסנות בקובץ Parquet בודד, כך שהמשקל זניח לחלוטין. ההורדה והטעינה לוקחות שניות ספורות בכל סביבת עבודה, כולל מחשב אישי או מחברת ענן.

מה ההבדל בין הדאטהסט הזה לבין Guanaco המקורי?

הנתונים כאן הם רק אלף דוגמאות שנלקחו מהמאגר המלא ועברו המרה ישירה למבנה הפרומפט שדורש Llama 2. אין כאן נתונים חדשים, אלא רק התאמת פורמט שמקצרת תהליכי עבודה.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets עם המזהה mlabonne/guanaco-llama2-1k, בלי צורך בבקשת גישה מיוחדת או אישור מוקדם. הנתונים שמורים בקובץ Parquet בודד שכולל את פיצול האימון, כך שההורדה מסתיימת תוך שניות בודדות גם בחיבור ביתי רגיל.

הטקסט שמור כבר כמחרוזת מוכנה להזנה למודל, עם כל התחביר והמבנה הנכון של Llama 2, ולכן לא נדרש שלב עיבוד מקדים של הטוקניזציה מעבר לחיתוך לפי אורך ההקשר שלכם.

from datasets import load_dataset

ds = load_dataset("mlabonne/guanaco-llama2-1k")

הרישיון

בעמוד המאגר לא דווח רישיון כלל. במצב כזה אין אישור מפורש לשימוש מסחרי, וכל שילוב שלו במוצר סופי כרוך בסיכון משפטי. אם אתם מתכננים משהו מעבר לבדיקה פנימית, חובה לבדוק קודם את תנאי הרישיון של דאטהסט המקור timdettmers/openassistant-guanaco ואת תנאי השימוש של Llama 2 עצמה.

הרישיון המלא ב־Hugging Face ↗