GPT
Y

Yarn-Mistral-7b-128k

קוד פתוח

NousResearchapache-2.02023-10-31

  • transformers
  • pytorch
  • mistral
  • text-generation
  • custom_code

גרסה מורחבת של מיסטרל שפותחה כדי לקרוא מסמכים שלמים בלי להיחנק. הפתרון למי שרוצה חלון עבודה עצום במודל קל משקל יחסית.

  • 32,768טוקנים בהקשר
  • 13.5 GBמשקל הקבצים
  • 683הורדות בחודש
  • 574לייקים

מה זה

מדובר בהרחבה ישירה של המודל הפתוח מיסטרל שבעה מיליארד, שעבר אימון המשך של 1,500 צעדים בשיטה שנקראת YaRN. המטרה כאן ברורה, לדחוף את חלון ההקשר לתקרה של מאה עשרים ושמונה אלף טוקנים בלי לשבור את ההבנה הבסיסית של הטקסט.

במבחני הפרפלקסיטי, ככל שהטקסט מתארך המדד דווקא משתפר מ־3.08 בטווח של שמונת אלפים טוקנים ועד 2.19 בטווח המלא של מאה עשרים ושמונה אלף. לצד זה, המבחנים הקצרים מראים ירידה קלה מאוד ביכולות הכלליות, למשל ירידה מ־64.16 ל־60.64 בציון MMLU מול מודל הבסיס.

מתאים ל

  • עיבוד ספרים ומסמכים

    קריאה וניתוח של קבצי טקסט ענקיים באנגלית במכה אחת בזכות חלון של מאה עשרים ושמונה אלף טוקנים.

  • תחקור מסדי נתונים בטקסט

    הזנת כמויות גדולות של לוגים או תיעוד טכני ארוך ישירות לתוך הפרומפט בלי לפצל לחתיכות.

  • מחקר על הקשר ארוך

    בדיקת שיטת YaRN ויציבות המודל בעומסים של עשרות אלפי טוקנים על בסיס קוד פתוח.

איפה זה נופל

המודל מוגדר רשמית לשפה האנגלית בלבד, כך שאין כאן התאמה לשפות אחרות. מעבר לזה, כדי להריץ אותו חייבים לאפשר הרצת קוד מרוחק בספרייה, דרישה שמרימה גבה מבחינת אבטחת מידע בארגונים מסודרים.

בנוסף, רואים פגיעה מסוימת בביצועים במשימות קצרות וקלאסיות בהשוואה למיסטרל המקורי, כמו ירידה קלה בבדיקות ידע והיגיון דוגמת ARC ו־Hellaswag.

אותה משפחה

Yarn-Mistral יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

הכרטיס מציין אנגלית בלבד. מודל הבסיס מכיר מעט שפות אחרות, אבל כאן אין שום ערובה לאיכות הפלט או ליציבות הטוקנייזר בטקסט מקומי ארוך.

למה חובה לסמן trust remote code בטעינה?

המימוש של YaRN דורש שכבות וחישובים מותאמים שאינם חלק מהקוד הסטנדרטי הישן של transformers. המשמעות היא שאתם מריצים קוד שנמשך ישירות מהמאגר של המפתח.

איך מריצים

המשקל הכולל של הקבצים עומד על 13.5 גיגה בייט בפורמט bfloat16. כדי לטעון אותו תצטרכו כרטיס מסך עם לפחות שישה עשר עד עשרים וארבעה גיגה בייט זיכרון, במיוחד אם אתם באמת מתכננים לנצל את כל עומק חלון הטוקנים ולא סתם לטעון את המשקלים.

הטעינה מתבצעת בספריית transformers עם הגדרת flash attention 2 ודרישה מפורשת להפעלת קוד מרוחק. אם אין לכם חומרה ייעודית מקומית שמסוגלת להחזיק הקשר ארוך בזיכרון, פנייה לשרת ענן ייעודי תהיה הרבה יותר מעשית מהרצה עצמאית.

from transformers import pipeline

pipe = pipeline("text-generation", model="NousResearch/Yarn-Mistral-7b-128k")
print(pipe("שלום"))

הרישיון

הרישיון הוא אפאצ׳י שתיים אפס. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗