GPT
Y

Yarn-Llama-2-13b-128k

קוד פתוח

NousResearchרישיון לא דווח2023-08-30

  • transformers
  • pytorch
  • llama
  • text-generation
  • custom_code

גרסת מחקר שפותחת חלון עבודה ענק של 128 אלף טוקנים על בסיס לאמה 13B. היא מיועדת למי שחייב לבלוע ספרים או קבצים שלמים בלי לחתוך אותם לחתיכות קטנות.

  • 131,072טוקנים בהקשר
  • 24.2 GBמשקל הקבצים
  • 423הורדות בחודש
  • 113לייקים

מה זה

מדובר בהרחבה ישירה של מודל הבסיס Llama 2 בגודל 13 מיליארד פרמטרים, שפותחה כדי להתמודד עם טקסטים ארוכים במיוחד. הצוות אימן אותו מחדש במשך 600 צעדים בלבד על גבי תת קבוצה מתוך מאגר הספרים PG19, תוך שימוש בשיטת YaRN כדי למתוח את חלון ההקשר עד 131,072 טוקנים. השינוי הטכני המרכזי כאן לעומת הגרסה המקורית הוא שילוב ישיר של Flash Attention 2, שנועד לחסוך זיכרון ולהאיץ את החישוב באורכים האלה.

בפועל, היכולת הזו מתמקדת בניתוח והשלמה של רצפי טקסט מסיביים, כמו קריאת מסמכים טכניים שלמים, ספרות או מאגרי נתונים גולמיים שלא נכנסו במודלים קודמים. עם זאת, היוצרים השאירו את סעיף המבחנים והמדידות בכרטיס המודל תחת הכיתוב TODO ולא הציגו תוצאות ביצועים רשמיות. אתם מקבלים כאן ניסוי טכנולוגי בהרחבת קשב, ולא גרסה שעברה בדיקות איכות השוואתיות מסודרות מול מודלים מתחרים.

מתאים ל

  • עיבוד ספרים ומסמכים מלאים

    קריאה וניתוח של קבצים שלמים בבת אחת בזכות תמיכה ב־128 אלף טוקנים.

  • השלמת טקסט טכני רציף

    המשך כתיבה של חומרים ארוכים מתוך הבנת הקשר רחב וללא צורך בקיטוע.

  • בסיס לכוונון עצמאי

    תשתית טובה לאימון מודל הוראות פרטי שמחזיק חלון הקשר ענק.

איפה זה נופל

זהו מודל בסיס שלא עבר כוונון להוראות או לצ'אט, כך שאין לו פורמט פרומפטים מוגדר. אם תשאלו אותו שאלה ישירה, הוא עשוי פשוט להמשיך את הטקסט במקום לענות. הכרטיס מציין במפורש שהאימון נמשך 600 צעדים בלבד, ושהיוצרים מתכננים בעתיד לאמן אותו עוד ולבצע instruct tuning. בנוסף, חסרות כל תוצאות מדידה מספריות, ולכן חובה לבדוק בעצמכם אם הוא שומר על עקביות לאורך כל 128 אלף הטוקנים או מאבד ריכוז באמצע.

אותה משפחה

Yarn-Llama-2 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מוכן לשימוש כצ'אטבוט?

לא. מדובר במודל בסיס גולמי שלא עבר אימון שיחה או התאמה להוראות, והוא רק משלים טקסט קיים. כדי לדבר איתו צריך לאמן אותו מחדש על דאטה של שיחות.

אפשר להריץ אותו בלי Flash Attention 2?

לא, הכרטיס מבהיר במפורש שהספרייה הזו נדרשת כדי שהמודל יפעל בצורה תקינה. חובה להתקין אותה יחד עם הרחבות ה־Rotary המתאימות.

איך מריצים

כדי להריץ אותו צריך להתקין את ספריית transformers יחד עם flash-attn והרחבות ה־Rotary ממאגר הגיטהאב של HazyResearch, כי בלעדיהן המודל לא עובד בצורה תקינה. קבצי המשקולות תופסים 24.2 גיגה בייט בדיוק bfloat16 על פני 40 שכבות, כך שבשביל לטעון אותו ולנצל את חלון ההקשר המלא תצטרכו כרטיס מסך חזק מאוד, כמו A100 עם 40 או 80 גיגה זיכרון.

אם אין לכם חומרה כזו מקומית, עדיף להשתמש בפתרון ענן מנוהל או בשירות API חיצוני. הרצה של חלון מלא של 128 אלף טוקנים על חומרה חלשה יותר פשוט תגרום לשגיאות זיכרון מידיות.

from transformers import pipeline

pipe = pipeline("text-generation", model="NousResearch/Yarn-Llama-2-13b-128k")
print(pipe("שלום"))

הרישיון

הרישיון של המודל מוגדר כלא דווח בדף הרשמי. המשמעות בפועל היא שאי אפשר לדעת אם מותר לשלב אותו במוצר מסחרי, להפיץ אותו מחדש או לבסס עליו שירות חיצוני בלי להסתכן בהפרת זכויות יוצרים, עד שהיוצרים יפרסמו תנאי שימוש ברורים.

הרישיון המלא בעמוד המודל ↗