GPT
L

Llama-3-70B-Instruct-Gradient-1048k

קוד פתוח

gradientaillama32024-05-03

  • transformers
  • safetensors
  • llama
  • text-generation
  • meta

גרסה מורחבת ללאמה 3 בגודל 70B, שמותחת את ההקשר מ־8k ליותר ממיליון טוקנים. פתרון מתאים למי שחייב לעבד קוד שלם או ספרים בפרומפט יחיד בלי לחתוך מידע.

  • 71Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 131 GBמשקל הקבצים
  • 72הורדות בחודש

מה זה

המודל לוקח את הדגם המקורי של מטא ומאמן אותו בהדרגה על אורכי רצף עולים, החל מ־65k ועד 1048k, באמצעות שינוי RoPE theta וטכנולוגיית RingAttention. האימון התבצע על פחות מ־0.003 אחוז מכמות הטוקנים המקורית של לאמה 3, תוך שילוב דאטהסטים כמו SlimPajama ו־UltraChat. הוא יודע לעבד שיחות ארוכות במיוחד ולבצע משימות טקסט מורכבות.

ההבדל המשמעותי מול המקור הוא היכולת לבלוע קלטים עצומים בלי לאבד את ההתחלה. מבחן המחט בערימת שחת שנערך על המודל בדק עומקים שונים עד לאורך של 1,140,200 טוקנים, ונועד להראות שהוא מסוגל לאתר מידע ספציפי גם כשהקלט מלא במסמכים מסיביים, ולא רק לטעון שהוא תומך בחלון כזה.

מתאים ל

  • ניתוח בסיסי קוד מלאים

    מאפשר לטעון עשרות קבצי מקור יחד לפרומפט אחד כדי לאתר באגים ותלויות מורכבות בלי לחלק את המידע לחלקים.

  • תחקור ארכיונים ומסמכים

    מתאים לסריקת מאות עמודים של דוחות כספיים או ספרות מקצועית ואיתור עובדות ספציפיות מתוכם.

  • סוכן שיחה עם היסטוריה ארוכה

    מאפשר לנהל אינטראקציות רציפות בלי צורך לסכם או למחוק את תחילת השיחה לאורך זמן.

איפה זה נופל

בסיס המודל אומן ונבדק באנגלית בלבד. אם תזינו לו טקסטים בעברית בהיקף גדול, איכות הפלט תרד והוא עלול להמציא דברים או לאבד עקביות. בנוסף, חלון הקשר ענק לא מבטיח הבנה מעמיקה לאורך כל הדרך, והאימון הנוסף על כמות קטנה יחסית של טוקנים עלול לפגוע ביכולות חשיבה כלליות שהיו למודל המקורי. חובה לבדוק איבוד ביצועים במשימות קצרות לפני שמכניסים אותו למערכת.

אותה משפחה

Llama-3-70B-Instruct-Gradient יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב מקומי חזק?

לא, המודל שוקל 131 גיגה-בייט ודורש לפחות שני כרטיסי מסך ארגוניים עם 80 גיגה זיכרון רק כדי להיטען. מחשב שולחני רגיל ייכשל מיד מחוסר זיכרון.

איך המודל מתמודד עם טקסטים בעברית?

הכרטיס מציין שהאימון והבדיקות נעשו באנגלית בלבד. הוא עשוי להבין עברית בסיסית, אבל הוא לא מיועד לכך וצפויות טעויות רבות בטקסטים ארוכים.

איך מריצים

כדי להריץ אותו במשקל מלא של 131 גיגה-בייט בפורמט bfloat16, תצטרכו שרת עם לפחות שני כרטיסי A100 או H100 של 80 גיגה, או לחלופין מערך מרובה כרטיסי L40S. כרטיס בודד לא יחזיק אפילו את המשקלים בזיכרון, ועוד לא דיברנו על ה־KV cache המפלצתי שנוצר כשמתקרבים למיליון טוקנים בהקשר פעיל.

אם אין לכם קלאסטר ייעודי בענן או תקציב חומרה כבד, עדיף להשתמש ב־API של ספקי צד שלישי או לחכות לגרסאות מקוונטטות. ההרצה דורשת שימוש בספריית transformers וניהול חכם של זיכרון כדי לא לחטוף שגיאות חוסר זיכרון מיד עם פתיחת חלון קלט גדול.

from transformers import pipeline

pipe = pipeline("text-generation", model="gradientai/Llama-3-70B-Instruct-Gradient-1048k")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון llama3 של מטא. מותר להשתמש בו לצרכים מחקריים ומסחריים, אבל השימוש כפוף למדיניות השימוש המקובל שלהם ולהגבלות על מוצרים בעלי נפח משתמשים חודשי עצום.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗