GPT
L

LLaMA-2-7B-32K

קוד פתוח

togethercomputerllama22023-07-26

  • transformers
  • pytorch
  • llama
  • text-generation
  • en

הרחבה של מודל שבעה מיליארד פרמטרים לחלון של שלושים ושניים אלף טוקנים. פתרון מתאים למי שרוצה לעבד מסמכים ארוכים על חומרה צנועה יחסית.

  • 32,768טוקנים בהקשר
  • 12.6 GBמשקל הקבצים
  • 6,352הורדות בחודש
  • 537לייקים

מה זה

הגרסה הזו לוקחת את הבסיס המוכר של מטא ומרחיבה את טווח הראייה שלו באמצעות אינטרפולציית מיקומים. במקום לעצור בטווח הקצר הרגיל, הוא מסוגל לקרוא רצפים באורך מלא של 32,768 טוקנים. תהליך האימון כלל המשך אימון מקדים על טקסטים ארוכים ממאגרי ספרים ומאמרים מדעיים, תוך סינון מכוון של כל קטע קצר מאלפיים מילים כדי להכריח אותו לנצל את המרחב.

אחרי האימון המקדים הוסיפו לו כוונון עדין על שאלות והנחיות שנארזו יחד לרצפים מלאים. התוצאה מכוונת ישירות למשימות כמו מענה על שאלות מתוך מספר מסמכים במקביל או סיכום של פרקים שלמים מתוך ספרים, בלי לפצל את המידע לחלקים קטנים שמקשים על שמירת ההקשר.

מתאים ל

  • מענה על שאלות מרובות מסמכים

    שליפת תשובה מתוך עשרות עמודי מידע בו זמנית, כשהמודל צריך להתעלם מקטעים לא רלוונטיים.

  • סיכום פרקים ומאמרים שלמים

    עיבוד של טקסטים רצופים באורך של עשרות אלפי מילים ליצירת תקציר מהודק בלי חיתוך באמצע.

  • בסיס לכוונון מותאם אישית

    התאמת המודל לדאטה פנימי ארוך באמצעות ספריות אימון ייעודיות שפותחו עבור הגרסה הזו.

איפה זה נופל

הכרטיס מודה מפורשות שהמודל עלול לייצר תוכן שגוי או מוטה, עניין מוכר בבסיס המקורי. בנוסף, מדובר במודל שמאומן באנגלית בלבד. אם תזרקו עליו טקסטים בעברית בהיקף גדול, הוא יתקשה מאוד להבין את ההקשר וקצב הטוקניזציה יקפוץ ויבזבז את החלון מהר. המודל שוחרר כבסיס גולמי יותר ומצריך בדיקה מעמיקה של יכולת איתור המידע בתוך ערימת הטקסט לפני שסומכים עליו במוצר אמיתי.

אותה משפחה

LLaMA-2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל עובד טוב בעברית?

האימון הרשמי הוגדר לשפה האנגלית בלבד, וכל המאגרים שצוינו היו באנגלית. אפשר להזין לו עברית, אבל צריכת הטוקנים תהיה לא יעילה והתוצאות יהיו פחות עקביות.

האם חייבים להתקין פלאש אטנשן כדי להריץ אותו?

לא חובה, הקוד תומך בהרצה רגילה דרך ספריית טרנספורמרס על ידי ביטול הקוד המרוחק. בפועל, על טקסטים באורך שלושים אלף טוקנים בלי האופטימיזציה הזו, הביצועים יהיו איטיים בהרבה.

איך מריצים

המשקל הכולל של הקבצים עומד על 12.6 גיגה בייט בדיוק חצי, כך שכרטיס מסך בודד עם 16 או 24 גיגה בייט זיכרון יספיק כדי לטעון אותו. עם זאת, הרצה של הקשר מלא שמגיע לקצה החלון תדרוש זיכרון עבודה נוסף עבור זיכרון המפתח והערך. כדי להפיק ממנו מהירות שמישה באורכים כאלה, היצרן ממליץ להשתמש בספריית פלאש אטנשן שתיים.

מי שאין לו כרטיס מתאים עם סביבת פיתוח של קודה יכול להשתמש בקריאות ישירות לממשק של טוגדר. אם כל מה שאתם צריכים זה ניסוי מהיר על טקסט ארוך פה ושם, צריכת המודל דרך שירות חיצוני תחסוך את כאב הראש של הקינפוג המקומי.

from transformers import pipeline

pipe = pipeline("text-generation", model="togethercomputer/LLaMA-2-7B-32K")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון לאמה שתיים הרשמי. המשמעות היא שמותר להשתמש בו לצרכים מסחריים ופנימיים במוצר שלכם, כל עוד כמות המשתמשים החודשית שלכם לא חוצה מאות מיליונים לפי תנאי מטא. נדרש גם לשמור על תנאי השימוש המקוריים לגבי בטיחות, שימושים אסורים וייחוס הולם של המודל.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗