GPT
M

Meta-Llama-3.1-70B-Instruct-AWQ-INT4

קוד פתוח

hugging-quantsllama3.12024-07-19

  • transformers
  • safetensors
  • llama
  • text-generation
  • llama-3.1

גרסת קוונטיזציה של מטא לאמה 70B שמכווצת את המשקלים ל־4 ביט. היא מאפשרת להריץ מודל הוראות חזק על פחות חומרה בלי לאבד את היכולות המקוריות.

  • 71Bפרמטרים
  • 131,072טוקנים בהקשר
  • 37.0 GBמשקל הקבצים
  • 170,503הורדות בחודש

מה זה

מדובר בגרסה מכווצת של המודל הרשמי של מטא, שעברה עיבוד בשיטת AutoAWQ עם דיוק INT4. במקום להחזיק משקלים כבדים בפורמט חצי דיוק המקורי, הקבצים כאן שוקלים 37 גיגה בייט בלבד ומאורגנים בעשרים קבצים כמעט. המודל שומר על יכולות מענה להוראות ושיחה רב לשונית בשמונה שפות עיקריות כמו אנגלית, ספרדית וצרפתית.

השימוש בקרנלים של GEMM עם קבוצות של 128 מאפשר למצות את כוח העיבוד של כרטיסי מסך מודרניים. המודל מיועד לייצור טקסט ומגיע עם חלון הקשר עצום של מעל מאה ושלושים אלף טוקנים, כך שאפשר לתת לו משימות עיבוד ארוכות בלי לחתוך את הקלט מראש.

מתאים ל

  • בוט שירות רב לשוני

    מתאים לשיחות מורכבות בשפות אירופיות בזכות אימון ייעודי להוראות ומענה מדויק.

  • שרת הסקה פנימי מאובטח

    משתלב בקלות בתוך vLLM או TGI בארגונים שלא רוצים להוציא מידע לענן חיצוני.

  • ניתוח מסמכים ארוכים

    חלון הקשר של 131,072 טוקנים מאפשר להזין טקסטים שלמים ומסמכים מרובי עמודים.

איפה זה נופל

עברית לא נכללת ברשימת השפות הנתמכות רשמית, שכוללת רק שפות אירופיות, תאילנדית והינדי. אפשר לצפות לפלט פחות מדויק או שגיאות תחביריות בניסיון לעבוד איתו בעברית שוטפת. בנוסף, למרות שחלון ההקשר תומך ביותר ממאה אלף טוקנים, בפועל הרצה של הקשרים ארוכים כאלה דורשת זיכרון גרפי ענק מעבר לטעינת הבסיס, והדוגמאות הרשמיות של התשתית מגבילות את ההרצה לארבעת אלפים טוקנים בלבד כדי למנוע קריסה.

אותה משפחה

Meta-Llama-3.1 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

כמה זיכרון גרפי חובה להחזיק בשביל להריץ אותו?

המודל תופס כ־35 גיגה בייט רק בטעינה. כדי לייצר טקסט בפועל ולשמור מקום לחישובים תצטרכו כרטיס של 48 גיגה בייט לפחות, או פיצול על פני כמה כרטיסים במקביל.

האם המודל יודע לעבוד בעברית בצורה טובה?

עברית לא נמצאת ברשימת השפות הרשמית של המודל. הוא יבין מילים בודדות אבל יתקשה בניסוחים מורכבים, ולכן עדיף לבדוק מודלים אחרים למשימות בעברית.

איך מריצים

כדי רק לטעון את המשקלים לזיכרון כרטיס המסך צריך בערך 35 גיגה בייט של זיכרון ייעודי, וזה עוד לפני חישובי ההקשר והזיכרון הזמני. בפועל תצטרכו כרטיס מקצועי של 48 גיגה בייט או מערך של כמה כרטיסים קטנים יותר, למשל חלוקה לארבעה מעבדים גרפיים באמצעות TGI או vLLM שנתמכים כאן באופן מלא מתוך קונטיינרים.

אם אין לכם שרת ייעודי כזה פנוי בענן או במשרד, התחזוקה והעלות השעתית של המכונות האלה יהיו יקרות מדי. במקרה של עומס עבודה נמוך או ניסיונות ראשונים, קריאה ישירה לשירותי ענן חיצוניים תחסוך לכם התעסקות טכנית מיותרת.

from transformers import pipeline

pipe = pipeline("text-generation", model="hugging-quants/Meta-Llama-3.1-70B-Instruct-AWQ-INT4")
print(pipe("שלום"))

הרישיון

השימוש כפוף לרישיון הרשמי של מטא עבור לאמה 3.1. הרישיון מתיר שימוש מסחרי ומחקר, אך מחייב לעמוד בתנאי המדיניות והשימוש המקובל של מטא, כולל מגבלות על היקפי משתמשים חודשיים ענקיים ברמה תאגידית.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗