GPT
M

Meta-Llama-3.1-8B-Instruct-GPTQ-INT4

קוד פתוח

hugging-quantsllama3.12024-07-24

  • transformers
  • safetensors
  • llama
  • text-generation
  • llama-3.1

גרסה מכווצת של המודל הפתוח מבית מטא שרצה על חומרה ביתית צנועה. מקבלים יכולות שיחה מתקדמות וחלון הקשר ענק בלי לשלם על שרתי ענן יקרים.

  • 8Bפרמטרים
  • 131,072טוקנים בהקשר
  • 5.4 GBמשקל הקבצים
  • 3,012הורדות בחודש

מה זה

הפרויקט הזה לוקח את הדגם המקורי של מטא בדיוק חצי, ומכווץ אותו לדיוק של 4 ביט באמצעות אלגוריתם שנקרא GPTQ. המודל הבסיסי מכיל 8 מיליארד פרמטרים ומכוון למשימות שיחה והוראות בטקסט, אבל בגרסה הזו כל המשקל שלו יורד לכ־5.4 ג'יגה בייט בלבד על הדיסק.

היתרון הגדול מול חלופות באותו סדר גודל הוא חלון הקשר עצום של 131,072 טוקנים שמגיע ישירות מסדרת 3.1. הכיווץ כאן בוצע עם גודל קבוצה 128, מה ששומר על איכות המענה קרוב למקור תוך קיצוץ דרסטי בצריכת הזיכרון בריצה.

מתאים ל

  • בוט שיחה על חומרה מקומית

    רץ ישירות על מחשב נייד או שרת מקומי צנוע ללא צורך בכרטיס מסך תעשייתי יקר.

  • עיבוד מסמכים רב לשוניים

    מתמודד היטב עם טקסטים ארוכים באחת משמונה השפות הנתמכות רשמית.

  • שרת הסקה פנימי בארגון

    משתלב בקלות בתוך vLLM או קונטיינר של TGI לקבלת תאימות מלאה לממשק דמוי OpenAI.

איפה זה נופל

המודל תומך רשמית בשמונה שפות בלבד: אנגלית, גרמנית, צרפתית, איטלקית, פורטוגזית, הינדי, ספרדית ותאילנדית. עברית לא ברשימה הזו, ולכן אי אפשר לבנות עליו לפלט מקצועי או דקדוק תקין בעברית בלי לבדוק אותו ביסודיות מראש. בנוסף, למרות שחלון ההקשר תומך בכמות טוקנים גדולה, ניצול מלא שלו ידרוש הרבה יותר מ־4 ג'יגה בייט זיכרון גרפי עבור שמירת הנתונים הפעילים, מה שיפיל כרטיסי מסך קטנים.

אותה משפחה

Meta-Llama-3.1 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו ישירות על מעבד בלי כרטיס מסך?

הקוד והספריות שהוגדרו בכרטיס המודל, כמו AutoGPTQ וקרנלים של Marlin, בנויים להרצה מואצת על מעבדים גרפיים של אנבידיה. להרצה טהורה על מעבד עדיף לחפש פורמטים מותאמים כמו GGUF.

כמה זיכרון גרפי צריך בפועל בשביל מסמכים ארוכים?

טעינת המודל לוקחת כ־4 ג'יגה בייט, אבל שמירת הקשר של אלפי טוקנים דורשת זיכרון נוסף. להקשרים ארוכים במיוחד של עשרות אלפי טוקנים מומלץ להצטייד בכרטיס עם 12 עד 16 ג'יגה בייט.

איך מריצים

טעינת המשקלים לכרטיס המסך דורשת כ־4 ג'יגה בייט זיכרון גרפי נקי, אבל בפועל צריך קצת מעבר לזה כדי לפנות מקום לחישובי הקשר וזיכרון הריצה. כרטיס ביתי פשוט של 8 ג'יגה בייט יריץ אותו בקלות דרך ספריית transformers או שרתי הסקה כמו vLLM ו־TGI עם קרנלים מואצים מסוג Marlin.

אם כל מה שצריך זה שליחת שאילתות קצרות פה ושם, כנראה שעדיף לשלם סנטים בודדים ל־API מנוהל ולחסוך תחזוקה. הרצה עצמית שווה את המאמץ ברגע שיש רצון לפרטיות מלאה, חוסר תלות ברשת, או תעבורת נתונים רציפה שמייקרת שירותי ענן.

from transformers import pipeline

pipe = pipeline("text-generation", model="hugging-quants/Meta-Llama-3.1-8B-Instruct-GPTQ-INT4")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון llama3.1 של מטא. הוא מתיר שימוש מסחרי ומחקר, אבל מחייב עמידה במדיניות השימוש המקובל שלהם וכולל תנאים ספציפיים לגבי גודל קהל המשתמשים והפצה של מודלים נגזרים.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗