GPT
M

Meta-Llama-3-8B-GGUF

קוד פתוח

QuantFactoryother2024-04-18

  • gguf
  • facebook
  • meta
  • pytorch
  • llama

גרסה מכווצת בפורמט GGUF למודל הבסיס של מטא, שמיועדת להרצה מקומית בלי שרתים מנופחים. היא מתאימה למי שרוצה בסיס גולמי של שמונה מיליארד פרמטרים ומעדיף לכוונן אותו לבד.

  • 67.7 GBמשקל הקבצים
  • 1,444הורדות בחודש
  • 115לייקים

מה זה

מדובר בהמרה של מודל הבסיס Llama 3 8B לפורמט GGUF, שנועד לעבודה ישירה מול מעבדים וכרטיסים גרפיים פשוטים. המודל אומן על יותר מ־15 טריליון טוקנים ממקורות גלויים ברשת, עם חלון הקשר של 8k ושימוש ב־Grouped-Query Attention כדי לחסוך בזיכרון בזמן ריצה.

נקודה שחשוב להבין היא שמדובר במודל Pretrained בסיסי ולא בגרסת ה־Instruct. הוא מייצר טקסט וקוד, אבל הוא לא מכוון לשיחה, אלא בעיקר להשלמת משפטים ולמשימות המשך שתגדירו לו. הידע שלו נחתך במרץ 2023, כך שכל מה שקרה מאז פשוט לא קיים אצלו.

מתאים ל

  • אימון והתאמה אישית

    הוא מגיע כמודל בסיס נקי בלי שכבות שיחה, מה שהופך אותו לנקודת מוצא נוחה ל־Fine-tuning ייעודי.

  • השלמת קוד וטקסט

    הארכיטקטורה שלו מיועדת להשלמה אוטורגרסיבית של קטעי טקסט וקוד באנגלית מתוך חלון של 8k.

  • ניסויי הרצה מקומיים

    פורמט GGUF מאפשר להריץ אותו ישירות על מעבד ביתי כדי לבדוק ביצועים בלי תלות בחיבור לרשת.

איפה זה נופל

זה מודל בסיס ולא מודל צ'אט, והוא לא עבר כוונון להוראות או התאמה מול בני אדם. אם תשאלו אותו שאלה ישירה, הוא עלול להמשיך אותה בשאלות נוספות במקום לענות. בנוסף, השפה המוגדרת בכרטיס היא אנגלית בלבד, ונתוני האימון שלו נעצרים במרץ 2023, כך שהוא לא מתאים לעבודה עם מידע עדכני.

אותה משפחה

Meta-Llama-3 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להשתמש במודל הזה בתור בוט שיחה?

לא מומלץ בלי התאמה נוספת. זהו מודל בסיס שלא עבר אימון הנחיות, ולכן הוא מייצר המשך לטקסט במקום לענות כמו בצ'אט.

צריך להוריד את כל 67 הגיגה־בייט כדי לעבוד איתו?

לא. המשקל הכולל מייצג 18 קבצים שונים של כימותים, וכל מה שצריך זה להוריד קובץ בודד שמתאים לגודל הזיכרון שלכם.

איך מריצים

המודל מחולק ל־18 קבצים בנפח כולל של 67.7 גיגה־בייט, שכוללים דרגות כימות שונות. כדי להריץ קובץ בודד לא צריך את כל החבילה, אלא בוחרים קובץ כימות אחד שמתאים לזיכרון שלכם, לרוב בין 4 ל־8 גיגה זיכרון פנוי, וטוענים אותו עם כלים שתומכים ב־GGUF כמו llama.cpp.

אם אתם צריכים להריץ קריאות מהירות בעומס גבוה בלי לנהל זיכרון מקומי, כנראה שעדיף לשלם לפי טוקן ל־API חיצוני. הרצה מקומית של המודל הזה מתאימה בעיקר לפיתוח, עבודה בלי רשת או כשחייבים שהמידע לא ייצא מהמחשב.

ollama run hf.co/QuantFactory/Meta-Llama-3-8B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון מוגדר כמותאם אישית של מטא ומאפשר שימוש מסחרי, אבל כפוף לתנאי השימוש הרשמיים שלהם באתר ייעודי. מי שמתכנן להפיץ את המודל בתוך מוצר חייב לבדוק את התנאים בעמוד הרישיון של Llama 3.

הרישיון המלא בעמוד המודל ↗