GPT
M

MaziyarPanahi/Meta-Llama-3.1-8B-Instruct-GGUF

קוד פתוח

MaziyarPanahillama3.12024-07-23

  • gguf
  • quantized
  • 2-bit
  • 3-bit
  • 4-bit

ההמרה הזו לוקחת את מודל ההוראות הקטן של מטא ומאפשרת להריץ אותו מקומית על מעבדים וכרטיסים ביתיים, עם תמיכה בהקשר של 128 אלף טוקנים ושיפור ניכר בקוד.

  • 47.7 GBמשקל הקבצים
  • 154,451הורדות בחודש
  • 38לייקים

מה זה

מדובר באריזת GGUF לגרסת ההוראות של המודל בן שמונה מיליארד פרמטרים מבית מטא. המודל אומן על מעל 15 טריליון טוקנים, והשינוי המשמעותי לעומת הדור הקודם מתבטא בזינוק בביצועי קוד ומתמטיקה, לצד חלון הקשר ענק שמגיע לראשונה לגודל הזה.

במדדי קוד כמו HumanEval המודל עולה משישים אחוזים ליותר משבעים ושניים, ובמבחני הפעלת כלים וקריאות API הדיוק מזנק באופן חד. השיפור הזה מורגש ישירות כשמבקשים ממנו לבנות סקריפטים או לעקוב אחרי פורמט נתונים מוגדר, אם כי הוא עדיין מפגר מאחורי גרסאות השבעים מיליארד בהסקה עמוקה.

מתאים ל

  • הפעלת פונקציות וכלים

    קפיצה לציון של 82.6 אחוז במדד API-Bank הופכת אותו למתאים במיוחד להפעלת סוכנים אוטונומיים מקומיים.

  • עבודה עם מסמכים ארוכים

    תמיכה בהקשר של 128 אלף טוקנים מאפשרת לנתח קוד או קבצים שלמים בלי לחתוך אותם לחלקים קטנים.

  • יצירת נתוני אימון

    הרישיון מאפשר לייצר ממנו דאטה סינתטי כדי לשפר מודלים קטנים וממוקדים יותר בתוך הארגון.

איפה זה נופל

הכרטיס הרשמי מגדיר במפורש תמיכה בשמונה שפות בלבד: אנגלית, גרמנית, צרפתית, איטלקית, פורטוגזית, הינדי, ספרדית ותאית. עברית אינה ברשימת השפות הנתמכות, ולכן שימוש בעברית מחוץ לטווח האימון הרשמי דורש בדיקה זהירה כדי להימנע משיבושים, הזיות ותחביר שבור.

בנוסף, מאגר הנתונים נחתך בדצמבר 2023 כך שהמודל אינו מכיר אירועים עדכניים, ובמבחני היגיון מדעי מורכבים כמו GPQA נרשמה דווקא ירידה קלה לעומת הדור הקודם.

אותה משפחה

Meta-Llama-3.1 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להוריד את כל 47 הגיגה בייט של המאגר?

לא, המאגר כולל 12 קבצים עם גרסאות שונות של כימות המודל. מורידים רק קובץ GGUF אחד שמתאים לנפח הזיכרון של המחשב שלכם, בדרך כלל בין ארבעה לשמונה גיגה בייט לקובץ בודד.

איך המודל מתמודד עם טקסטים בעברית?

עברית אינה מופיעה ברשימת השפות הנתמכות בכרטיס המודל. הוא מסוגל לייצר טקסטים בסיסיים בעברית בזכות דאטה כללי ברשת, אך הביצועים והדיוק נמוכים משמעותית ביחס לשפות הנתמכות רשמית.

איך מריצים

המודל מחולק לקובצי GGUF במשקל כולל של 47.7 גיגה בייט ברמות כימות שונות, מה שמאפשר להוריד קובץ בודד שמתאים בדיוק לחומרה שלכם. כדי להריץ כימות ממוצע כמו Q4 או Q5 תצטרכו כרטיס מסך עם שמונה גיגה זיכרון לפחות, או מעבד סביר עם שש עשרה גיגה זיכרון פנימי דרך llama.cpp, LM Studio או ספריית llama-cpp-python.

אם אתם מתכננים לנצל את מלוא חלון ההקשר של 128 אלף טוקנים, תוספת הזיכרון לניהול ההקשר תהיה כבדה מאוד לחומרה ביתית. במצב כזה, או כשאין גישה לכרטיס גרפי מתאים, עדיף להשתמש בספק שמגיש את המודל דרך שרת מרוחק.

ollama run hf.co/MaziyarPanahi/Meta-Llama-3.1-8B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

השימוש כפוף לרישיון הקהילתי של Llama 3.1, שמתיר שימוש מחקרי ומסחרי. הרישיון מאפשר במפורש להשתמש בפלטים של המודל כדי לאמן ולזקק מודלים אחרים, בתנאי שמצייתים למדיניות השימוש ההוגן של מטא.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗