GPT
L

Llama-3.1-8B-Instruct-GGUF

קוד פתוח

unslothllama3.12025-04-23

  • gguf
  • llama
  • facebook
  • meta
  • pytorch

גרסת קובצי GGUF למודל הקוד הפתוח של מטא, מותאמת במיוחד לריצה מקומית קלה וחסכונית בזיכרון.

  • 131,072טוקנים בהקשר
  • 118 GBמשקל הקבצים
  • 12,026הורדות בחודש
  • 44לייקים

מה זה

מטא אימנה את הדגם הזה על 15 טריליון טוקנים, וצוות unsloth ארז אותו בפורמט GGUF שמיועד להרצה מהירה על מעבדים וכרטיסי מסך ביתיים. השינוי הבולט ביותר מול הדור הקודם הוא חלון הקשר עצום של 128 אלף טוקנים, שמאפשר לבלוע מסמכים ארוכים בלי לאבד את הצפון.

במבחני ביצועים רואים קפיצה של ממש ביחס לגרסת 8B הקודמת, בעיקר בכתיבת קוד ובשימוש בכלים חיצוניים. במבחן HumanEval הוא מגיע ל־72.6 אחוז לעומת 60.4 אחוז במודל הישן, ובמבחן API-Bank שמודד קריאות לפונקציות הוא מזנק ל־82.6 אחוז לעומת 48.3 אחוז. הוא עדיין ברמת כניסה מול דגמי ה־70B, אבל למשימות מוגדרות הוא נותן עבודה יציבה.

מתאים ל

  • קריאה לפונקציות וכלים

    קפיצה ל־82.6 אחוז במבחן API-Bank הופכת אותו למנוע מעולה לניתוב פקודות והפעלת סקריפטים.

  • סיוע בכתיבת קוד

    מתאים להשלמת קוד מקומית ב־IDE בזכות זינוק בביצועי HumanEval וזמני תגובה קצרים במחשב אישי.

  • סיכום מסמכים באנגלית

    חלון של 128 אלף טוקנים מאפשר להזין קובצי לוג ומפרטים טכניים מלאים בלי לחתוך אותם מראש.

איפה זה נופל

השפות הרשמיות הנתמכות הן אנגלית, גרמנית, צרפתית, איטלקית, פורטוגזית, הינדי, ספרדית ותאילנדית בלבד. עברית לא נמצאת ברשימה הזו, ואם תנסו להריץ עליו טקסטים מקומיים מורכבים תיתקלו בתחביר שבור והזיות. בנוסף, מידע האימון שלו נעצר בדצמבר 2023, ובמשימות היגיון מדעי מתקדם כמו מבחן GPQA הוא השיג רק 30.4 אחוז, ירידה קלה אפילו מול הדור הקודם.

שאלות
נפוצות

אני חייב להוריד את כל 118 הגיגה בייט כדי להשתמש בו?

לא. המאגר מכיל גרסאות כימות שונות של אותו הדגם. אתם בוחרים קובץ יחיד שמתאים לגודל הזיכרון של כרטיס המסך שלכם, בדרך כלל בין 4 ל־9 גיגה בייט לקובץ, ומורידים רק אותו.

הוא מתאים לפיתוח בוטים ועיבוד טקסט בעברית?

לא הייתי בונה עליו בעברית למוצר פעיל. מטא הצהירה על תמיכה בשמונה שפות בלבד ועברית אינה אחת מהן, כך שהיכולת שלו לטפל בניסוחים מקומיים או לנתח פקודות בעברית מוגבלת מאוד.

איך מריצים

המאגר כולל 29 קבצים במשקל כולל של 118 גיגה בייט, שזה בעצם אוסף של דרגות כימות שונות. בפועל אתם לא מורידים את כל המשקל הזה אלא בוחרים קובץ בודד, לרוב בכימות 4-bit או 8-bit, שיכול לרוץ בנוחות על כרטיס מסך ביתי עם 8 עד 16 גיגה זיכרון דרך llama.cpp או Ollama.

אם אתם צריכים לחבר את המודל למוצר עם תעבורה גבוהה וכמה פניות במקביל, שרת מקומי בודד ייחנק די מהר. במצב כזה עדיף לשלם לפי טוקן לשירות ענן שמארח אותו במקום לנהל תשתית עצמאית.

ollama run hf.co/unsloth/Llama-3.1-8B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא רישיון הקהילה של Llama 3.1, שמתיר שימוש מסחרי ומחקרי חופשי כל עוד אין לכם מעל 700 מיליון משתמשים חודשיים פעילים. תנאי הרישיון גם מרשים להשתמש בפלטים של המודל כדי לאמן ולשפר מודלים אחרים.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗