GPT
M

Meta-Llama-3-70B-Instruct-GGUF

קוד פתוח

MaziyarPanahiרישיון לא דווח2024-04-18

  • gguf
  • facebook
  • meta
  • pytorch
  • llama

גרסת קוונטיזציה של מודל הדגל הפתוח של מטא, מותאמת למי שרוצה להריץ מודל שיחה חזק מקומית דרך llama.cpp במקום לשלם לפי טוקן לספק ענן.

  • 656 GBמשקל הקבצים
  • 4,598הורדות בחודש
  • 170לייקים

מה זה

מדובר בהמרה לפורמט GGUF של דגם ההוראות בגודל 70 מיליארד פרמטרים ממשפחת Llama 3. המודל אומן על מעל 15 טריליון טוקנים עם חלון הקשר של 8k וארכיטקטורת Grouped-Query Attention, מה שמשפר את יעילות ההסקה לעומת הדור הקודם. הוא מכוון ישירות למשימות שיחה וקוד.

במבחנים שהוצגו בכרטיס, הדגם מציג קפיצה חדה מול Llama 2 המקביל. בפתרון בעיות קוד ב־HumanEval הוא מזנק מציון 25.6 ל־81.7, ובמתמטיקה יסודית ב־GSM-8K הוא מגיע ל־93 לעומת 57.5. התוצאות האלה מראות יכולת תכנות ופתרון בעיות מעשית שלא הייתה קיימת במשפחה הזו בעבר.

מתאים ל

  • עוזר פיתוח וכתיבת קוד

    מגיע לציון 81.7 ב־HumanEval, מתאים לכתיבה ותיקון פונקציות באנגלית על חומרה מקומית.

  • בוט שיחה בארגון סגור

    עבר כיוונון הוראות ומאפשר הרצה מקומית מלאה בלי להוציא נתונים פנימיים החוצה.

  • פתרון בעיות לוגיות וחישוב

    מציג ביצועים של 93 ב־GSM-8K, מסוגל לפרק שאלות מורכבות לשלבי חשיבה.

איפה זה נופל

המודל אומן ונבדק באנגלית בלבד. מטא מציינת במפורש ששימוש בשפות אחרות חורג מההגדרות הרשמיות של הכרטיס, כך שעבור עברית אין שום התחייבות ליכולת תקינה בלי אימון נוסף. נקודת חיתוך המידע שלו נעצרת בדצמבר 2023, והוא מייצר טקסט וקוד בלבד, בלי יכולות תמונה או מולטימודל.

אותה משפחה

Meta-Llama-3 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להוריד את כל המאגר ששוקל מעל 600 גיגהבייט?

לא. המאגר מכיל גרסאות קוונטיזציה שונות לאותו מודל. בוחרים רמת דחיסה אחת, למשל קובץ Q2_K, ומורידים רק אותו ישירות דרך כלי הפקודה.

האם המודל יפעל טוב בפניות בעברית?

הכרטיס מגדיר שימוש בשפות שאינן אנגלית מחוץ לתחום המיועד של המודל. הוא עשוי להבין מילים מסוימות, אבל לא נבדק לכך ועלול לייצר שגיאות תחביר והזיות.

איך מריצים

הריפו כולל 24 קבצים בנפח כולל של 656 גיגהבייט, אבל מורידים רק קובץ בודד של רמת הקוונטיזציה הרצויה, למשל דרך huggingface-cli עם סינון לקובץ Q2_K ספציפי. ההרצה נעשית ישירות דרך llama.cpp, עם תבנית הפרומפט המדויקת שכוללת תגיות כמו eot_id ו־start_header_id.

בשביל להריץ 70 מיליארד פרמטרים צריך חומרה ייעודית כבדה. אפילו בגרסאות דחוסות מאוד יש צורך בזיכרון של עשרות גיגהבייט כדי לטעון את המשקלים. אם אין לכם שרת עם כמה כרטיסים חזקים או זיכרון מאוחד רחב, זול ומהיר יותר לשלוח קריאות למודל המקורי דרך שירותי API קיימים.

ollama run hf.co/MaziyarPanahi/Meta-Llama-3-70B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

בעמוד המודל הנוכחי לא דווח רישיון ספציפי לקבצי ה־GGUF עצמם. הכרטיס המקורי מפנה לרישיון הקהילתי של Llama 3 באתר של מטא, הכולל תנאי שימוש מסחריים ומדיניות שימוש מקובל. במצב שבו הרישיון במאגר ריק, שילוב ישיר במוצר מסחרי דורש זהירות ובדיקה משפטית מול התנאים המקוריים של מטא.

הרישיון המלא בעמוד המודל ↗