GPT
M

Meta-Llama-3.1-8B-Instruct-GGUF

קוד פתוח

bartowskillama3.12024-07-23

  • gguf
  • facebook
  • meta
  • pytorch
  • llama

גרסת GGUF מכווצת של מודל ההוראות מבית מטא. מתאימה למי שרוצה להריץ שפה מקומית על כרטיס מסך בודד או במעבד בלי לשלם על שירותי ענן.

  • 134 GBמשקל הקבצים
  • 294,527הורדות בחודש
  • 401לייקים

מה זה

המאגר הזה מציג המרות קוונטיזציה של מודל ההוראות מטא למה 3.1 בגודל 8 מיליארד פרמטרים. ההמרות נעשו באמצעות llama.cpp עם כיול imatrix, מה שנועד לשמור על איכות הפלט גם בדחיסות משמעותיות.

במקום מודל מלא שדורש משאבי ענק, המודל הזה מחולק לקבצים שמתחילים מקצת פחות מ־3 גיגה בייט ומגיעים עד משקל מלא של מעל 32 גיגה בייט. רוב הגרסאות המומלצות יושבות באזור של 4 עד 6 גיגה בייט, ומספקות יכולות של יצירת טקסט והבנת הוראות במגוון שפות רשמיות כמו אנגלית, ספרדית, צרפתית, גרמנית, איטלקית, פורטוגזית, הינדי ותאי.

מתאים ל

  • עוזר מקומי למחשב נייד

    קובץ Q4_K_M רץ על זיכרון של כרטיס גרפי פשוט או מעבד ללא תלות ברשת.

  • שרת הסקת מסקנות על ARM

    גרסאות Q4_0 מספקות אופטימיזציה ייעודית ומדידת ביצועים מהירה לשרתים מתאימים.

  • ניתוח מסמכים ללא גישה לענן

    מאפשר לשמור על מידע ארגוני פנימי בתוך המחשב מבלי להוציא בקשות החוצה.

איפה זה נופל

המודל הזה לא כולל עברית ברשימת השפות הרשמיות שלו. אם המטרה היא עיבוד שפה מקומית בישראל, צריך לבדוק אותו היטב מראש כי הכרטיס מציין רשמית רק שמונה שפות אחרות.

בנוסף, איכות הפלט יורדת ככל שבוחרים קבצים קטנים יותר, במיוחד מתחת ל־4 גיגה בייט. תבנית הפורמט עודכנה בסוף יולי 2024 עקב באג שקשור להפעלת כלים, ולכן חובה לוודא שמשתמשים בהגדרות השיחה הנכונות ולא במבנה ישן.

אותה משפחה

Meta-Llama-3.1 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם צריך להוריד את כל המאגר ששוקל 134 גיגה בייט?

לא. מורידים רק קובץ בודד שמתאים למגבלות הזיכרון של המחשב שלכם, למשל קובץ ברמת Q4_K_M ששוקל 4.92 גיגה בייט.

האם גרסאות ה־ARM יעבדו טוב על מחשב מק?

לא. כרטיס המודל מזהיר במפורש שגרסאות Q4_0 המיועדות ל־ARM לא מתאימות למחשבי מק ואין להשתמש בהן שם.

איך מריצים

אתם מורידים קובץ ספציפי בלבד מתוך המאגר, בדרך כלל בעזרת huggingface-cli או ישירות לתוך ממשקים כמו LM Studio. הגרסה הנפוצה ביותר היא Q4_K_M ששוקלת 4.92 גיגה בייט ונכנסת בקלות לכרטיס מסך צרכני פשוט עם 6 או 8 גיגה בייט זיכרון.

אם אתם רצים על מעבדי ARM או מעבדי שרת עם AVX, יש קבצים ייעודיים כמו Q4_0_X_X שנותנים מהירות משופרת, אך הם לא מתאימים למחשבי מק או להרצה על כרטיסי מסך. אם אין לכם חומרה ייעודית מקומית, עדיף להשתמש בנקודת קצה מרוחקת במקום להעמיס על מעבד איטי.

ollama run hf.co/bartowski/Meta-Llama-3.1-8B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

השימוש כפוף לרישיון הייעודי llama3.1 של מטא. הרישיון מאפשר שימוש מסחרי ואישי, אך כולל מגבלות ספציפיות של מטא לגבי שימוש בתוצרים והיקף משתמשים נרחב, ולכן חובה לקרוא את תנאי הרישיון המקוריים לפני שילוב שלו במוצר מסחרי פעיל.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗