GPT
M

bartowski/Meta-Llama-3-8B-Instruct-GGUF

קוד פתוח

bartowskiother2024-04-29

  • gguf
  • facebook
  • meta
  • pytorch
  • llama

גרסאות מכווצות של מודל ההוראות הפופולרי שמאפשרות להריץ אותו מקומית על כמעט כל מחשב. הפתרון למי שרוצה ביצועים טובים בלי לשלם על שרתים יקרים.

  • 128 GBמשקל הקבצים
  • 10,712הורדות בחודש
  • 108לייקים

מה זה

המאגר הזה מכיל המרות של מודל ההוראות המקורי מבית מטא לפורמט GGUF, באמצעות שימוש בכלי llama.cpp עם כיול imatrix. המטרה כאן היא לצמצם את דרישות הזיכרון של המודל תוך שמירה מרבית על הדיוק שלו ביצירת טקסט ובמענה להנחיות באנגלית.

במקום להסתפק בהמרה פשוטה, נעשה כאן שימוש בטכניקות כיבוץ מתקדמות שמאפשרות לרדת עד לרמות של שני ביטים ואפילו ביט בודד למשקל. זה נותן מענה גמיש מאוד למי שרוצה להריץ את המודל על כרטיסי מסך ביתיים או על מעבדים רגילים, בלי להחזיק תחנת עבודה ייעודית.

מתאים ל

  • עוזר מקומי על מחשב נייד

    קובץ Q4_K_M שוקל פחות מחמישה גיגהבייט ונכנס בקלות לזיכרון של מחשב נייד רגיל.

  • עיבוד טקסט באנגלית במערכות קצה

    המודל מחזיר תוצאות איכותיות על הנחיות באנגלית ומאפשר עבודה ללא חיבור רשת.

  • בדיקות פיתוח על כרטיסי מסך חלשים

    גרסאות ה־I המכווצות מאפשרות להריץ מודל שלם גם על כרטיסים עם פחות מארבעה גיגהבייט זיכרון.

איפה זה נופל

המודל אומן והוגדר רשמית עבור השפה האנגלית בלבד, ולכן הוא לא מתאים לעיבוד והפקה של טקסטים בעברית ללא בדיקה מעמיקה מראש. בנוסף, רמות הכיבוץ הנמוכות ביותר מגיעות עם מחיר כבד באיכות הפלט. היוצר מציין במפורש שהגרסאות הקיצוניות מסוג IQ1_M ו־IQ1_S מספקות איכות נמוכה ביותר ואינן מומלצות לשימוש מעשי, וגם גרסת Q3_K_S מספקת תוצאות ירודות. מעבר לכך, גרסאות ה־I סובלות מאיטיות ניכרת על גבי מעבדים ומגבלות תאימות בסביבות הרצה מסוימות כמו Vulkan.

אותה משפחה

Meta-Llama-3 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ כדאי להוריד אם יש לי כרטיס מסך עם שמונה גיגהבייט זיכרון?

קובץ Q5_K_M ששוקל 5.73 גיגהבייט או Q6_K ששוקל 6.59 גיגהבייט יתאימו במדויק וירוצו במהירות מקסימלית.

האם כדאי להוריד את כל עשרים ושבעת הקבצים שמופיעים במאגר?

ממש לא, מורידים רק קובץ בודד לפי כמות הזיכרון ורמת הדיוק שמתאימים למחשב שלכם.

איך מריצים

בוחרים קובץ אחד בלבד לפי כמות הזיכרון הזמינה לכם. לקבלת המהירות המרבית, הקובץ צריך להיות קטן בגיגהבייט או שניים מסך הזיכרון הגרפי בכרטיס המסך. אם אתם מכוונים לאיכות גבוהה, גרסאות כמו Q5_K_M במשקל 5.73 גיגהבייט או Q4_K_M במשקל 4.92 גיגהבייט נחשבות לנקודת האיזון המומלצת עבור רוב המשתמשים.

אם אתם יורדים מתחת לרמת ארבעה ביטים, גרסאות ה־I מציעות איכות עדיפה על פני גרסאות ה־K באותו נפח, אבל הן דורשות תמיכה של cuBLAS או rocBLAS ויהיו איטיות יותר על גבי מעבד רגיל או מעבדי אפל. הן גם אינן תואמות להרצה דרך Vulkan.

ollama run hf.co/bartowski/Meta-Llama-3-8B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון בעמוד מסווג ככללי ולא מצורף נוסח מלא בכרטיס. מאחר שמדובר בהמרה של מודל מקורי של מטא, השימוש המסחרי וההפצה במוצר כפופים ישירות לתנאי הרישיון המקוריים של החברה, ולכן חובה לבדוק אותם במקור לפני שילוב בקוד מסחרי.

הרישיון המלא בעמוד המודל ↗