GPT
M

bartowski/Meta-Llama-3.1-70B-Instruct-GGUF

קוד פתוח

bartowskillama3.12024-07-23

  • transformers
  • gguf
  • facebook
  • meta
  • pytorch

גרסת GGUF מכווצת של המודל מבית מטא מאפשרת להריץ יכולות חזקות על חומרה מקומית. הפתרון מיועד למי שרוצה עצמאות בלי לשלוח מידע לרשת.

  • 804 GBמשקל הקבצים
  • 90,531הורדות בחודש
  • 73לייקים

מה זה

מדובר בהמרה של דגם שבעים מיליארד הפרמטרים של מטא לפורמט llama.cpp באמצעות כיול imatrix. ההבדל המרכזי מול קבצי המשקלים המקוריים הוא היכולת לדחוס את המודל לפורמטים של שמונה ביט ומטה, עד לקבצים קטנים משמעותית. הדבר מאפשר גמישות בבחירת היחס בין איכות הפלט לנפח הזיכרון הנדרש בעבודה מקומית.

בגודל הזה המודל מיועד להתמודד עם משימות מורכבות של יצירת טקסט, ניתוח והבנת הוראות בשפות הנתמכות, כולל אנגלית, גרמנית, צרפתית, ספרדית, איטלקית, פורטוגזית, הינדי ותאי. הוא נותן מענה חזק בהרבה מדגמי שמונה מיליארד הפרמטרים, אבל דורש משאבים כבדים כדי לספק זמני תגובה שמתאימים לשימוש חי.

מתאים ל

  • עיבוד מידע רגיש מקומית

    ניתוח מסמכים מקומי בארגון ללא הוצאת נתונים לרשת חיצונית, תוך שימוש ביכולות ניתוח גבוהות.

  • סביבת פיתוח ובדיקות

    הרצה מקומית של מודל גדול לצורך בדיקת פרומפטים ואינטגרציות לפני מעבר לתשתיות ענן.

  • תרגום וניסוח רב לשוני

    יצירת טקסט בשפות אירופיות נתמכות כמו אנגלית וספרדית עם בקרת איכות על גבי החומרה שלכם.

איפה זה נופל

המודל אינו כולל תמיכה מובנית בעברית ברשימת השפות הרשמית שלו, ולכן עבודה בעברית מחייבת בדיקה עצמאית של איכות הפלט והדיוק. בנוסף, גרסאות הדחיסה האגרסיביות כמו IQ1_M או Q3_K_S מוגדרות במפורש כבעלות איכות נמוכה ולא מומלצות לשימוש, כך שחיסכון קיצוני במקום פוגע ביכולת הניסוח וההבנה של המודל.

אותה משפחה

Meta-Llama-3.1 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזו גרסה כדאי להוריד אם יש לי מספיק זיכרון?

היוצר ממליץ על גרסת Q4_K_M כברירת מחדל לאיכות וגודל של 42.52 ג'יגה. אם יש לכם מספיק זיכרון וידאו, גרסאות כמו Q6_K או Q5_K_M יתנו פלט מדויק יותר שקרוב למקור.

האם המודל ירוץ מהר על מעבד רגיל בלי כרטיס מסך?

הוא ירוץ אם יש מספיק זיכרון עבודה, אבל קצב יצירת המילים יהיה איטי מאוד. מודל בגודל שבעים מיליארד דורש כרטיס מסך מתאים עם זיכרון ייעודי כדי לעבוד במהירות סבירה.

איך מריצים

בשביל להריץ אותו צריך זיכרון וידאו או זיכרון עבודה בנפח של לפחות 19 ג'יגה בגרסאות הנמוכות, ומעל 75 ג'יגה בגרסת שמונה ביט. גרסת ברירת המחדל המומלצת לרוב השימושים היא Q4_K_M ששוקלת 42.52 ג'יגה. קבצים מעל 50 ג'יגה מפוצלים ומחייבים הורדה מסודרת של כל החלקים. אפשר לטעון אותם דרך LM Studio או ישירות עם llama.cpp.

אם אין לכם כרטיס גרפי כפול עם מספיק זיכרון כדי להחזיק לפחות ארבעים ג'יגה, הקריאה תגלוש לזיכרון המערכת והביצועים יהיו איטיים מדי לעבודה אינטראקטיבית. במצב כזה, פנייה לשירות ענן מנוהל תהיה זולה ומהירה בהרבה.

ollama run hf.co/bartowski/Meta-Llama-3.1-70B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

31 קבצים במאגר, 804 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

השימוש כפוף לרישיון llama3.1 של מטא. הרישיון מאפשר שימוש מסחרי ומחקר תחת התנאים והמגבלות שמטא מגדירה ברישיון המקורי, ויש לוודא עמידה בהם לפני הפצה במוצר.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗