GPT
M

lmstudio-community/Meta-Llama-3.1-70B-Instruct-GGUF

קוד פתוח

lmstudio-communityllama3.12024-07-24

  • transformers
  • gguf
  • facebook
  • meta
  • pytorch

גרסת GGUF מכווצת של המודל הגדול של מטא, שנועדה לאפשר הרצה מקומית. הפתרון הזה נותן איכות גבוהה וחלון הקשר עצום בלי להסתמך על ענן חיצוני.

  • 417 GBמשקל הקבצים
  • 2,421הורדות בחודש
  • 37לייקים

מה זה

מדובר בהמרה של דגם שבעים מיליארד הפרמטרים מבית מטא לפורמט GGUF, שבוצעה באמצעות llama.cpp עבור קהילת LM Studio. המודל עבר אימון על 15 טריליון טוקנים, כולל 25 מיליון דוגמאות שנוצרו באופן סינתטי, והוא מציע חלון הקשר של 128 אלף טוקנים. השיפורים מול הדור הקודם מתמקדים בעיקר בביצועים כלליים וביכולות רב לשוניות.

היתרון המרכזי בגודל הזה הוא שילוב בין עומק הבנה ליכולת ביצוע משימות מורכבות. במקום להתפשר על דגמים קטנים של שמונה מיליארד פרמטרים שמפספסים הוראות עדינות, המודל הזה מתמודד טוב בהרבה עם יצירת קוד, ניתוח מסמכים ארוכים ומעקב אחרי פרומפטים מובנים, כל עוד יש לכם את החומרה המתאימה להחזיק אותו בזיכרון.

מתאים ל

  • ניתוח מסמכים ארוכים

    חלון הקשר של 128k מאפשר לטעון טקסטים ענקיים באנגלית ובשפות הנתמכות ללא פיצול.

  • כתיבת קוד וסקריפטים

    דגם 70B מבין הקשר טכני ומייצר קוד מורכב בדיוק גבוה בהרבה מדגמים קטנים.

  • עיבוד מידע רגיש מקומית

    הרצה מקומית בתוך הרשת הארגונית שומרת על פרטיות מלאה בלי להוציא נתונים החוצה.

איפה זה נופל

עברית אינה מופיעה ברשימת השפות הרשמית של המודל, שכוללת אנגלית, גרמנית, צרפתית, איטלקית, פורטוגזית, הינדי, ספרדית ותאית. הוא אמנם עשוי לפלוט עברית, אבל זה לא נבדק רשמית ויכול להוביל לטעויות תחביר והזיות. בנוסף, חלון של 128 אלף טוקנים דורש משאבי זיכרון אדירים, ובגרסאות מכווצות אגרסיביות יש סכנה לאובדן דיוק במשימות היגיון עדינות.

אותה משפחה

Meta-Llama-3.1 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית כשפת עבודה?

השפות הרשמיות שצוינו במפרט כוללות שמונה שפות בלבד, ועברית לא ביניהן. הוא מסוגל להבין מעט עברית מהאימון הכללי, אבל התוצאות יהיו איטיות ולא אמינות בהשוואה לאנגלית.

איזו תוכנה צריך כדי להריץ את הקבצים האלה?

הקבצים הוכנו עבור LM Studio מגרסה 0.2.29 ומעלה, ומתבססים על llama.cpp. יש לוודא שבוחרים בהגדרות את תבנית הפרומפט המובנית של Llama 3.

איך מריצים

כדי להריץ מודל של שבעים מיליארד פרמטרים תצטרכו חומרה רצינית. הקבצים בעמוד שוקלים בסך הכול 417 גיגה בייט ומחולקים לשישה עשר קבצים, כך שגרסאות שונות תופסות נפח זיכרון משתנה. להרצה חלקה בזיכרון הווידאו דרושים לרוב לפחות שני כרטיסי מסך חזקים או מעבד אפל סיליקון עם נפח זיכרון מאוחד גבוה.

לפי כרטיס המודל, חובה להשתמש בגרסה 0.2.29 ומעלה של LM Studio עם תבנית הפרומפט של Llama 3. אם יש לכם מחשב רגיל עם כרטיס מסך בודד, המודל פשוט יזחל או יקרוס, ובמצב כזה עדיף לשלם לפי שימוש לספק שמחזיק את המודל על שרתים ייעודיים.

ollama run hf.co/lmstudio-community/Meta-Llama-3.1-70B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא רישיון llama3.1 של מטא. הוא מאפשר שימוש מסחרי ומחקר, אך כפוף למגבלות המדיניות של מטא, כולל תנאי שימוש ייעודיים לגופים עם מאות מיליוני משתמשים פעילים. חובה לקרוא את נוסח הרישיון המלא לפני שילוב המודל בשירות מסחרי.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗