GPT
M

lmstudio-community/Meta-Llama-3-70B-Instruct-GGUF

קוד פתוח

lmstudio-communityרישיון לא דווח2024-04-19

  • gguf
  • facebook
  • meta
  • pytorch
  • llama

גרסה מכווצת של המודל הגדול של מטא מציעה ביצועים שעוקפים את GPT-3.5 בקוד ובשיחה. היא מיועדת למי שרוצה להריץ מודל חזק מקומית בלי תלות בשרת חיצוני.

  • 74.9 GBמשקל הקבצים
  • 978הורדות בחודש
  • 111לייקים

מה זה

מדובר בהמרה לפורמט GGUF של המודל עם 70 מיליארד פרמטרים, שעבר כיוונון להוראות באמצעות שילוב של SFT, דגימת דחייה, PPO ו־DPO. לפי כרטיס המודל, מטא אימנה אותו על מעל 15 טריליון תוקנים, כולל כמות קוד גדולה פי ארבעה בהשוואה לדור הקודם, והוא מגיע עם ארכיטקטורת Grouped Attention Query לחיסכון בזיכרון תחת הקשר ארוך.

המודל מתמחה בשיחות מרובות שלבים, ידע כללי וכתיבת קוד. ההבדל המרכזי מול מה שהכרנו בגודל הזה הוא היכולת שלו לעקוב בצורה הדוקה ועקבית אחרי הוראות מערכת (system prompt), מה שמאפשר שליטה מדויקת יותר בסגנון התשובות ובמבנה שלהן.

מתאים ל

  • פיתוח ובדיקת קוד מקומית

    הוא כולל פי ארבעה יותר נתוני קוד מהדור הקודם, ומספק עזרה בכתיבה ובניתוח תחביר בלי לשלוח מידע לרשת.

  • סוכני שיחה מורכבים

    הוא מצטיין בשיחות ארוכות ומרובות שלבים ועוקב בדייקנות אחרי הוראות ה־system prompt שהוגדרו לו.

  • מענה על שאלות ידע כללי

    אימון על 15 טריליון תוקנים מעניק לו בסיס ידע רחב שמתחרה ישירות במודלים מסחריים סגורים.

איפה זה נופל

השפה המוגדרת בכרטיס היא אנגלית בלבד. המודל אומנם אומן על מגוון שפות במסגרת 15 טריליון התוקנים, אבל בלי תמיכה מוצהרת בעברית אתם צפויים להיתקל בתחביר עילג או בהזיות בתרגום. בנוסף, מודלים בגודל הזה סובלים מאיטיות ניכרת ומצריכת משאבים קיצונית בהרצה עצמית, והכרטיס מבהיר במפורש שהתוכן שנוצר עלול להיות לא מדויק, מטעה או פוגעני.

אותה משפחה

Meta-Llama-3 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית לפיתוח יישומים?

הכרטיס מגדיר את השפה שלו כאנגלית בלבד. למרות שהוא נחשף לשפות נוספות באימון, הוא לא מכוונן לעברית ומומלץ לבדוק היטב את הפלט שלו לפני שמסתמכים עליו לשפה המקומית.

איזו תבנית פרומפט צריך להגדיר עבורו?

המודל משתמש בתבנית המובנית של Llama 3 עם תגיות מערכת, משתמש ועוזר ספציפיות כמו start_header_id ו־eot_id. בתוכנת LM Studio יש לבחור בפרופיל Llama 3 כדי שהשיחה תפורמט כראוי.

איך מריצים

הקבצים כולם שוקלים 74.9 גיגה-בייט, ומדובר במודל כבד מאוד. כדי להריץ גרסה כזו באופן מקומי צריך חומרת שרתים ייעודית עם כרטיסי מסך שמחזיקים לפחות כמה עשרות גיגה-בייט של זיכרון וידאו, או תחנת עבודה חריגה מאוד. בפורמט הזה, גרסאות קטנות וקיצוניות כמו IQ1_M ו־IQ2_XS נבנו עם מטריצת חשיבות כדי לשמור על תפקוד בסיסי, בעוד שאר הגרסאות נוצרו בכימות רגיל.

אם אין לכם כרטיסי מסך תעשייתיים זמינים, אין טעם לנסות להריץ את זה על מחשב ביתי ממוצע כי המהירות תהיה בלתי שמישה. במצב כזה עדיף לשלם לפי קריאה ל־API מסחרי של מטא או ספק ענן אחר שמריץ את המודל המקורי.

ollama run hf.co/lmstudio-community/Meta-Llama-3-70B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

בכרטיס המודל הזה לא דווח רישיון בכלל. המודל המקורי שייך למטא ומופץ דרך קהילת LM Studio, אבל העובדה שאין כאן הגדרה רשמית של רישיון שימוש אומרת שאין לכם אישור ברור לפרוס אותו במוצר מסחרי. לפני שמטמיעים אותו, חובה לבדוק את תנאי הרישיון של מטא עצמה.

הרישיון המלא בעמוד המודל ↗