GPT
M

Meta-Llama-3-120B-Instruct-GGUF

קוד פתוח

lmstudio-communityother2024-05-09

  • gguf
  • merge
  • mergekit
  • lazymergekit
  • text-generation

מיזוג עצמי שלקח את לאמה 3 של 70 מיליארד פרמטרים וניפח אותו ל־120 בלי אימון מחדש. מי שמוריד אותו מחפש יכולות מעבר ל־70B אבל בלי לגעת במפלצות של 400B.

  • 800 GBמשקל הקבצים
  • 2,186הורדות בחודש
  • 48לייקים

מה זה

מקסים לאבון יצר את המודל הזה באמצעות MergeKit בשיטת self-merge על בסיס לאמה 3 בגרסת 70B Instruct. הרעיון במיזוג עצמי כזה הוא מתיחת שכבות שמנסה להרחיב את היכולות של מודל המקור בלי לשלם על אימון חדש מאפס. הגרסה הזו נארזה בפורמט GGUF על ידי bartowski עם llama.cpp, מה שנועד לאפשר הרצה מקומית דרך LM Studio עם תבנית הפרומפט הרגילה של לאמה 3.

בפועל, כרטיס המודל לא מציג תוצאות מדידה או מבחני ביצועים שמראים מה המיזוג הזה שווה באמת. אין פה נתונים רשמיים על דיוק, קידוד או שפות. כל מה שיש זה קונספט של מודל מנופח שמנסה להתנהג כמו משהו גדול יותר מהמקור שלו, וזה הימור שצריך לבדוק לבד מול המשימות שלכם.

מתאים ל

  • ניסויי מיזוג מקומיים

    בדיקת ההשפעה של טכניקת self-merge על ביצועי מודל שפה, למי שחוקר ארכיטקטורות ומחזיק שרת ייעודי.

  • מעבדה פנימית מבודדת

    הרצה על שרת מקומי חזק כשרוצים לבחון מודל רחב בלי להוציא שום נתון החוצה לספקי ענן.

  • השוואת איכות מול 70B

    ולידציה ישירה של תשובות מול מודל הבסיס כדי לראות אם שכפול השכבות אכן תרם למשימות טקסט מורכבות.

איפה זה נופל

הכרטיס מודה בגלוי שאין כאן הרבה פרטים טכניים חוץ מקונפיגורציית המיזוג עצמה, ואין שום התחייבות ליציבות או לדיוק. מיזוגים עצמיים מסוג זה עלולים לייצר חוסר עקביות, הזיות ופגיעה בלוגיקה הבסיסית שהייתה במודל המקורי, והסרת האחריות של המפרסמים מבהירה שהתוכן עשוי להיות שגוי או מטעה. לפני שמשלבים דבר כזה בתהליך עבודה, חייבים לבדוק נקודתית שהוא לא ממציא תשובות או מאבד את ההקשר.

אותה משפחה

Meta-Llama-3 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה אומן מחדש על דאטהסט חדש?

לא. מדובר במיזוג עצמי שבוצע בעזרת MergeKit על בסיס מודל 70B קיים, ללא עלויות אימון נוספות.

איזה פרומפט צריך להגדיר כדי להפעיל אותו?

עובדים עם הפורמט הסטנדרטי של לאמה 3 עם התגיות הייעודיות של מערכת, משתמש ועוזר, או שבוחרים בהגדרה המוכנה ב־LM Studio.

האם אפשר להריץ אותו על מחשב נייד רגיל?

ממש לא. מדובר במודל של 120 מיליארד פרמטרים שדורש חומרה כבדה וזיכרון עצום כדי לפעול בקצב שמיש.

איך מריצים

המשקל הכולל של כל הקבצים במאגר מגיע ל־800 גיגה-בייט שמחולקים ל־35 קבצים בפורמט GGUF. כדי להריץ משקל כזה מקומית צריך מפלצת חומרה אמיתית, כמה כרטיסי מסך חזקים או שרת עם כמויות זיכרון וידאו ו־RAM שרוב המפתחים לא מחזיקים מתחת לשולחן. אם יש לכם רק תחנת עבודה בסיסית, הקבצים האלה פשוט יישבו אצלכם בלי לזוז.

ההרצה עצמה דורשת שימוש ב־llama.cpp או טעינה ישירה לתוך LM Studio תוך בחירה בתבנית הפרומפט של לאמה 3. אם אין לכם גישה לשרת ייעודי שיכול לבלוע עשרות ומאות גיגות של זיכרון במהירות סבירה, שימוש ב־API חיצוני למודל פתוח גדול יהיה הרבה יותר זול והגיוני.

ollama run hf.co/lmstudio-community/Meta-Llama-3-120B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

35 קבצים במאגר, 800 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר בתור other, כלומר רישיון מותאם שלא הוגדר כקוד פתוח סטנדרטי. במצב כזה אסור להניח שמותר להשתמש בו לצרכים מסחריים בלי לחפור בתנאי הרישיון המקוריים של יוצר המיזוג ושל לאמה 3. אם אתם בונים מוצר מסחרי, חוסר הבהירות הזה מחייב בדיקה משפטית לפני שמפיצים אותו ללקוחות.

הרישיון המלא בעמוד המודל ↗