GPT
N

NousResearch/Nous-Hermes-2-Mixtral-8x7B-DPO-GGUF

קוד פתוח

NousResearchapache-2.02024-01-16

  • gguf
  • Mixtral
  • instruct
  • finetune
  • chatml

גרסת קוד פתוח מכווננת לארכיטקטורת מומחים, שמציגה ביצועי שיחה והיגיון גבוהים מהמקור של מיסטרל. היא מתאימה למי שרוצה להריץ לוקאלית מודל חזק עם פורמט פקודות מוכר.

  • 328 GBמשקל הקבצים
  • 2,688הורדות בחודש
  • 76לייקים

מה זה

הבסיס כאן הוא ארכיטקטורת המומחים של מיקסטרל, שעברה אימון נוסף על יותר ממיליון דוגמאות שרובן הופקו מ־GPT-4 לצד מאגרי מידע פתוחים. תהליך ההכשרה כלל גם כוונון עדין בהנחיה וגם אופטימיזציה ישירה להעדפות, מה שמייצר תגובות מלוטשות יותר לשיחה ולכתיבת קוד.

במדדי הביצועים שהוצגו, הוא עוקף בממוצע את מודל ההוראות המקורי של מיסטרל. בבדיקות GPT4All הוא מגיע לממוצע של 75.70, במבחן AGIEval ל־46.05 וב־BigBench הוא עומד על 49.70. המשמעות בפועל היא יכולת סבירה במשימות חשיבה מורכבות והבנת הוראות באנגלית, לצד שמירה על התנהגות עקבית בפורמט ChatML שזהה לזה של OpenAI.

היתרון המרכזי מול מודלים אחרים במשקל הזה הוא השילוב בין אימון ההעדפות לבין אריזת ה־GGUF, שמאפשרת גמישות בבחירת רמות כימות לריצה מקומית על מעבדים וכרטיסים גרפיים ביתיים.

מתאים ל

  • פיתוח כלי קוד פנימיים

    הוא מציג יכולת טובה בכתיבת קוד לוויזואליזציה ומאפשר שמירה על המידע בשרת המקומי של הארגון.

  • סוכני שיחה מותאמים

    התמיכה המלאה ב־ChatML והגדרות מערכת מפורטות עוזרות לשלוט באישיות ובסגנון התשובות לאורך זמן.

  • היפוך ויצירת פרומפטים

    הוא הוכשר לקחת טקסט קיים ולייצר ממנו פרומפט מתאים למודלים אחרים בצורה עקבית.

איפה זה נופל

המודל אומן בעיקר על אנגלית ואין שום נתונים על יכולות העבודה שלו בעברית, כך שלא כדאי לבנות עליו לשפה מקומית בלי בדיקה יסודית. מעבר לכך, המדדים מראים נקודות תורפה ברורות במבחנים מסוימים, כמו ציון של 34.40 במבחן הבנת הנקרא openbookqa, מה שמלמד שהוא עדיין עלול לפספס עובדות ולייצר הזיות.

אותה משפחה

Nous-Hermes-2-Mixtral יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להוריד את גרסת ה־DPO או להישאר עם ה־SFT?

גרסת ה־DPO עברה כוונון נוסף להעדפות אנושיות, ולכן ברוב המקרים היא תיתן תשובות שנשמעות טבעיות ומדויקות יותר להוראות. עם זאת, היוצרים שחררו גם גרסת SFT בלבד למי שמעדיף התנהגות פחות מרוסנת או רוצה להמשיך לאמן את המודל בעצמו.

כמה זיכרון וידאו אני חייב כדי להריץ את המודל הזה לוקאלית?

הכרטיס מדגיש שאפילו ברמת כימות של 4 ביט תצטרכו יותר מ־24GB של VRAM כדי לפרוס אותו במלואו על המעבד הגרפי. אם יש לכם פחות מזה, תצטרכו לזלוג לזיכרון הראשי של המחשב בעזרת llama.cpp, מה שיאט מאוד את מהירות התגובה.

איך מריצים

קובצי ה־GGUF מיועדים להרצה עם llama.cpp או תוכנות כמו LM Studio שתומכות בפורמט ChatML ישירות מהקופסה. אפשר לטעון אותם לזיכרון הראשי לצד כרטיס המסך, אבל קחו בחשבון שגם בכימות אגרסיבי של 4 ביט תצטרכו מעל 24GB של זיכרון וידאו אם תרצו הרצה מלאה ומהירה על ה־GPU.

אם אין לכם חומרה ייעודית עם שפע זיכרון, קצב יצירת הטוקנים ירד משמעותית. במצב כזה, עדיף לפנות ל־API חיצוני שמארח את המודל במקום לסחוב קבצים כבדים ולחנוק את המחשב המקומי.

ollama run hf.co/NousResearch/Nous-Hermes-2-Mixtral-8x7B-DPO-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון פתוח ומתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה של המודל בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗