GPT
N

Nous-Hermes-2-Mixtral-8x7B-DPO-GGUF

קוד פתוח

TheBlokeapache-2.02024-01-16

  • transformers
  • gguf
  • mixtral
  • Mixtral
  • instruct

גרסה מכווצת של מודל המומחים המוביל של Nous Research, שעבר כוונון DPO על גבי Mixtral. הוא מיועד למי שרוצה ביצועים של מודל ענק מקומי בלי לקנות שרת ייעודי.

  • 231 GBמשקל הקבצים
  • 2,769הורדות בחודש
  • 66לייקים

מה זה

מדובר באריזת GGUF למודל Nous Hermes 2 שנבנה על בסיס Mixtral 8x7B. המודל המקורי אומן על מעל מיליון רשומות, רובן נוצרו באמצעות GPT-4, ועבר תהליך אופטימיזציה של DPO שמחדד את ההיענות להוראות. לפי המפתחים, השילוב הזה עוקף את מודל ה־Instruct המקורי של MistralAI במבחנים כמו GPT4All עם ממוצע של 75.70, וציון 46.05 ב־AGIEval.

המשמעות בפועל היא יכולת טובה מאוד בכתיבת קוד, הבנת שאלות מורכבות ומעקב צמוד אחרי פרומפטים בפורמט ChatML. בזכות מבנה ה־Mixture of Experts, אתם מקבלים איכות של מודל רחב אבל עם מהירות תגובה גבוהה יותר בזמן ריצה, כיוון שרק חלק מהרשת מופעל בכל טוקן.

מתאים ל

  • ייצור קוד וסקריפטים

    אימון ה־DPO על נתוני GPT-4 נותן מענה מדויק למשימות פיתוח מורכבות.

  • עבודה עצמאית ללא ענן

    הפורמט מאפשר הרצה פנימית בתוך ארגון שחייב פרטיות מוחלטת למידע.

  • צ'אט בפורמט ChatML

    מבנה השיחה המובנה מתאים למערכות שירות ודיאלוג שדורשות עקביות.

איפה זה נופל

המודל מוגדר רשמית לדוברי אנגלית בלבד. לא כדאי לבנות עליו לפרויקטים בעברית, שכן אוצר המילים ואיכות הפלט בשפה זו יפגעו קשות. בנוסף, בגרסאות הדחיסה הנמוכות כמו Q2_K יש אובדן איכות מורגש ביותר שהופך את השימוש ללא מומלץ. נקודה טכנית קריטית היא הדרישה לפורמט ChatML מדויק, אם תשמיטו את התגיות הנכונות של המערכת והמשתמש, התשובות שלו יאבדו כיוון.

שאלות
נפוצות

איזה קובץ הכי מומלץ להוריד מהרשימה?

הקובץ המומלץ לרוב השימושים הוא Q4_K_M. הוא שוקל 28.45 גיגה, שומר על איזון מצוין בין איכות הטקסט לבין דרישות הזיכרון, ולא מציג ירידה דרסטית ביכולות לעומת המודל המלא.

האם אפשר להריץ אותו בלי מעבד גרפי בכלל?

כן, llama.cpp וכלים דומים תומכים בהרצה על מעבד רגיל בלבד. עם זאת, תצטרכו לפחות 32 גיגה של זיכרון RAM פנוי לקובץ 4 ביט, ומהירות יצירת הטוקנים תהיה איטית משמעותית בהשוואה לכרטיס מסך.

איך מריצים

כדי להריץ אותו מקומית תצטרכו כלי תומך GGUF כמו llama.cpp, LM Studio או text-generation-webui. אם אתם רוצים את שביל האמצע בין איכות למשאבים, קובץ ה־Q4_K_M שוקל 28.45 גיגה וידרוש כמעט 31 גיגה של זיכרון עבודה כדי לרוץ על המעבד, או שילוב של כרטיס מסך חזק כדי לדחוף אליו חלק מהשכבות. גרסת Q5_K_M תדרוש כבר קרוב ל־36 גיגה זיכרון.

אם אין לכם לפחות 32 גיגה RAM פנויים או כרטיס עם זיכרון וידאו מכובד, הריצה המקומית תזחל ותתסכל. במצב כזה, עדיף בהרבה להשתמש ב־API מרוחק של ספק ענן שמחזיק את המודל המקורי.

ollama run hf.co/TheBloke/Nous-Hermes-2-Mixtral-8x7B-DPO-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון פתוח ומתירני שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והפצה פנימית או חיצונית במוצר שלכם. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗