GPT
N

NeuralHermes-2.5-Mistral-7B

קוד פתוח

mlabonneapache-2.02023-11-29

  • transformers
  • safetensors
  • mistral
  • text-generation
  • instruct

גרסת כוונון עדין על בסיס מיסטרל שמוסיפה אופטימיזציית העדפות ישירה. מקבלים מודל שיחה זריז עם תוצאות משופרות במבחני ביצועים ביחס למקור.

  • 7.2Bפרמטרים
  • 32,768טוקנים בהקשר
  • 13.5 GBמשקל הקבצים
  • 72הורדות בחודש

מה זה

הבסיס כאן הוא המודל הפתוח אופן-הרמס 2.5, שעבר אימון DPO נוסף באמצעות דאטה-סט מותאם למבנה צ'אט-מל. המטרה היתה לחקות את שיטת השיפור שאינטל הציגה במודל שלהם כדי לחדד את התשובות. האימון עצמו לקח בערך שעה בודדת על גבי מאיץ A100 יחיד, מה שמסביר למה מדובר בכוונון ממוקד ולא בבנייה מחדש.

במדדים המוצגים הוא עוקף את מודל המקור שלו בהפרשים קטנים, למשל עליה מ־43.07 ל־43.62 ב־AGIEval ועליה קלה ב־GPT4All ל־73.25, לצד שיפור ב־TruthfulQA. אלה לא פערים שמשנים את חוקי המשחק, אבל במודלים של 7 מיליארד פרמטרים כל שבריר אחוז כזה מתבטא בדיוק טיפה יותר יציב ופחות הזיות בתשובות עובדתיות.

מתאים ל

  • בוט שיחה קומפקטי באנגלית

    האימון במבנה ChatML עם DPO הופך אותו למגיב עקבי ומדויק יותר ממודל 7B ממוצע.

  • הרצה מקומית על מחשב אישי

    קיימים קובצי GGUF מוכנים שמאפשרים עבודה חלקה דרך LM Studio בלי צורך בשרת יקר.

  • סיווג ותמצות קצר באנגלית

    השיפור במבחני האמינות והדיוק נותן יתרון במשימות טקסט ממוקדות שדורשות מענה מהיר.

איפה זה נופל

המודל אומן ותועד עבור השפה האנגלית בלבד. מי שבונה על עברית יגלה מהר מאוד ביצועים חלשים, ג'יבריש או תשובות מקוטעות. בנוסף, חלון האימון בפועל הוגבל לאורך פרומפט של 1,024 טוקנים ואורך מקסימלי של 1,536, למרות שהארכיטקטורה הבסיסית תומכת בהקשר רחב יותר, מה שעלול לפגוע ביכולת שלו לעבד שיחות ארוכות במיוחד.

שאלות
נפוצות

האם המודל מתאים לעבודה בעברית?

הכרטיס מצהיר על תמיכה באנגלית בלבד. הוא מסוגל לפעמים לפלוט מילים בעברית בזכות משקלי הבסיס של מיסטרל, אבל רמת ההבנה והדקדוק תהיה נמוכה ולא הייתי משלב אותו במוצר שמיועד לקהל ישראלי.

מה ההבדל בינו לבין אופן-הרמס הרגיל?

הוא לקח את המודל המקורי והוסיף לו שכבת אופטימיזציה של העדפות אנושיות בעזרת אלגוריתם DPO. התוצאה היא ציונים טיפה יותר גבוהים במבחני אמינות וידע, לצד שמירה על תבנית שיחה מוגדרת היטב.

איך מריצים

כדי להריץ אותו במשקל המקורי של 13.5 גיגה-בייט בדיוק מלא של 16 ביט צריך כרטיס מסך עם לפחות 16 עד 24 גיגה זיכרון גרפי. אפשר להשתמש ישירות בספריית transformers או בכלים כמו LM Studio. אם רוצים לחסוך משאבים, נוצרו לו גרסאות מכווצות בפורמטים שונים כמו GGUF, AWQ, GPTQ ו־EXL2 שמאפשרות דחיסה עד לרמות של 3 או 4 ביט.

ברגע שעוברים לגרסה מכווצת אפשר לדחוף אותו גם לחומרה ביתית צנועה או מעבד רגיל. אם אתם צריכים רק שאילתות בודדות ולא רוצים להחזיק שרת דולק כל הזמן, שירותי ענן עם ממשק מוכן יצאו זולים יותר מהקצאת מכונה ייעודית.

from transformers import pipeline

pipe = pipeline("text-generation", model="mlabonne/NeuralHermes-2.5-Mistral-7B")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצר סגור בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗