GPT
N

Nous-Hermes-2-Mistral-7B-DPO

קוד פתוח

NousResearchapache-2.02024-02-18

  • transformers
  • safetensors
  • mistral
  • text-generation
  • Mistral

גרסת כוונון עדין למודל Mistral שעברה אימון Direct Preference Optimization. הבחירה בה הגיונית אם מחפשים מודל שיחה ממושמע לקלטים מורכבים במעטפת של 7 מיליארד פרמטרים.

  • 7.2Bפרמטרים
  • 32,768טוקנים בהקשר
  • 13.5 GBמשקל הקבצים
  • 1,650הורדות בחודש

מה זה

המודל הזה נבנה על בסיס OpenHermes 2.5, שעבר בעצמו אימון על כמיליון שיחות והוראות באיכות גבוהה, בעיקר דאטה סינתטי. שלב ה־DPO הוסיף לו יישור ישיר מול העדפות אנושיות. הוא משתמש בפורמט ChatML המוכר מהממשקים של OpenAI, מה שהופך את ההטמעה שלו בצינורות קיימים לפשוטה, ומאפשר לו להישמע להוראות מערכת קפדניות יותר מהגרסה המקורית של מיסטרל.

במבחני ביצועים הוא מציג שיפור מול גרסת הבסיס הקודמת שלו. במבחן GPT4All הוא מגיע לממוצע של 73.72, עם ציונים גבוהים במשימות כמו BoolQ ו־PIQA. עם זאת, במבחני היגיון וידע מורכבים יותר כמו AGIEval הוא עומד על ממוצע של 43.63, וב־BigBench על 41.94. המספרים האלה מראים שיש פה כלי טוב לעבודה שוטפת וניסוח, אבל לא תחליף למודלי ענק במשימות שדורשות הבנה לוגית עמוקה.

מתאים ל

  • בוט שיחה במבנה ChatML

    תמיכה מובנית בתבנית שיחה מרובת תורות והיענות טובה להוראות מערכת מורכבות.

  • חילוץ מידע למבני JSON

    אימון ייעודי על נתונים סינתטיים מאפשר לו להחזיר רשימות ומבני נתונים מקוננים.

  • משחקי תפקידים והנחיה

    היכולת להיצמד לדמות מוגדרת בהוראת המערכת נבדקה והודגמה כחלק מיכולות הבסיס.

איפה זה נופל

הנתונים הרשמיים מוגבלים לשפה האנגלית בלבד, כך שלא הייתי בונה עליו לעיבוד או יצירת טקסט בעברית ללא בדיקה יסודית. נקודת תורפה נוספת מופיעה במבחן TruthfulQA, שם הוא מקבל ציון של 0.3892 במדד mc1 ו־0.5642 ב־mc2. המשמעות היא שהמודל עדיין נוטה להמציא עובדות או לחזור על טעויות נפוצות. אסור להסתמך עליו כמקור אמת עובדתי ללא מנגנון אימות חיצוני או בדיקת מקורות.

אותה משפחה

Nous-Hermes-2-Mistral יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית לשימוש במוצר?

הכרטיס מצהיר על תמיכה באנגלית בלבד. מודלים שמבוססים על Mistral מסוגלים לפעמים לקרוא מילים בעברית, אבל בהיעדר אימון ייעודי, הפלט לרוב שבור או לא מדויק. אם המוצר שלכם פונה לשוק המקומי, תצטרכו לבדוק את זה ידנית או לחפש מודל שעבר התאמה לשפה.

במה שונה גרסת ה־DPO מגרסאות OpenHermes קודמות?

המודל עבר שלב אופטימיזציה ישיר של העדפות על גבי OpenHermes 2.5. התהליך הזה משפר את המענה לבקשות המשתמש ומקטין סטיות מההנחיות. מבחני הביצועים מראים עליונות עקבית של גרסת ה־DPO על פני המודל המקורי בכל המדדים שנבדקו.

איך מריצים

כדי להריץ את המודל המלא בפורמט bfloat16 צריך כרטיס מסך עם לפחות 16GB זיכרון ייעודי, בהתחשב בכך שמשקל הקבצים עומד על 13.5GB. אם תמירו אותו לקוונטיזציה של 4 ביט, הוא יוכל לרוץ גם על כרטיס עם 5GB זיכרון בלבד דרך ספריות כמו Transformers או בכלים כמו LM Studio.

אם אתם צריכים להריץ שאילתות בודדות או לבדוק היתכנות, כנראה שעדיף להשתמש בנקודת קצה מנוהלת במקום להחזיק שרת דלוק. מנגד, אם יש לכם חומרה מקומית ואתם צריכים עיבוד נתונים מקומי ללא שליחת מידע החוצה, משקל הזיכרון הנמוך הופך אותו לפתרון נגיש.

from transformers import pipeline

pipe = pipeline("text-generation", model="NousResearch/Nous-Hermes-2-Mistral-7B-DPO")
print(pipe("שלום"))

הרישיון

הפרויקט משוחרר תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי של הקוד והמשקולות והפצה שלהם בתוך מוצרים פרטיים או מסחריים, ללא תשלום תמלוגים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים וציון השינויים שנעשו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗