GPT
H

Hermes-2-Pro-Mistral-7B

קוד פתוח

NousResearchapache-2.02024-03-11

  • transformers
  • safetensors
  • mistral
  • text-generation
  • Mistral

גרסה מכווננת של מיסטרל 7B שמתמקדת בהפעלת פונקציות ובפליטת JSON תקני. אם אתם צריכים סוכן קטן שעובד מול כלים חיצוניים בלי להסתמך על שירות ענן סגור, זו נקודת פתיחה מצוינת.

  • 7.2Bפרמטרים
  • 32,768טוקנים בהקשר
  • 13.5 GBמשקל הקבצים
  • 4,801הורדות בחודש

מה זה

המודל הזה לוקח את הבסיס המוכר של מיסטרל בגודל 7B ומאמן אותו על מערכי נתונים פנימיים שנועדו במיוחד לקריאות לפונקציות ולמבנה נתונים קשיח. המטרה כאן היא לתת מענה לפעולות אוטומטיות, כשהמערכת שלכם צריכה לקבל פלט במבנה ידוע מראש במקום טקסט חופשי שעלול להישבר בכל רגע.

בבדיקות מול מערכי הערכה ייעודיים שנבנו עם Fireworks.AI, המודל הגיע לדיוק של 91% בהפעלת פונקציות ול־84% ביצירת פלט JSON לפי סכמה. במבחנים כלליים כמו GPT4All הוא מחזיק ממוצע של 71.19, לצד ממוצעים נמוכים יותר של 44.52 ב־AGIEval ו־41.65 ב־BigBench. המספרים האלה מראים בבירור את החוזק שלו במשימות מוגדרות של עיבוד נתונים, לצד ביצועים בינוניים למדי כשמדובר בהיגיון מופשט או במבחני ידע כללי מורכבים.

מתאים ל

  • הפעלת פונקציות וכלים

    אידיאלי לסוכנים שצריכים לזהות כוונת משתמש ולקרוא ל־API חיצוני עם פרמטרים מדויקים.

  • חילוץ מידע לתוך JSON

    מעולה לקבלת טקסט חופשי והמרתו לאובייקט מבני לפי סכמת Pydantic מוגדרת מראש.

  • שיחה מובנית מבוססת ChatML

    מתאים לבוטים שדורשים שליטה הדוקה בסגנון דרך System Prompt לפי התקן המוכר של OpenAI.

איפה זה נופל

הדיוק ב־JSON עומד על 84%, מה שאומר שאחת מכל שש תשובות בערך לא תתאים לסכמה שהגדרתם, ובקוד אמיתי זה יגרום לשגיאות פענוח אם לא תשימו מנגנון תפיסה ובקשה חוזרת. בנוסף, המודל מאומן באנגלית בלבד, כך שלא כדאי לבנות עליו לפקודות או לחילוץ מידע בעברית, והציונים שלו במבחני היגיון כמו AGIEval נמוכים ומחייבים בדיקה קפדנית לפני שסומכים עליו בהחלטות מורכבות.

אותה משפחה

Hermes-2-Pro-Mistral יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לעיבוד טקסטים בעברית?

המודל הוגדר ואומן לשפה האנגלית בלבד. הוא עשוי להבין מילים בודדות בעברית עקב אימון הבסיס של מיסטרל, אבל הוא ייכשל במשימות מורכבות, בניסוח קריאות לפונקציות וביצירת JSON יציב כשהקלט הוא בעברית.

איך המודל מחזיר את הקריאה לפונקציה בקוד?

הוא משתמש בתחביר מיוחד של ChatML עם תגיות ייעודיות בשם tool_call שמכילות את שם הפונקציה והארגומנטים ב־JSON. כדי שהמערכת תעבוד, הקוד שלכם צריך לקרוא את התגית הזו, לבצע את הפעולה בפועל, ולהחזיר את התוצאה תחת תפקיד tool כדי שהמודל ימשיך את השיחה.

איך מריצים

כדי להריץ את המודל המקורי בדיוק bfloat16 מלא, תצטרכו כרטיס מסך עם לפחות 16GB של זיכרון וידאו, שכן הקבצים תופסים 13.5GB. אם אתם מריצים אותו בכימות של 4 ביט, דרישת הזיכרון צונחת לכ־5GB בלבד, מה שמאפשר להריץ אותו אפילו על מחשב מקומי סביר או על חומרה זולה בענן.

הריצה נעשית ישירות דרך ספריית transformers בפייתון או באמצעות קובצי GGUF בתוכנות ייעודיות לשיחה. אם אין לכם עניין לנהל שרתים מקומיים או לכתוב קוד לפענוח התגיות המיוחדות של הפונקציות, עדיף להשתמש בנקודת קצה קיימת של ספקי ענן.

from transformers import pipeline

pipe = pipeline("text-generation", model="NousResearch/Hermes-2-Pro-Mistral-7B")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי של המודל, הפצה מחדש והטמעה במוצרים סגורים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים וציון השינויים שביצעתם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗