GPT
H

Hermes-2-Pro-Mistral-7B-GGUF

קוד פתוח

NousResearchapache-2.02024-03-02

  • gguf
  • Mistral
  • instruct
  • finetune
  • chatml

גרסת GGUF יעילה למודל 7B שמיועדת להרצה מקומית ב־llama.cpp. הוא בולט בעיקר בזכות אימון ייעודי להפעלת פונקציות והחזרת מבני JSON מדויקים.

  • 50.9 GBמשקל הקבצים
  • 45,825הורדות בחודש
  • 261לייקים

מה זה

מדובר בעדכון מקיף ל־Nous Hermes 2 שמבוסס על Mistral 7B, כשהחידוש העיקרי הוא תוספת דאטה־סט פנימי לקריאות פונקציה ופלט מובנה. המודל נשען על פורמט ChatML עם תגיות מערכת ייעודיות לכלים, מה שהופך את השילוב שלו בקוד לפשוט בלי צורך בטריקים מורכבים של הנדסת פרומפטים.

במבחני ביצועים מול Fireworks.AI הוא הגיע לדיוק של 90 עד 91 אחוזים בקריאות פונקציה ובין 81 ל־84 אחוזים ביצירת JSON לפי סכמה. במבחנים כלליים כמו GPT4All הוא מציג ממוצע של 71.19, אבל ברור שהכוח האמיתי שלו נמצא באוטומציה של משימות ואינטגרציות API ולא בידע אנציקלופדי.

מתאים ל

  • סוכן אוטומציה מבוסס כלים

    חילוץ קריאות API ופרמטרים מתוך שיחה ישירות לקוד, הודות לדיוק של 91 אחוזים במבחני הפעלת פונקציות.

  • חילוץ מידע למבנה JSON

    המרת טקסט חופשי למבנה נתונים מוגדר לפי סכמה, עם דיוק מוכח של מעל 80 אחוזים בפלט מובנה.

  • עוזר מקומי בצריכת זיכרון נמוכה

    הרצה מקומית על חומרה ביתית סביב 5GB זיכרון וידאו, שמתאימה למערכות שדורשות פרטיות מלאה.

איפה זה נופל

למרות השדרוג בכלים, יכולות ההסקה המורכבות עדיין מוגבלות מעצם היותו מודל 7B. במבחני BigBench הוא קיבל ממוצע של 41.65 וב־AGIEval עמד על 44.52 בלבד. בנוסף, במבחן TruthfulQA הוא עומד על 41 אחוזים במדד הראשון, מה שמראה נטייה להזיות.

חיסרון בולט נוסף הוא שהמודל אומן והוגדר רשמית עבור אנגלית בלבד. אם אתם בונים מערכת מבוססת עברית, לא הייתי מסתמך עליו לקריאות פונקציה מורכבות בלי לבדוק קודם היטב את תקינות הפלט.

אותה משפחה

Hermes-2-Pro-Mistral יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל לקריאת פונקציות מתוך ממשק LM Studio?

לא. כרטיס המודל מציין במפורש שממשק LM Studio מתאים רק לשיחות טקסט רגילות בפורמט ChatML, וכדי לנצל את קריאות הפונקציה צריך להשתמש בקוד ההרצה שהמפתחים פרסמו בגיטהאב.

האם צריך להוריד את כל 50.9 הג'יגהבייט כדי להשתמש במודל?

ממש לא. המשקל הכולל נובע מכך שבעמוד מרוכזים 14 קבצים שונים ברמות כימות משתנות, ואתם צריכים להוריד רק קובץ GGUF בודד שמתאים לגודל הזיכרון הפנוי שלכם.

איך מריצים

המודל ארוז בפורמט GGUF, כך שהוא רץ ישירות דרך llama.cpp או כלים גרפיים כמו LM Studio. לפי המפתחים, גרסת 4bit דורשת סביב 5GB זיכרון כרטיס מסך, מה שמאפשר להריץ אותו בקלות על כרטיסים ביתיים פשוטים או מחשבי מק עם זיכרון משותף.

הריפו מכיל 14 קבצים בנפח כולל של 50.9GB שמכסים דרגות כימות שונות, כך שאפשר לבחור קובץ יחיד שמתאים למגבלות הזיכרון שלכם במקום להוריד הכל. אם אתם צריכים רק ממשק שיחה בסיסי ללא פונקציות, LM Studio יעבוד מיד, אך להפעלת כלים תצטרכו להשתמש בקוד הפייתון הייעודי שהצוות שחרר.

ollama run hf.co/NousResearch/Hermes-2-Pro-Mistral-7B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל משוחרר ברישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי לחלוטין, שינוי של הקוד והמשקלים והפצה במוצרים סגורים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים ומסמך הרישיון המקורי, בלי אחריות מצד המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗