GPT
O

OpenHermes-2.5-Mistral-7B-GGUF

קוד פתוח

TheBlokeapache-2.02023-11-02

  • transformers
  • gguf
  • mistral
  • instruct
  • finetune

גרסת GGUF מכווצת של מודל קוד פתוח מוביל, שעבר כוונון עדין על מיליון דוגמאות אימון. פתרון קל להרצה מקומית על מחשב אישי בלי תלות בענן.

  • 51.2 GBמשקל הקבצים
  • 9,424הורדות בחודש
  • 282לייקים

מה זה

מדובר בהמרה לפורמט GGUF של המודל OpenHermes 2.5 Mistral 7B, שנוצר במקור על ידי Teknium ומבוסס על שבעה מיליארד פרמטרים. המודל אומן על מיליון רשומות, רובן מבוססות על פלטים מסוננים מ־GPT-4, לצד תוספת של שבעה עד ארבעה עשר אחוזים של הוראות קוד. התוספת הזו דחפה קדימה לא רק משימות תכנות, אלא גם מבחני היגיון כלליים.

במבחן HumanEval הוא מציג דיוק של 50.7 אחוזים במעבר ראשון, לעומת 43 אחוזים בגרסה הקודמת. במבחן GPT-4All הממוצע שלו עומד על 73.12, כולל תוצאה של 86.57 אחוזים ב־BoolQ ו־83.46 אחוזים ב־ARC-Easy. הנתונים מראים שהכוונון הנוסף שיפר משמעותית את המענה לשאלות עובדתיות ומשימות קוד ביחס למודלים מקבילים בגודל הזה.

מתאים ל

  • עוזר פיתוח מקומי

    תוספת נתוני הקוד מעלה את הביצועים ב־HumanEval ל־50.7 אחוז, מה שמתאים לכתיבת סקריפטים ובדיקות בלי לשלוח קוד לרשת.

  • צ'אטבוט עצמאי ללא רשת

    משקל קובץ של 4.37 גיגה בייט מאפשר לו לרוץ על מחשב נייד רגיל ללא חיבור אינטרנט באמצעות LM Studio או llama.cpp.

  • מענה על שאלות והיגיון

    ציונים של מעל 80 אחוז במבחני BoolQ ו־PIQA הופכים אותו לשימושי במיון מידע ומענה מבוסס טקסט באנגלית.

איפה זה נופל

האימון על נתוני הקוד שיפר את רוב המדדים, אבל היוצר מודה שהוא גרם לפגיעה בתוצאות במבחן BigBench. בנוסף, המודל מתועד ומאומן רק באנגלית, כך שהוא לא מתאים למשימות בעברית ללא כוונון נפרד. גרסאות הכיווץ הנמוכות, כמו Q2_K וגרסאות השלושה ביט, סובלות מאובדן איכות משמעותי ולא מומלצות לשימוש אמין. חובה לבדוק את התנהגותו עם תבנית ה־ChatML המדויקת, שכן סטייה ממנה פוגעת ישירות באיכות הפלט.

אותה משפחה

OpenHermes-2.5-Mistral יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להוריד את כל המאגר בבת אחת?

לא. המאגר מכיל 15 קבצים שונים בנפח כולל של 51.2 גיגה בייט, שכוללים גרסאות שונות של אותם משקלים. צריך לבחור רק קובץ אחד שמתאים לחומרה שלכם, כמו גרסת Q4_K_M.

איזה פרומפט צריך לשלוח למודל כדי לקבל תוצאות נכונות?

המודל אומן על מבנה ChatML. חובה להשתמש בתגיות התחלה וסיום מדויקות עבור המערכת, המשתמש והעוזר, אחרת איכות התשובות והיכולת שלו להבין הוראות ייפגעו.

איך מריצים

המודל מגיע במגוון קבצים מכווצים, החל מגרסת שני ביט במשקל 3.08 גיגה בייט הדורשת 5.58 גיגה בייט זיכרון, ועד שמונה ביט במשקל 7.70 גיגה בייט. לשימוש יומיומי מומלץ לקחת את Q4_K_M ששוקל 4.37 גיגה בייט וצורך 6.87 גיגה בייט זיכרון עבודה, או את Q5_K_M שדורש 7.63 גיגה בייט זיכרון. המשמעות היא שכרטיס מסך ביתי בסיסי עם 8 גיגה בייט VRAM יספיק כדי לטעון את רוב השכבות בלי לגעת במעבד המרכזי.

אפשר להריץ אותו מקומית דרך llama.cpp, ספריות פייתון כמו ctransformers או ממשקים דוגמת LM Studio ו־text-generation-webui, תוך שימוש בתבנית ChatML. אם המטרה היא להרים שירות שמשרת מאות בקשות במקביל, כנראה עדיף להשתמש ב־API מנוהל חיצוני במקום לתחזק חומרה מקומית שמסוגלת לספק קצב סביר לעומס כזה.

ollama run hf.co/TheBloke/OpenHermes-2.5-Mistral-7B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש חופשי לגמרי, כולל שימוש מסחרי, שינוי הקוד, הפצה מחודשת ושילוב בתוך מוצרים מסחריים סגורים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים ועותק של הרישיון המקורי בקוד או במוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗