GPT
O

OpenHermes-2-Mistral-7B-GGUF

קוד פתוח

TheBlokeapache-2.02023-10-14

  • transformers
  • gguf
  • mistral
  • instruct
  • finetune

גרסה מכווצת של כוונון עדין על בסיס מיסטרל, שאומנה על דאטה סינתטי מ־GPT-4. היא מתאימה למי שרוצה להריץ שיחה וקוד מקומית בלי חומרת שרתים יקרה.

  • 51.2 GBמשקל הקבצים
  • 4,433הורדות בחודש
  • 77לייקים

מה זה

מדובר באריזה של המודל OpenHermes 2 שיצר Teknium, בפורמט GGUF להרצה על מעבדים וכרטיסים ביתיים. הבסיס הוא Mistral 7B שעבר אימון על 900 אלף דוגמאות שיחה וקוד שעברו סינון, תוך שימוש במבנה ChatML שמגדיר בבירור תפקידי מערכת ומשתמש.

במדדי ביצועים כמו GPT4All הוא מגיע לציון ממוצע של 72.68, עם תוצאות חזקות במיוחד במשימות הבנה והגיון בסיסי כמו boolq שבו רשם 86.88 אחוז דיוק. הוא עוקף מודלים קודמים בסדרה הזו, אבל עדיין מתקשה יותר במבחני היסק מורכבים כמו BigBench שבהם משימות לוגיות מרובות שלבים נעצרות סביב עשרות אחוזים בודדים.

מתאים ל

  • בוט שיחה מקומי

    תמיכה בתבנית ChatML מאפשרת לנהל שיחות מוגדרות מראש ללא תלות ברשת או שירותי ענן.

  • עוזר פיתוח ותכנות

    האימון על נתוני קוד איכותיים מספק השלמות קוד ומענה על שאלות טכניות ישירות מהמחשב.

  • משחקי תפקידים

    הוא מגיב היטב להוראות מערכת מורכבות ומסוגל להיכנס לדמויות בדיוניות בעקביות.

איפה זה נופל

הנתונים חושפים ירידה חדה במשימות שדורשות היסק גיאומטרי או לוגיקה מרובת שלבים, שם התוצאות במבחן BigBench צונחות ל־20 עד 37 אחוז דיוק בלבד. בנוסף, מדובר במודל שהוגדר באנגלית בלבד, כך שאין לצפות לביצועים סבירים בעברית בלי התאמות חיצוניות.

שאלות
נפוצות

איזה קובץ בדיוק צריך להוריד מתוך הרשימה?

עבור רוב השימושים כדאי לבחור ב־Q4_K_M שנותן שיווי משקל מצוין בין איכות לגודל קובץ של 4.37 גיגה. הורדת כל המאגר מיותרת ותבזבז מעל 50 גיגה של נפח אחסון סתם.

האם המודל ירוץ בצורה חלקה ללא כרטיס מסך של אנבידיה?

כן, פורמט GGUF פותח במיוחד כדי לאפשר ריצה ישירה על גבי המעבד וזיכרון ה־RAM של המחשב. כרטיס מסך ייעודי רק יאיץ את מהירות הפקת הטקסט, אך אינו תנאי הכרחי לפעולה.

איך מריצים

כדי להריץ אותו בפועל מורידים קובץ בודד מהמאגר ולא את כל התיקייה. הקובץ המאוזן ביותר הוא Q4_K_M ששוקל 4.37 גיגה ומצריך פחות מ־7 גיגה של זיכרון עבודה כדי לעבוד על המעבד, או כרטיס מסך עם 6 עד 8 גיגה VRAM להרצה מלאה ומהירה.

אם יש צורך ברמת דיוק גבוהה יותר בלי לאבד הרבה משקל, גרסאות Q5_K_M דורשות כ־7.6 גיגה זיכרון. מריצים את הקבצים האלה בעזרת llama.cpp, ספריות פייתון כמו ctransformers, או ממשקים גרפיים מקומיים דוגמת LM Studio.

ollama run hf.co/TheBloke/OpenHermes-2-Mistral-7B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. זהו רישיון מתירני שמאפשר שימוש מסחרי, שינוי קוד והפצה של המודל בתוך שירותים או מוצרים עצמאיים, כל עוד שומרים על הודעת זכויות היוצרים והתנאים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗