GPT
O

OpenHermes-2.5-Mistral-7B-16k-GGUF

קוד פתוח

TheBlokeapache-2.02023-11-16

  • transformers
  • gguf
  • mistral
  • instruct
  • finetune

גרסה מכווצת של מודל קוד ושיחה ותיק, שהורחבה לעבודה עם 16 אלף תווים. מתאימה למי שרוצה להריץ מודל טקסט מקומית על חומרה צנועה.

  • 51.2 GBמשקל הקבצים
  • 2,301הורדות בחודש
  • 58לייקים

מה זה

מדובר בהמרה של TheBloke למודל שעבר אימון על בסיס מיסטרל שבעה מיליארד פרמטרים. המקור אומן על מיליון דוגמאות שיחה שרובן נוצרו על ידי מודלים חזקים יותר, עם תוספת של שבעה עד 14 אחוז דאטה של קוד. התוספת הזו דחפה את התוצאה שלו במבחן הקוד HumanEval לציון של 50.7 אחוז במעבר ראשון, לעומת 43 אחוז בגרסה הקודמת.

ההבדל המרכזי כאן הוא הרחבת חלון ההקשר לשישה עשר אלף טוקנים לצד המרה לפורמט GGUF. החישוב והאימון הנוסף שיפרו מדדים כלליים של הבנה וידע כמו TruthfulQA וסט המבחנים של GPT4All, שבו הוא מחזיק ממוצע של 73.12, אבל פגעו בביצועים שלו במבחן BigBench. הפורמט הזה מאפשר להריץ אותו ישירות במעבד ובכרטיס המסך בלי תלויות מורכבות.

מתאים ל

  • עוזר תכנות מקומי

    מציג שיפור לציון של 50.7 אחוז במבחן קוד, ורץ ישירות על לפטופ פיתוח ללא שליחת קוד החוצה.

  • ניתוח מסמכים בינוניים

    חלון הקשר של 16 אלף טוקנים מאפשר להזין קבצים ארוכים יחסית בפורמט ChatML.

  • סוכן שיחה מותאם תפקיד

    האימון כלל תבניות של משחקי תפקידים והנחיות מערכת גמישות לעיצוב אופי המענה.

איפה זה נופל

המודל הוגדר רשמית עבור אנגלית בלבד. אין שום תיעוד ליכולות שלו בעברית, ובמודלים בגודל שבעה מיליארד פרמטרים התמיכה בשפות שאינן אנגלית נוטה להישבר מהר. נוסף לכך, היוצרים עצמם ציינו שהאימון על הקוד פגע בתוצאות במבחן BigBench לעומת המודל המקורי, כך שמשימות של היגיון מופשט ומורכב עלולות להניב תוצאות פחות טובות. הרצה של חלון הקשר מלא של 16 אלף טוקנים תדרוש זיכרון נוסף מעבר למשקל הבסיסי ותאט את קצב יצירת הטקסט.

אותה משפחה

OpenHermes-2.5-Mistral יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ כדאי להוריד מתוך הרשימה?

האפשרות המאוזנת ביותר היא Q4_K_M. הקובץ שוקל 4.37 גיגה בייט, שומר על רוב היכולות של המודל המקורי, ועולה לכרטיס מסך בסיסי בלי לחנוק את המערכת.

האם המודל תומך בעבודה בעברית?

הכרטיס מצהיר על אנגלית בלבד. לא כדאי להסתמך עליו למשימות בעברית, כי מודלים בגודל כזה שלא אומנו במפורש על השפה מייצרים שגיאות ניסוח ומאבדים דיוק במהירות.

איך צריך לעצב את הטקסט שנשלח אליו?

חובה להשתמש במבנה ChatML עם תגיות מערכת, משתמש ועוזר. בלי התבנית הזו המודל יתקשה להבין איפה נגמרת השאלה ואיפה אמורה להתחיל התשובה.

איך מריצים

ההרצה נעשית באמצעות ספריות כמו llama.cpp, תוכנות שולחניות כמו LM Studio, או בסביבת פייתון דרך חבילות דוגמת ctransformers ו־llama-cpp-python. הקובץ המומלץ לרוב השימושים הוא Q4_K_M במשקל 4.37 גיגה בייט, שדורש 6.87 גיגה זיכרון פנוי כדי לרוץ כולו במעבד, או כרטיס מסך ביתי עם שמונה גיגה VRAM לטעינה מלאה. גרסאות קטנות יותר כמו Q2_K יורדות לשלושה גיגה בייט אבל משלמות בירידה מורגשת באיכות הפלט, בעוד שגרסת Q8_0 תדרוש יותר מעשרה גיגה זיכרון.

המודל דורש מבנה שיחה מסוג ChatML כדי להגיב נכון, ומנהל את הרחבת ההקשר אוטומטית. שווה להריץ אותו מקומית אם המידע רגיש ואי אפשר להוציא אותו לרשת. אם המטרה היא מענה מהיר לכמות משתמשים בו־זמנית, חומרה ביתית תיחנק מול חלונות של 16 אלף טוקנים, ועדיף לשלם לפי קריאה לשירות ענן.

ollama run hf.co/TheBloke/OpenHermes-2.5-Mistral-7B-16k-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקבצים והפצה שלהם בתוך מוצר, ללא תשלום תמלוגים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים שמפיצים הלאה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗