GPT
N

NeuralHermes-2.5-Mistral-7B-GGUF

קוד פתוח

TheBlokeapache-2.02023-11-29

  • transformers
  • gguf
  • mistral
  • instruct
  • finetune

גרסת כיול בשיטת DPO לשיפור מודל שבעה מיליארד פרמטרים מוכר, שנועדה לתת תשובות מדויקות יותר על חומרה מקומית. הפורמט מתאים למי שרוצה להריץ שיחה ישירות ממעבד או כרטיס ביתי.

  • 51.2 GBמשקל הקבצים
  • 3,266הורדות בחודש
  • 52לייקים

מה זה

הבסיס כאן הוא חידוד של מודל קודם באמצעות שיטת אופטימיזציה שנקראת DPO, שרצה על סט נתונים שמיועד לפורמט שיחה מובנה. המטרה היתה לקחת מודל פתוח מוכר ולהדק את האופן שבו הוא עונה להנחיות.

במדדי ההערכה הרשמיים, השינוי מציג שיפור עקבי אבל צנוע. במבחן AGIEval הוא עלה מ־43.07 ל־43.62, וב־GPT4All מ־73.12 ל־73.25, לצד שיפור בבדיקת אמיתות המידע ב־TruthfulQA. אלה תוספות שבריריות באחוזים שלא משנות את המהות, אבל הן מראות שהכוונון המהיר לא פגע בביצועים אלא חידד מעט את הבנת ההוראות ביחס למקור.

מתאים ל

  • עוזר שיחה מקומי באנגלית

    מבנה ה־ChatML המוטמע והמשקל הקל מאפשרים שיחה חלקה על חומרה צנועה, בלי חיבור לאינטרנט.

  • שרת פנימי זול לחברות

    צריכת הזיכרון נמוכה מ־7 גיגה, מה שמאפשר להריץ אותו מקומית בסביבות מבודדות ובלי דליפת מידע.

  • מענה מבוסס הנחיות קצרות

    תהליך הכיול נועד במפורש להביא ציות טוב יותר למבנה השאלות שנבדקו במבחני הדיוק.

איפה זה נופל

המודל אומן והוגדר עבור השפה האנגלית בלבד, ואין שום תיעוד או תמיכה בעברית. ניסיון להשתמש בו למשימות בעברית עלול לייצר פלט משובש, חלקי או לא הגיוני.

בנוסף, האימון התמקד בשיפור קל של 200 צעדים בלבד על חומרה בודדת. המדדים עלו בחלקיקי אחוז, כך שאין כאן קפיצת מדרגה אמיתית בהיגיון מורכב או ביכולות תכנות, אלא רק עידון של אופן המענה למשתמש.

שאלות
נפוצות

האם כדאי להוריד את כל 15 הקבצים שבעמוד?

לא. המאגר מכיל את אותו מודל ברמות דחיסה שונות. מורידים רק קובץ אחד שמתאים לזיכרון של המחשב, בדרך כלל קובץ מסוג Q4_K_M או Q5_K_M.

האם המודל יבין שאלות בעברית?

המודל מוגדר רשמית לאנגלית בלבד. אם יש לכם צורך במענה בעברית, עדיף לבחור מודל שעבר אימון ייעודי לשפה, כי כאן אין הבטחה לתחביר תקין.

מה התבנית שחובה להעביר למודל בזמן הרצה?

המודל כויל עם תבנית ChatML. צריך להשתמש בתגיות פתיחה וסגירה מוגדרות עבור תפקידי מערכת, משתמש ועוזר, אחרת איכות התשובות תרד משמעותית.

איך מריצים

בשביל להריץ אותו צריך להוריד קובץ בודד שמתאים למגבלות הזיכרון של המחשב. גרסת Q4_K_M שוקלת 4.37 גיגה ומבקשת בערך 6.87 גיגה זיכרון כדי לעבוד באופן בסיסי, מה שאומר שהיא תרוץ כמעט על כל כרטיס מסך מודרני פשוט, או על מעבד בלי האצה גרפית. למי שיש זיכרון פנוי, גרסאות כמו Q5_K_M יתנו איכות מעט טובה יותר בנפח של 5.13 גיגה.

הריצה בפועל נתמכת דרך llama.cpp או ספריות דוגמת llama-cpp-python, ומחייבת שמירה על תבנית שיחה מסוג ChatML. אם אתם צריכים לשרת אלפי בקשות במקביל ואין לכם שרת ייעודי, אחזקת תשתית מקומית כזו פחות משתלמת מפנייה לשירותי ענן מוכנים.

ollama run hf.co/TheBloke/NeuralHermes-2.5-Mistral-7B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון פתוח ומתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה פנימית או חיצונית בתוך מוצרים. התנאי העיקרי הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי בקבצים שתפיצו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗