GPT
C

CapybaraHermes-2.5-Mistral-7B-GGUF

קוד פתוח

TheBlokeapache-2.02024-01-31

  • trl
  • gguf
  • mistral
  • distilabel
  • dpo

גרסה מכווצת של מודל שיחה מבוסס Mistral שמתמקד בשיחות מרובות שלבים. הוא מיועד למי שמחפש מודל 7B שמסוגל לזכור הקשר בצורה עקבית ולא לאבד כיוון אחרי שאלה אחת.

  • 50.9 GBמשקל הקבצים
  • 3,427הורדות בחודש
  • 129לייקים

מה זה

מדובר בהמרה לפורמט GGUF של שיתוף הפעולה בין Argilla לבין בסיס הקוד של OpenHermes 2.5. המפתח, Argilla, לקח את המודל המקורי ואימן אותו מחדש בשיטת DPO על מערכי נתונים ספציפיים שנועדו לשפר את איכות התשובות לאורך שיחה מתמשכת, ולא רק באינטראקציות בודדות.

במבחני ביצועים רואים שהכוונון הזה עובד. במדד MTBench, הציון בסיבוב השני של השיחה עלה ל־7.56 לעומת 7.28 במודל המקור ו־7.1 בגרסת המקור של Mistral Instruct v0.2. זה אומר שבמקום לקרוס או לחזור על עצמו כשהמשתמש שואל שאלות המשך מורכבות, הוא שומר על יציבות ומבין מה קרה קודם לכן. עם זאת, במבחני אמינות כמו TruthfulQA הוא עומד על 57.07, שזה שיפור מול OpenHermes אבל נמוך משמעותית מגרסת ההוראות הרשמית של Mistral שמגיעה ל־66.82.

מתאים ל

  • סוכני שיחה מרובי שלבים

    המודל מצטיין בשיחות ארוכות ומעקב אחר פקודות המשך לפי ציוני MTBench.

  • עוזר מקומי למחשב נייד

    גרסת Q4_K_M רצה על כרטיסי מסך ביתיים בלי תלות בחיבור לרשת או עלויות ענן.

  • ניתוח טקסטים ארוכים

    תמיכה מובנית בחלון הקשר של עד 32K טוקנים מאפשרת הזנת מסמכים שלמים.

איפה זה נופל

הנתונים מעידים שהמודל הוגדר רשמית לאנגלית בלבד, כך שלא כדאי לבנות עליו לעיבוד טקסטים בעברית בלי בדיקה מעמיקה. מעבר לזה, ציון ה־TruthfulQA הנמוך ביחס לגרסת ההוראות של Mistral מצביע על נטייה להזיות וביטחון עצמי מופרז כשמדובר בעובדות קשיחות. המפתחים לא צירפו מידע על סינון תכנים פוגעניים או מנגנוני בטיחות, ולכן הוא דורש שכבת בדיקה חיצונית לפני שחושפים אותו למשתמשי קצה.

אותה משפחה

CapybaraHermes-2.5-Mistral יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ כדאי להוריד מהרשימה?

לרוב השימושים כדאי לבחור ב־capybarahermes-2.5-mistral-7b.Q4_K_M.gguf ששוקל 4.37 GB. הוא מספק יחס איכות לגודל אופטימלי ודורש פחות מ־7 GB זיכרון בהרצה על מעבד, או נכנס במלואו לכרטיס מסך ממוצע.

איך צריך להעביר לו פקודות בקוד?

המודל אומן עם תבנית ChatML. צריך להשתמש במבנה עם תגיות im_start ו־im_end עבור תפקידי המערכת, המשתמש והעוזר, אחרת איכות התשובות וההיגיון של המודל ייפגעו.

איך מריצים

כדי להריץ אותו מקומית מורידים קובץ GGUF בודד וטוענים אותו בתוכנות כמו llama.cpp, LM Studio או ספריית llama-cpp-python. אם יש לכם כרטיס מסך עם 6GB עד 8GB זיכרון, עדיף לבחור בגרסת Q4_K_M ששוקלת 4.37 גיגה ומציעה איזון מעולה בין מהירות לאיכות, או ב־Q5_K_M אם יש לכם קצת יותר מקום בזיכרון. המודל תומך בחלון הקשר של עד 32,768 טוקנים באמצעות דגלי פקודה, אך פתיחת חלון כזה תדרוש זיכרון RAM או VRAM נוסף מעבר למשקל הקובץ.

אם אין לכם כרטיס מסך ייעודי, הוא ירוץ על מעבד רגיל עם 8GB זיכרון מערכת אבל בקצב אטי יותר. במידה ואתם צריכים לשרת עשרות משתמשים במקביל או שאין לכם כוח לנהל שרתים וחומרה, שימוש ב־API של ספק ענן מסחרי יהיה זול ופשוט יותר מלתחזק מכונה ייעודית.

ollama run hf.co/TheBloke/CapybaraHermes-2.5-Mistral-7B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח הוא Apache 2.0. הרישיון מאפשר שימוש חופשי בקוד ובמשקלים, כולל שימוש מסחרי, שינוי והפצה, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי. אין חובת שיתוף של שינויים שתעשו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗