GPT
N

Nous-Hermes-2-SOLAR-10.7B-GGUF

קוד פתוח

TheBlokeapache-2.02024-01-02

  • transformers
  • gguf
  • solar
  • SOLAR
  • instruct

גרסה מכווצת של מודל המבוסס על SOLAR בגודל ביניים לא שגרתי, שאומן על מיליון דוגמאות ברובן מתוצרת GPT-4. הוא פונה למי שמחפש יכולות מעבר ל־7B בלי לדרוש משאבים של 13B או 70B.

  • 75.7 GBמשקל הקבצים
  • 3,957הורדות בחודש
  • 113לייקים

מה זה

מדובר בהמרה לפורמט GGUF של הדגם Nous Hermes 2 שנבנה על גבי בסיס SOLAR בגודל 10.7 מיליארד פרמטרים. המפתחים אימנו אותו על סט נתונים רחב כדי לחזק יכולות שיחה, מענה לשאלות והסקה לוגית, במטרה להתקרב לביצועים של מודלים גדולים משמעותית כמו Yi-34B.

במבחני GPT4All הוא מציג ממוצע של 74.69 אחוזים, עם תוצאות טובות יחסית של מעל 88 אחוז במשימות הבנת הנקרא כמו boolq. עם זאת, במבחן היגיון והסקה של BigBench או ב־AGIEval הוא מתייצב סביב 47.79 אחוז בממוצע, ובמשימות היסק לוגי מורכבות יותר הוא נעצר סביב 21 עד 28 אחוזים. המבנה שלו מנסה למצות גודל פיזי בינוני, אך עדיין מוגבל כשנדרש חישוב רב-שלבי כבד.

מתאים ל

  • עוזר שיחה מקומי באנגלית

    התבנית מבוססת ChatML והאימון על תוצרי שיחה מעניקים מענה שוטף ומנוסח היטב במערכות פנימיות.

  • חילוץ מידע וסיווג טקסט

    התוצאות הגבוהות יחסית במבחני הבנת הנקרא מתאימות למשימות תיוג ועיבוד מסמכים קצרים.

  • בדיקות פיתוח על כרטיס יחיד

    משקל של כ־6.5 ג״ב בגרסת Q4 מאפשר ריצה שלמה בזיכרון של כרטיס מסך בודד בנפח 8 עד 12 ג״ב.

איפה זה נופל

הנתונים מראים נפילה ברורה בחשיבה מופשטת ובמבחני היסק מורכבים, שם הציונים במבחנים כמו היסק מתוך חמישה או שבעה עצמים יורדים מתחת ל־30 אחוזים, ובצורות גיאומטריות נרשם דיוק אפסי בהתאמה מדויקת. המודל מוגדר ומאומן באנגלית, כך שאין לצפות לביצועים סבירים בעברית. בנוסף, חובה להקפיד בדיוק על תבנית ה־ChatML הייעודית, אחרת התשובות מאבדות עקביות.

שאלות
נפוצות

איזה קובץ כדאי להוריד מתוך כל האפשרויות במאגר?

הגרסה המומלצת לרוב השימושים היא Q4_K_M שדורשת פחות מ־9 ג״ב זיכרון ונותנת יחס טוב בין משקל לאיכות. אם יש מחסור חמור בזיכרון אפשר לרדת ל־Q3_K_M, אך רצוי להתרחק מגרסאות 2 ביט שפוגעות קשות בתוצאות.

האם המודל מתאים לעבודה בעברית?

לפי נתוני המאגר המודל מוגדר עבור השפה האנגלית בלבד. האימון שלו התמקד בדאטהסטים באנגלית, ולכן לא מומלץ להסתמך עליו למשימות ניתוח או ייצור תוכן בשפות אחרות בלי בדיקה מוקדמת.

איך מריצים

את קובצי ה־GGUF אפשר להריץ ישירות דרך llama.cpp או ספריות עוטפות כמו llama-cpp-python, לצד ממשקים כמו LM Studio ו־text-generation-webui. אם רוצים איזון סביר בין איכות לנפח, קובץ ה־Q4_K_M שוקל 6.46 ג״ב ודורש כמעט 9 ג״ב זיכרון עבודה בהרצה על מעבד בלבד, או כרטיס מסך ביתי עם 8 עד 12 ג״ב VRAM כדי לפרוק אליו את כל השכבות.

אין צורך להוריד את כל המאגר ששוקל עשרות ג׳יגה-בייט, אלא רק את הקובץ הספציפי שמתאים לחומרה שלכם. אם אין לכם מעבד גרפי פנוי או לפחות 16 ג״ב RAM פנויים במערכת, עדיף לפנות לשרת מרוחק שמציע גישה במקום לנסות להריץ מקומית גרסאות 2 ביט שפוגעות באיכות המענה.

ollama run hf.co/TheBloke/Nous-Hermes-2-SOLAR-10.7B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי, שינוי קוד והפצה מחדש. המשמעות עבור מפתחים היא שניתן לשלב את המשקלים במוצר פנימי או מסחרי, בכפוף לשמירה על תנאי הרישיון המקוריים ומתן קרדיט מתאים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗