GPT
N

Nous-Hermes-2-SOLAR-10.7B

קוד פתוח

NousResearchapache-2.02024-01-01

  • transformers
  • safetensors
  • llama
  • text-generation
  • SOLAR

שילוב בין בסיס של כמעט 11 מיליארד פרמטרים לדאטהסט ענק שרובו מבוסס על GPT-4. הוא נותן מענה חזק למי שמחפש ביצועים של מודל גדול יותר בלי להסתבך עם דרישות זיכרון כבדות.

  • 11Bפרמטרים
  • 4,096טוקנים בהקשר
  • 20.0 GBמשקל הקבצים
  • 9,402הורדות בחודש

מה זה

המודל מבוסס על SOLAR 10.7B ועבר אימון נוסף על מיליון רשומות, בעיקר תוצרי GPT-4 ודאטהסטים פתוחים אחרים. מבחינת גודל הוא יושב בדיוק בין מודלי 7B הנפוצים לבין המפלצות של 34B ומעלה, כשהרעיון הוא לתת תפוקה שמתקרבת למודלים הגדולים אך בחומרה נגישה.

בבנצ'מרקים המפרסמים מציגים שיפור רוחבי על פני מודל הבסיס, עם ממוצע של 74.69% ב־GPT4All וציון של 47.79% ב־AGIEval, שבודק שאלות מורכבות ומבחני הסמכה. הוא עובד בתבנית ChatML המוכרת מהממשקים של OpenAI, מה שהופך את ניהול השיחה והגדרת תפקידים לטבעיים וישירים בלי לכתוב לוגיקת שרשור ידנית.

מתאים ל

  • בוטים ושיחות מורכבות

    תמיכה מובנית ב־ChatML והגדרות מערכת קשיחות מאפשרות לקבוע אישיות והתנהגות בצורה יציבה באנגלית.

  • עוזר פיתוח מקומי

    אימון על תוצרי GPT-4 נותן יכולת טובה בכתיבת סקריפטים וסיוע בקוד, בלי לשלוח מידע לרשת.

  • משימות סיווג ומענה

    התוצאות במבחני ידע כללי הופכות אותו למנוע טוב לעיבוד שאלות ותשובות על בסיס טקסטים קצרים.

איפה זה נופל

הנתונים מעידים על נקודות תורפה ברורות. במבחן TruthfulQA המודל עומד על 39.17% בלבד במדד mc1, מה שאומר שהוא עדיין נוטה להזות עובדות ולהמציא מידע שנשמע משכנע. כמו כן, חלון ההקשר שלו מוגבל ל־4,096 טוקנים בלבד, כך שהוא לא מתאים לעיבוד מסמכים ארוכים, ניתוח קוד מסיבי או שיחות שנמשכות שעות. בנוסף, האימון הוגדר לשפה האנגלית בלבד, ולכן הוא לא בחירה טובה לעיבוד טקסט בעברית.

שאלות
נפוצות

האם הוא יעבוד טוב בעברית?

הכרטיס מציין אנגלית בלבד כשפת המודל. הוא לא עבר אופטימיזציה לעברית, ולכן פלט בעברית עשוי להיות משובש, איטי או שגוי לחלוטין.

האם אפשר להריץ אותו על מחשב נייד רגיל?

לא בגרסה המקורית שדורשת כרטיס מסך מקצועי עם 24 גיגה זיכרון. כדי להריץ על מחשב אישי תצטרכו להוריד גרסה מכווצת בפורמט GGUF דרך כלי כמו LM Studio.

איך מריצים

במשקל מקורי של 20 גיגה בייט בפורמט bfloat16, צריך כרטיס מסך עם לפחות 24 גיגה בייט VRAM כמו RTX 3090 או A10 כדי להריץ אותו ישירות בספריית transformers. זה אומר שאם אין לכם חומרה ייעודית, תצטרכו לפנות לגרסאות מכווצות בפורמט GGUF שהועלו לרשת או להרים שרת בענן.

למי שרוצה רק להתנסות מקומית בלי לכתוב קוד תשתית, המפתח ממליץ על תוכנת LM Studio עם התאמה לתבנית ChatML. אם המטרה היא שירות ייצור עם תעבורה גבוהה והתקציב לכרטיסי מסך לוחץ, שימוש ב־API חיצוני עשוי להיות זול ופשוט יותר מתחזוקת שרת עצמאי.

from transformers import pipeline

pipe = pipeline("text-generation", model="NousResearch/Nous-Hermes-2-SOLAR-10.7B")
print(pipe("שלום"))

הרישיון

המודל שוחרר ברישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו מחדש ולשלב אותו במוצרים סגורים בלי לשלם תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗