GPT
O

OpenHermes-2-Mistral-7B

קוד פתוח

tekniumapache-2.02023-10-12

  • transformers
  • pytorch
  • mistral
  • text-generation
  • instruct

התאמה עמוקה של מיסטרל על 900,000 דוגמאות שיצר GPT-4. הוא פונה למי שמחפש מודל קומפקטי לשיחה ומעקב אחרי הוראות מורכבות במבנה מסודר.

  • 32,768טוקנים בהקשר
  • 13.5 GBמשקל הקבצים
  • 1,030הורדות בחודש
  • 255לייקים

מה זה

מדובר בכיוונון של מיסטרל שנוצר באמצעות אימון על כמעט מיליון רשומות ציבוריות מגוונות, רובן פלטים של GPT-4 שסוננו והומרו למבנה שיחה. המודל מסתמך על פורמט ChatML שכולל תגיות מפורשות לתחילת וסיום תור, מה שעוזר לו להבין הנחיות מערכת ברורות ולא לאבד את ההקשר בשיחות מרובות שלבים.

במבחני GPT4All הוא קיבל ממוצע של 72.68. המבחנים האלה בודקים הבנת הנקרא, היגיון בסיסי וידע כללי, והתוצאה מראה יכולת טובה מאוד לשלוף מידע ולענות על שאלות אמריקאיות ישירות יחסית לגודל שלו. לפי הכרטיס, הוא עוקף את רוב הגרסאות הקודמות של אותה משפחה חוץ מגרסת שבעים מיליארד הפרמטרים, לצד שיפור במבחני AGIEval ו־BigBench.

מתאים ל

  • סוכן שיחה מבוסס הנחיות

    פורמט ChatML והאימון על שיחות מאפשרים לו להיצמד היטב לתפקיד שהוגדר בהוראת המערכת.

  • הרצה מקומית על לפטופ

    בעזרת גרסאות GGUF אפשר להריץ אותו בתוכנת LM Studio ללא חיבור רשת וללא שרת ייעודי.

  • מערכות תואמות OpenAI

    מבנה ההודעות והתגיות תואם לפרוטוקול של ChatGPT, מה שמקל על החלפת השרת בצד הלקוח.

איפה זה נופל

היוצר ייעד אותו בעיקר לאנגלית, כך שאין כאן התאמה לשפות אחרות ועברית עלולה להיות עילגת או שבורה. במבחן TruthfulQA תוצאות הדיוק בבחירת תשובות נכונות נמוכות בהרבה מהמבחנים הכלליים, מה שאומר שהוא עדיין נוטה להמציא עובדות או לייצר תשובות שנשמעות משכנעות בלי להיות נכונות. בנוסף, חלון הקשר מלא דורש כוח חישוב משמעותי שלא מתאים לכל חומרה.

שאלות
נפוצות

האם הוא מתאים לשיחה שוטפת בעברית?

הנתונים הרשמיים מציינים אנגלית בלבד. המודל יכול להבין מילים בודדות בזכות ארכיטקטורת הבסיס, אך לא אומן לייצר טקסט עברי איכותי ואינו מומלץ למשימות בעברית.

איך דואגים שהמודל יידע מתי לענות?

משתמשים במתודת apply_chat_template של הטוקנייזר עם הפרמטר add_generation_prompt מופעל. פעולה זו מוסיפה את תגית הפתיחה של תור העוזר ומאותתת לו להמשיך את השיחה בצורה נכונה.

איך מריצים

המשקל המלא שוקל 13.5 גיגה בייט בפורמט bfloat16, כך שכדי להריץ אותו בלי קוונטיזציה תצטרכו כרטיס מסך עם לפחות 16 או 24 גיגה זיכרון גרפי, במיוחד אם מנצלים חלון הקשר ארוך. הוא רץ ישירות דרך ספריית transformers עם פונקציית תבנית השיחה המובנית של הטוקנייזר.

למי שרוצה להריץ מקומית על מחשב אישי או זיכרון מוגבל, קיימות גרסאות מכווצות של TheBloke בפורמטים GGUF, GPTQ ו־AWQ. בשימוש אינטראקטיבי פשוט מומלץ להריץ אותו דרך ממשק LM Studio עם הגדרת ChatML, במקום להקים שרת שלם בעצמכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="teknium/OpenHermes-2-Mistral-7B")
print(pipe("שלום"))

הרישיון

המודל שוחרר ברישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי הקוד והפצה פנימית או חיצונית במוצרים, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗