GPT
M

Mistral-7B-OpenOrca

קוד פתוח

Open-Orcaapache-2.02023-09-29

  • transformers
  • pytorch
  • mistral
  • text-generation
  • conversational

שילוב של בסיס מיסטרל עם דאטה־סט סינתטי של אורקה נותן מודל שיחה שמנצח מודלים כבדים בהרבה. הוא מיועד למי שמחפש היגיון חזק על כרטיס מסך ביתי בלי לשלם על מודל ענק.

  • 32,768טוקנים בהקשר
  • 13.5 GBמשקל הקבצים
  • 792הורדות בחודש
  • 690לייקים

מה זה

המודל לוקח את Mistral 7B ומאמן אותו על תת־קבוצה מסוננת של דאטה־סט OpenOrca, שמבוסס על דאטה שנוצר בעזרת GPT-4 לפי מחקר אורקה של מיקרוסופט. תהליך האימון רץ על שמונה כרטיסי A6000 במשך 62 שעות וארבעה מחזורים מלאים בעזרת Axolotl ו־OpenChat packing.

בזמן היציאה שלו, המבחנים הציבו אותו במקום הראשון בקטגוריה של מתחת ל־30 מיליארד פרמטרים. במדד הלידרבורד של HuggingFace הוא השיג ממוצע של 65.84, כולל 62.24 ב־MMLU ו־53.05 ב־TruthfulQA. במבחן השיחה MT-Bench הוא רשם ציון של 6.86, נתון שהשווה אותו ישירות לביצועים של Llama2-70b-chat למרות פערי הגודל העצומים ביניהם.

מתאים ל

  • מענה מבוסס ChatML

    הוא אומן ישירות על פורמט התגיות של מיקרוסופט ו־OpenAI, ומחזיר שיחות מובנות היטב בשרתי הסקה מקומיים.

  • הסקה על חומרה ביתית

    בזכות גרסאות GGUF ו־AWQ אפשר להריץ מודל עם היגיון של 70B על גבי כרטיסי מסך צרכניים רגילים.

  • פירוק משימות מורכבות

    ציון 0.416 ב־BigBench-Hard מאפשר לו לבצע ניתוח שלבים והסבר לוגי ברמה גבוהה בהרבה ממודל הבסיס.

איפה זה נופל

המודל הוגדר ואומן באנגלית בלבד. אם תפנו אליו בעברית הוא יתקשה מאוד להחזיר תשובות קוהרנטיות וסביר שייכשל לחלוטין. בנוסף, בסיס האימון מגיע בעיקרו מתשובות שנוצרו על ידי GPT-4, מה שאומר שהוא עלול לחקות ביטחון עצמי מופרז ולהמציא עובדות בצורה משכנעת מאוד. עם תוצאה של 53.05 ב־TruthfulQA, קרוב לחצי מהתשובות שלו על שאלות מכשילות עלולות לכלול הזיות, כך שחובה להצמיד לו מנגנוני אימות עובדות לפני שנותנים לו לענות ישירות ללקוחות.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לשיחה חופשית בעברית?

הכרטיס מגדיר את שפת המודל כאנגלית בלבד. הוא לא עבר אימון או התאמה ייעודית לעברית, ולכן הוא לא יתאים לממשקי שיחה או מענה בעברית בלי אימון מקדים נוסף שתבצעו בעצמכם.

איך צריך לנסח את הפרומפט כדי שהוא יעבוד נכון?

הוא מחייב שימוש בפורמט ChatML שכולל תגיות מיוחדות לתפקידי מערכת, משתמש ועוזר. השיטה המומלצת בכרטיס היא שימוש בפונקציה apply_chat_template של transformers שמסדרת את הטקסט אוטומטית לפני ההסקה.

מה עדיף, להוריד את המודל המקורי או גרסה מכווצת?

הגרסה המקורית שוקלת 13.5 ג'יגה־בייט ודורשת לפחות 16 ג'יגה זיכרון גרפי. אם אתם רצים על מחשב אישי או כרטיס מסך בינוני, מומלץ לקחת גרסת GGUF או AWQ שהוכנו על ידי TheBloke כדי לחסוך זיכרון.

איך מריצים

המשקל המקורי תופס 13.5 ג'יגה־בייט ב־bfloat16 בתוך 18 קבצים, מה שדורש כרטיס מסך של 16 עד 24 ג'יגה זיכרון כדי לטעון אותו ישירות דרך ספריית transformers. המפתחים משתמשים בתבנית שיחה מסוג ChatML עם תגיות התחלה וסיום מוגדרות, כך שחובה להפעיל את apply_chat_template כדי לקבל תוצאות מדויקות ולא לבלבל את המודל.

אם אין לכם חומרה ייעודית, TheBloke שחרר גרסאות מכווצות בפורמטים של AWQ, GPTQ ו־GGUF שמאפשרות להריץ אותו מקומית על כרטיסים צרכניים פשוטים יותר או על מעבד. שווה להחזיק אותו על שרת פרטי רק אם אתם חייבים פרטיות מלאה או שליטה על העיבוד, אחרת פנייה ל־API מסחרי תחסוך את כאב הראש של תחזוקת התשתית.

from transformers import pipeline

pipe = pipeline("text-generation", model="Open-Orca/Mistral-7B-OpenOrca")
print(pipe("שלום"))

הרישיון

המודל שוחרר ברישיון apache-2.0 מלא. הרישיון הזה מתיר שימוש מסחרי, שינוי קוד, הפצה מחדש ושילוב במוצרים סגורים בלי לשלם תמלוגים. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים שתפיצו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗