GPT
S

Starling-LM-7B-beta

קוד פתוח

Nexusflowapache-2.02024-03-19

  • transformers
  • safetensors
  • mistral
  • text-generation
  • reward model

גרסת צ'אט שמבוססת על מיסטרל ועברה כוונון מבוסס משוב מכונות כדי לספק שיחה איכותית. היא מוציאה ציון גבוה במבחני שיחה למרות גודל קומפקטי שנכנס בכרטיס מסך בודד.

  • 7.2Bפרמטרים
  • 8,192טוקנים בהקשר
  • 13.5 GBמשקל הקבצים
  • 1,366הורדות בחודש

מה זה

מדובר במודל שנוצר על בסיס Openchat-3.5-0106, שבעצמו נשען על מיסטרל המוכר. המפתחים בנקסוספלו אימנו אותו בשיטת RLAIF, כלומר למידת חיזוק ממשוב של מודל שפה אחר, באמצעות מודל תגמול ייעודי בגודל שלושים וארבעה מיליארד פרמטרים ומאגר נתונים בשם נקטר.

במבחן MT Bench, שבו GPT-4 בודק איכות מענה, הוא קיבל ציון של 8.12. זה אומר שבמשימות שיחה כלליות באנגלית, רמת הניסוח והיכולת לעקוב אחרי הוראות דומות למודלים גדולים בהרבה. חלון ההקשר עומד על שמונה אלפים ומאה תשעים ושניים טוקנים, כך שאפשר להזין לו שיחות ארוכות או טקסטים בינוניים בלי לאבד את ההקשר.

מתאים ל

  • בוט שיחה באנגלית

    ביצועי השיחה שלו גבוהים מאוד ביחס לגודל קל שרץ על חומרה מקומית רגילה.

  • מערכת מענה מבוססת הנחיות

    האימון בחיזוק תגמול מאפשר לו לעקוב היטב אחרי דרישות מבנה בניסוח.

  • מעבד שיחות עם הקשר ארוך

    חלון של מעל שמונת אלפים טוקנים קולט היסטוריית שיחה עשירה בלי להיקטע.

איפה זה נופל

המפתח מזהיר שהמודל נוטה לפעמים למלל ארוך ומייגע מדי, וממליץ לקבוע את מדד הטמפרטורה לאפס כדי לצמצם את זה. בנוסף, חובה להשתמש בדיוק בתבנית השיחה של אופן צ'אט, אחרת הביצועים צונחים משמעותית. המודל מוגדר רשמית לאנגלית בלבד, כך שאין לצפות לביצועים סבירים בעברית.

שאלות
נפוצות

האם הוא יודע לעבוד בעברית?

החומר הרשמי מגדיר אותו באנגלית בלבד. מכיוון שהוא מבוסס על מיסטרל ייתכן שהוא יפלוט עברית מסוימת, אבל לא אימנו אותו לזה ולא הייתי בונה עליו לשום דבר בעברית.

למה התשובות שלו יוצאות ארוכות ומרוחות?

המפתחים מציינים בפירוש שהמודל נוטה לדברנות יתר במקרים נדירים. הדרך לתקן את זה היא להוריד את ה־temperature לאפס בהגדרות הקריאה.

למה חשוב להקפיד על תבנית השיחה של OpenChat?

המודל אומן עם טוקנים מיוחדים ומבנה קלט מדויק של אופן צ'אט. שינוי קל במבנה או שימוש בתבנית רגילה יפגעו באיכות התשובות ויובילו לפלט מקולקל.

איך מריצים

המשקל הכולל של הקבצים הוא שלושה עשר וחצי גיגהבייט בפורמט bfloat16. כדי להריץ אותו כמו שהוא עם ספריית transformers תצטרכו כרטיס מסך עם לפחות שישה עשר עד עשרים וארבעה גיגהבייט זיכרון וידאו, למשל כרטיס מסדרת RTX 4090 או כרטיסי שרת דומים.

אם אין לכם חומרה כזו פנויה, אפשר לבדוק אותו בחינם ב־Chatbot Arena של LMSYS כדי לראות איך הוא מגיב בפועל לפני שמרימים שרת. אם המטרה היא שירות צדדי קטן, תשלום לפי קריאה ל־API של מודל חיצוני עשוי להיות זול ופשוט יותר מתחזוקת שרת ייעודי.

from transformers import pipeline

pipe = pipeline("text-generation", model="Nexusflow/Starling-LM-7B-beta")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־Apache 2.0, אבל יש כאן אותיות קטנות בעייתיות. המפתחים הוסיפו תנאי שאוסר להתחרות ב־OpenAI, והדאטה־סטים שעליהם אומן כפופים לתנאי השימוש של OpenAI ושל ShareGPT. מי שמתכנן להשתמש בו במוצר מסחרי צריך לבדוק אם ההגבלות האלו מסכנות את הפעילות שלו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗