GPT
S

SOLAR-0-70b-16bit

קוד פתוח

upstageרישיון לא דווח2023-07-30

  • transformers
  • pytorch
  • llama
  • text-generation
  • upstage

גרסת כוונון עדין על בסיס LLaMA 2 שהגיעה למקום הראשון בלוח המבחנים הפתוח בזמנו. מתאימה למי שצריך ביצועים גבוהים באנגלית ומחזיק בתשתית שרתים כבדה.

  • 4,096טוקנים בהקשר
  • 128 GBמשקל הקבצים
  • 22,089הורדות בחודש
  • 260לייקים

מה זה

המודל מבוסס על LLaMA 2 בגרסת 70 מיליארד פרמטרים, ועבר אימון נוסף עם דאטהסטים בסגנון Orca ו־Alpaca. במבחני ה־Open LLM של Hugging Face הוא הציג שיפור ניכר מול מודל הבסיס, במיוחד ב־TruthfulQA עם קפיצה מ־44.9 ל־62.2, וציון ממוצע של 73. הוא עקף בזמנו גם את הגרסאות הקודמות של 65 מיליארד פרמטרים ודגמי Falcon.

התוצאה ב־MT-Bench עומדת על 7.44, מה שמעיד על יכולת טובה במענה לשאלות מורכבות בכמה שלבים. המפתחים שינו את שמו המקורי מ־LLaMa-2-70b-instruct-v2 לגרסה הנוכחית, והוא זמין גם להתנסות דרך שירות Poe למי שלא רוצה להוריד את המשקלים.

מתאים ל

  • עוזר שיחה מורכב באנגלית

    אימון ה־Orca והתוצאה ב־MT-Bench הופכים אותו לטוב בניהול דיאלוג מרובה שלבים.

  • מחקר והשוואת ביצועים

    מצוין כנקודת ייחוס חזקה למודלי 70B פתוחים במחקר אקדמי שאינו מסחרי.

  • מענה לשאלות מבוסס עובדות

    הציון הגבוה ב־TruthfulQA מעיד על דיוק עובדתי עדיף בהרבה על מודל הבסיס.

איפה זה נופל

המודל הוגדר ואומן עבור השפה האנגלית בלבד, כך שלא הייתי בונה עליו שום תהליך שכולל עברית. חלון ההקשר המקורי עומד על 4,096 טוקנים בלבד, והרחבה שלו תלויה בהגדרות dynamic rope בזמן הריצה. בנוסף, מדובר במשקלים כבדים מאוד שלוקחים זמן טעינה ארוך ודורשים אופטימיזציות קוונטיזציה כדי לעבוד בקצב סביר.

שאלות
נפוצות

האם אפשר להשתמש בו במוצר מסחרי?

לא. כרטיס המודל מגדיר רישיון CC BY-NC-4.0 שמונע כל שימוש מסחרי. לצורך כזה צריך ליצור קשר ישיר עם Upstage.

איך אפשר להכניס טקסט ארוך מחלון ההקשר הרגיל?

המודל מגיע עם חלון בסיס של 4,096 טוקנים, אבל אפשר להגדיר בהרצה rope scaling דינמי עם פקטור 2. זה מאפשר לו להתמודד עם קלטים שמגיעים לעשרת אלפים טוקנים ויותר על גבי כרטיס A100.

איזה כרטיס מסך מינימלי צריך בשביל להריץ אותו?

בדיוק מלא של 16 ביט תצטרכו שני כרטיסי 80GB. אם מפעילים טעינה ב־8 ביט כפי שמופיע בקוד הדוגמה, אפשר להריץ אותו על כרטיס A100 יחיד של 80GB.

איך מריצים

כדי להריץ אותו בדיוק המקורי של 16 ביט דרושים מעל 140 גיגה-בייט של זיכרון גרפי, מה שמחייב לפחות שני כרטיסי A100 של 80GB או שרת ייעודי. הקוד הרשמי מציג הרצה ב־8 ביט על גבי כרטיס A100 יחיד, עם שימוש ב־rope scaling דינמי כדי לטפל בקלטים של מעל 10,000 טוקנים למרות חלון ברירת המחדל.

מי שאין לו תשתית מקומית כזו ישלם לא מעט על שרת ענן כדי לספק זמני תגובה סבירים. במקרים כאלה עדיף לבדוק אם כדאי לגשת אליו דרך ממשקי API חיצוניים או שירותי אירוח מנוהלים, במקום לתחזק 128 גיגה-בייט של קבצים בעצמכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="upstage/SOLAR-0-70b-16bit")
print(pipe("שלום"))

הרישיון

בעמוד המודל לא מופיע שדה רישיון רשמי, אבל הטקסט בכרטיס מציין במפורש רישיון CC BY-NC-4.0. המשמעות פשוטה: השימוש מוגבל למחקר ולניסויים בלבד, ואסור לחלוטין לשלב אותו במוצר מסחרי או לייצר ממנו הכנסה. אם תרצו להשתמש בו ליישום עסקי, תצטרכו לפנות ישירות ליוצרים.

הרישיון המלא בעמוד המודל ↗