GPT
L

llama-30b-instruct-2048

קוד פתוח

upstageרישיון לא דווח2023-07-13

  • transformers
  • pytorch
  • llama
  • text-generation
  • upstage

גרסת הוראות מכווננת היטב על בסיס לאמה הראשון, שמציגה ביצועים תחרותיים לגודל שלה במשימות היגיון באנגלית. היא מתאימה למי שרוצה עצמאות מחשובית בלי לקפוץ למודלי הענק של שבעים מיליארד פרמטרים.

  • 2,048טוקנים בהקשר
  • 60.6 GBמשקל הקבצים
  • 808הורדות בחודש
  • 104לייקים

מה זה

מדובר בכיוונון של חברת אפסטייג' על גבי מודל הבסיס לאמה המקורי של מטא, עם התאמה ספציפית למעקב אחרי פקודות ושיחה. המפתחים אימנו אותו על שילוב ממוקד מאוד של דאטה סטים, ביניהם אופן אורקה, סיינס קיו איי ולימה, בלי להכניס מידע נוסף.

במבחני הבנצ'מרק של לידרבורד הקוד הפתוח, הוא מציג ציון ממוצע של שישים ושבע בארבעת המבחנים המרכזיים. הוא עוקף בקלות את מודל הבסיס של שישים וחמישה מיליארד פרמטרים וגם את פלקון ארבעים, מה שמראה שהכיוונון חילץ ממנו הרבה יותר יכולת היגיון מאשר במודלים גדולים יותר שלא עברו עיבוד דומה. הציון בטרופול קיו עומד על חמישים ושש נקודה שלוש, שזה שיפור ניכר מול מודלי הבסיס המקוריים, אך עדיין משאיר מקום לטעויות כששואלים אותו שאלות ידע מורכבות.

מתאים ל

  • מחקר אקדמי על עיבוד פקודות

    הוא מציג יכולת הסקת מסקנות גבוהה ביחס לגודלו ומאפשר ניתוח ביצועים תחת רישיון מחקרי.

  • סיווג וניתוח טקסטים באנגלית

    הכיוונון על אופן אורקה הופך אותו לחד ומדויק בחילוץ מידע מתוך פסקאות קצרות.

  • מענה על שאלות מדעיות

    הדאטה סטים ששימשו לאימון מקנים לו רקע מוצק במבחני ידע מדעי כמו ארק וסיינס קיו איי.

איפה זה נופל

האימון נעשה כולו באנגלית בלבד ואין בו שום התאמה לשפות אחרות, כך שניסיון להפיק ממנו עברית ייתקל בתחביר שבור או חוסר הבנה מוחלט. מעבר לכך, חלון ההקשר המקורי שלו קצר מאוד ועומד על אלפיים ארבעים ושמונה טוקנים בלבד. אפילו שההרחבה הדינמית מאפשרת להזין טקסטים ארוכים יותר, זה פתרון תוכנתי שנוטה לאבד ריכוז בטקסטים מורכבים. הוא גם לא נבדק על בנצ'מרק אמ טי לבדיקת שיחות מרובות שלבים, בניגוד לגרסאות המתקדמות יותר.

שאלות
נפוצות

האם כדאי להשתמש בו ליישום בעברית?

לא. המודל אומן על נתונים באנגלית בלבד וללא בסיס רב לשוני, ולכן הוא לא מתאים לעיבוד שפה מקומית.

האם הוא יכול לשמש שירות פנימי בחברה?

כל עוד השימוש מוגדר כמחקרי בלבד זה אפשרי, אך שימוש מסחרי מפר את תנאי הרישיון של מטא.

מה היתרון שלו מול גרסת השבעים מיליארד?

הוא דורש משמעותית פחות זיכרון גרפי ויכול לרוץ בשמונה ביט על שרת יחיד וזול יחסית, תוך שמירה על ציונים סבירים.

איך מריצים

כדי לטעון שישים גיגה בייט של משקלים ברמת דיוק מלאה תצטרכו כרטיס מקצועי כמו איי מאה עם שמונים גיגה זיכרון, בדיוק כפי שהמפתחים בדקו. אם תרצו לחסוך, אפשר להשתמש בטעינה של שמונה ביט כפי שמופיע בקוד לדוגמה שלהם, וכך להריץ אותו גם על חומרה צנועה יותר של כארבעים גיגה זיכרון גרפי.

המפתחים הוסיפו תמיכה בהרחבת הקשר באמצעות רופ סקיילינג דינמי, מה שמאפשר לפי הדיווח שלהם להזין עד עשרת אלפים טוקנים בלי אימון מחדש. אם אין לכם גישה לשרת עם כרטיסי טסלה או שאתם רק בודקים רעיון, עדיף להשתמש בממשק מוכן ולא להסתבך עם הורדת עשרות גיגות ואחזקת שרת ייעודי.

from transformers import pipeline

pipe = pipeline("text-generation", model="upstage/llama-30b-instruct-2048")
print(pipe("שלום"))

הרישיון

הרישיון כאן מגביל מאוד ואינו מיועד למסחר כלל. המודל יושב תחת הסכם השימוש המקורי של מטא למודלי לאמה מהדור הראשון, שמתיר שימוש מחקרי בלבד ומחייב קבלת אישור רשמי דרך טופס ייעודי. מי שבונה מוצר מסחרי לא יכול להשתמש במשקלים האלה באופן חוקי.

הרישיון המלא בעמוד המודל ↗