GPT
O

opt-13b

קוד פתוח

facebookother2022-05-11

  • transformers
  • pytorch
  • tf
  • jax
  • opt

בסיס שפותח כדי לחקות את היכולות של GPT-3 ומיועד לחוקרים שרוצים משקלים פתוחים. מתאים למי שחוקר הטיות שפה ומוכן להתמודד עם משקלי ענק.

  • 2,048טוקנים בהקשר
  • 120 GBמשקל הקבצים
  • 11,108הורדות בחודש
  • 66לייקים

מה זה

מטא שחררה את המודל הזה כחלק מסדרת מודלים שמטרתה לתת מענה פתוח למערכות סגורות בסגנון GPT-3. הוא אומן על מאגר של 180 מיליארד טוקנים שכולל ספרים, רדיט, חדשות וחלקים ממאגר The Pile. המבנה הוא מודל פענוח בלבד שמייצר טקסט על בסיס חיזוי הטוקן הבא באנגלית, עם חלון הקשר מוגבל של 2,048 טוקנים.

המטרה המקורית שלו היא לאו דווקא להביס מודלים מודרניים בביצועים, אלא לתת לקהילת המחקר גישה למשקלים של מודל ענק. מכיוון שהוא מודל בסיס לא מכויל, הוא פשוט ממשיך טקסטים ולא פועל כעוזר אישי שעונה להוראות ישירות. כיום הוא מעניין בעיקר למי שרוצה בסיס מחקרי לבדיקות השוואתיות מול עבודות מ־2022.

מתאים ל

  • חקר הטיות במודלי שפה

    הכרטיס מדגים בבירור הטיות מגדריות במקצועות, מה שהופך אותו לכלי מתאים לניתוח ומדידת הטיות במודלי ענק.

  • כוונון על משימות ייעודיות

    משמש כבסיס באנגלית לאימון downstream tasks באמצעות causal language modeling למי שצריך מודל 13B.

  • השוואת ביצועים מול GPT-3

    מתאים לשחזור ניסויי עבר ומחקרים אקדמיים שמשתמשים בפרומפטים ובמערך הבדיקות המקורי של שנת 2022.

איפה זה נופל

הוא מלא בהטיות מגדריות, חברתיות וסטריאוטיפים שמגיעים ישירות מאיסוף לא מסונן של אתרים ורדיט. המפתחים עצמם מזהירים מהזיות, חזרתיות ופליטת תוכן פוגעני. בנוסף, הוא מתמקד באנגלית בלבד, ואין לו יכולת מובנית בעברית למעט שאריות מקריות מהרשת. חלון ההקשר עומד על 2,048 טוקנים בלבד, מה שמקשה מאוד על משימות עם מסמכים ארוכים.

אותה משפחה

opt יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יודע לענות על שאלות כמו צ'אטבוט?

לא באופן טבעי. מדובר במודל בסיס שלא עבר אימון עם משוב אנושי או התאמה להוראות, ולכן הוא נוטה להשלים משפטים במקום לענות לשאלות. כדי לקבל ממנו התנהגות של צ'אט, צריך לכוונן אותו מראש על סט נתונים מתאים.

האם אפשר להשתמש בו לטקסטים בעברית?

לא מומלץ בכלל. המודל אומן בעיקר על טקסטים באנגלית, וכל שפה אחרת נכנסה רק בכמויות זניחות דרך דפי רשת כלליים. הוא לא יבין פניות מורכבות בעברית וייצר בעיקר טקסט משובש.

איך מריצים

טעינה שלו דורשת כרטיס גרפי רציני. כדי להחזיק 13 מיליארד פרמטרים בדיוק של float16 תצטרכו לפחות 26 גיגה בייט של זיכרון גרפי רק עבור המשקלים, ועוד מרווח עבור הזיכרון של ההקשר. בפועל זה אומר כרטיס של 40 או 80 גיגה בייט, או פיצול בין שני כרטיסים ביתיים חזקים. הטוקנייזר המהיר של הספרייה לא עובד איתו בצורה תקינה, ולכן חייבים לכבות אותו ולהשתמש בגרסה האיטית.

אם אין לכם חומרת שרתים ייעודית, אין טעם לנסות להרים אותו על מחשב מקומי. עדיף בהרבה להשתמש ב־API חיצוני של מודלים מודרניים, או לפנות לגרסאות הקטנות יותר במשפחה אם רק בודקים צינורות עבודה של קוד.

from transformers import pipeline

pipe = pipeline("text-generation", model="facebook/opt-13b")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other ולא כרישיון קוד פתוח סטנדרטי. במקור המשקלים שוחררו תחת רישיון מחקרי לא מסחרי שנועד לאקדמיה ולמעבדות. אם אתם מתכננים לבנות עליו מוצר מסחרי או להטמיע אותו בשירות בתשלום, אי אפשר להשתמש בו ישירות בלי לוודא את תנאי הרישיון המקוריים של מטא במסמך המצורף.

הרישיון המלא בעמוד המודל ↗