GPT
O

opt-66b

קוד פתוח

facebookother2022-06-23

  • transformers
  • pytorch
  • tf
  • jax
  • opt

מודל שפה ענק שפותח כדי לשחזר את היכולות של משפחת GPT-3 במבנה פתוח למחקר. הוא מיועד למי שרוצה משקלים גולמיים לחלוטין בלי תלות בספק חיצוני.

  • 2,048טוקנים בהקשר
  • 368 GBמשקל הקבצים
  • 6,164הורדות בחודש
  • 174לייקים

מה זה

מטא פרסמה את סדרת OPT במטרה לתת למפתחים ולחוקרים גישה ישירה למודל בסדר גודל שמקביל לדור השלישי של GPT. המודל אומן מראש על מאגר של מאה ושמונים מיליארד טוקנים שנאספו מחמישה מקורות מידע שונים, כולל ספרים, רדיט, חדשות וחלקים מתוך The Pile ו־CommonCrawl. הוא בנוי כארכיטקטורת מפענח בלבד ומייצר טקסט בהמשכים על בסיס רצף קלט קודם.

המטרה העיקרית שלו היא השוואת ביצועים במשימות zero-shot ו־few-shot באמצעות תבניות הנחיה דומות לאלו שנבדקו מול GPT-3. מכיוון שמדובר במודל גולמי שלא עבר אימון נוסף עם הנחיות שיחה או התאמה מבוססת משוב אנושי, התפוקה שלו מתמקדת בהשלמת טקסט סטטיסטית ולא בהבנת שיחה או מענה ישיר לבקשות מורכבות.

מתאים ל

  • מחקר על הטיות במודלים

    משקלים מלאים וגישה חופשית לבחינת התנהגות מודלים ענקיים ברמת השכבה הבודדת.

  • אימון ייעודי על משימה

    נקודת פתיחה רחבה לביצוע כוונון עדין על מאגר נתונים פנימי בתחום ספציפי.

  • מדידת ביצועי הנחיות

    בדיקת יכולות למידה ללא דוגמאות מול תוצאות עבר שפורסמו בספרות המקצועית.

איפה זה נופל

הנתונים שאיתם המודל אומן הגיעו ממקורות רשת לא מפוקחים, ולכן הכרטיס מזהיר במפורש מפני רמות גבוהות של הטיות סטריאוטיפיות, שפה פוגענית והזיות. הדוגמאות הרשמיות מציגות פערים מגדריים מובהקים בייחוס מקצועות. בנוסף, חלון ההקשר מוגבל לאלפיים ארבעים ושמונה טוקנים בלבד, מה שמקשה על עיבוד מסמכים ארוכים או שיחות מתמשכות. כל הטיה כזו עוברת ישירות לכל מודל שעובר כוונון עדין על בסיסו.

אותה משפחה

opt יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין ומייצר עברית?

האימון התבסס כמעט לחלוטין על אנגלית. למרות שחלק קטן ממאגר CommonCrawl כולל שפות נוספות, המודל אינו מיועד לעבודה בעברית ויניב בה תוצאות מקוטעות ולא מדויקות.

האם אפשר להשתמש בו ישירות כבוט שיחה?

לא. מדובר במודל שפה בסיסי להשלמת טקסט ולא במודל שעבר אופטימיזציה לדיאלוג. הוא ימשיך את המשפט שתתנו לו במקום להגיב לשאלות שלכם כעוזר אישי.

איך מריצים

כדי להריץ מודל במשקל של שלוש מאות שישים ושמונה גיגה בייט צריך מערך שרתים ייעודי עם מספר כרטיסי מסך חזקים. הטעינה נעשית דרך ספריית transformers ברמת דיוק של float16 כדי לצמצם את צריכת הזיכרון, אך עדיין תידרשו למעל מאה ושלושים גיגה בייט זיכרון גרפי רק בשביל להחזיק אותו בחיים.

המפתחים ממליצים להפעיל את הפונקציה generate ישירות ולא דרך הצינור הרגיל של הספרייה, ולוודא שהטוקנייזר מוגדר ללא המצב המהיר שמכיל באגים בגרסה זו. למי שאינו מנהל חוות שרתים עם מאיצים מתאימים, הרצה עצמית של המודל תהיה יקרה וכבדה מדי לעומת שימוש בשירותים מנוהלים.

from transformers import pipeline

pipe = pipeline("text-generation", model="facebook/opt-66b")
print(pipe("שלום"))

הקבצים

54 קבצים במאגר, 368 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר במאגר כ־other, ומקורו בהפצה המקורית של פרויקט metaseq. הוא נועד למטרות מחקר ואינו מאפשר שימוש מסחרי חופשי בלי בדיקת תנאי ההסכם של מטא. אם אתם מתכננים להטמיע אותו במוצר שמייצר הכנסות, הרישיון הזה מהווה חסם משפטי.

הרישיון המלא בעמוד המודל ↗