GPT
B

bart-base

קוד פתוח

facebookרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • safetensors

מודל seq2seq קלאסי שמשלב אנקודר דו-כיווני ודקודר אוטורגרסיבי באנגלית. הוא מיועד בעיקר למי שרוצה בסיס קל לאימון מותאם אישית למשימות כמו סיכום טקסט או סיווג.

  • 1,024טוקנים בהקשר
  • 2.1 GBמשקל הקבצים
  • 309,765הורדות בחודש
  • 206לייקים

מה זה

מדובר בארכיטקטורת transformer של שש שכבות שפותחה על ידי פייסבוק ואומנה על שחזור טקסט שעבר שיבוש מכוון. החלק הראשון קורא את הקלט לשני הכיוונים בדומה ל־BERT, והחלק השני מייצר את הפלט ברצף כמו GPT. המבנה הזה נותן לו גמישות מול משימות שדורשות גם הבנה של ההקשר המלא וגם יצירת פלט רציף.

המשקל שלו עומד על 2.1 גיגה-בייט בדיוק float32, מה שהופך אותו לקומפקטי מאוד ביחס למודלים מודרניים. הוא אומן על אנגלית בלבד ומיועד בעיקר כבסיס לפיין-טיונינג ולא כמנוע שעומד בפני עצמו לשיחה או לכתיבה חופשית. בכרטיס המודל מצוין במפורש שצוות הפיתוח המקורי אפילו לא כתב לו כרטיס רשמי, והתיעוד הקיים נוצר על ידי האגינג פייס.

מתאים ל

  • פיין-טיונינג למשימות סיכום

    השילוב בין אנקודר לדקודר הופך אותו לנקודת מוצא טובה ויציבה לאימון מודל קטן שמסכם טקסטים קצרים באנגלית.

  • סיווג טקסט מורכב

    האנקודר הדו-כיווני מאפשר לייצר ייצוג וקטורי איכותי של משפטים עבור מודלי סיווג או זיהוי כוונות.

  • השלמת מקטעי טקסט

    בזכות אימון הדנוייזינג המקורי, המודל הגולמי מסוגל לבצע text infilling לטקסטים עם חוסרים.

איפה זה נופל

הגרסה הזו לא יודעת לעשות כמעט כלום מהקופסה מעבר לחילוץ וקטורים או השלמת מילים פשוטה, כי היא מודל גולמי שחייב אימון נוסף כדי להחזיר תשובות מועילות. בנוסף, הוא אומן אך ורק על אנגלית, כך שלעברית אין מה לחפש כאן בלי להשקיע באימון מאסיבי מאפס. חלון ההקשר מוגבל ל־1,024 טוקנים בלבד, מה שפוסל ניתוח של מסמכים ארוכים בפעימה אחת.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה ישירות כדי לקבל תשובות לשאלות?

לא מומלץ בכלל. המודל הגולמי מחזיר וקטורים ומיועד לאימון נוסף, לא לשיחה או למענה ישיר. אם אתם צריכים תשובות מוכנות, חפשו בהאגינג פייס גרסה שכבר עברה פיין-טיונינג על דאטה-סט של שאלות ותשובות.

האם המודל תומך בעבודה עם טקסטים בעברית?

הוא אומן על אנגלית בלבד. אם תזינו לו עברית תקבלו תוצאות שבורות או חסרות משמעות, ועדיף לבחור במודל רב-לשוני מראש אם השפה שלכם אינה אנגלית.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון עם BartModel ו־BartTokenizer. כל מה שצריך זה להעביר טקסט מקודד ולקבל את ה־hidden states לצורך עיבוד המשך או אימון שכבה עליונה.

בגודל של 2.1 גיגה-בייט אפשר להריץ אותו בלי בעיה על מעבד רגיל של לפטופ או על כרטיס מסך פשוט מאוד עם כמה גיגה-בייט בודדים של VRAM. אין שום הצדקה לשלם לספק חיצוני על שירות ענן ייעודי רק בשביל להריץ אותו, אלא אם כן אתם מריצים מיליוני בקשות בשעה וצריכים תשתית שמנהלת עומסים אוטומטית.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="facebook/bart-base")
print(pipe("שלום"))

הרישיון

הרישיון לא דווח בעמוד של המודל. מבחינה משפטית, כשאין רישיון מוגדר, אין לכם אישור רשמי להפיץ אותו, להטמיע אותו במוצר מסחרי או להשתמש בפלטים שלו באפליקציה פתוחה. לפני שאתם מתכננים לבנות עליו משהו שנמכר ללקוחות, חובה לבדוק את הרישוי המקורי במאגר fairseq של פייסבוק כדי למנוע חשיפה לתביעות זכויות יוצרים.

הרישיון המלא בעמוד המודל ↗