GPT
D

distilroberta-base-climate-f

קוד פתוח

climatebertapache-2.02022-03-02

  • transformers
  • pytorch
  • safetensors
  • roberta
  • fill-mask

גרסה מזוקקת של RoBERTa שאומנה ספציפית על טקסטים של אקלים, דוחות חברות ומאמרים מדעיים. מתאים למי שצריך מודל קל משקל ומהיר להבנת טרמינולוגיה סביבתית בלי להחזיק שרת יקר.

  • 82Mפרמטרים
  • 514טוקנים בהקשר
  • 632 MBמשקל הקבצים
  • 3,342הורדות בחודש

מה זה

הבסיס כאן הוא DistilRoBERTa, מודל של 82 מיליון פרמטרים ושישה שכבות, שעבר אימון מקדים נוסף על קורפוס של מעל שני מיליון פסקאות מתחום האקלים. הקורפוס כולל תקצירי מאמרים מדעיים, חדשות כלליות ודיווחים תאגידיים. היוצרים השתמשו באסטרטגיית בחירת דגימות בשם FULL-SELECT, והם מציינים שזו הגרסה המומלצת מבין הווריאציות שלהם והיחידה שהם מעדכנים.

המטרה העיקרית של המודל במצבו הנוכחי היא השלמת מילים חסרות, fill-mask, אבל בפועל מדובר באבן בניין. במקום לקחת מודל שפה גנרי שלא מכיר מושגים כמו פליטות פחמן או רגולציית ESG, מקבלים ייצוג וקטורי שמבין את ההקשרים האלה מראש, וכל זה במשקל קובץ של 632 מגה בייט בלבד.

מתאים ל

  • בסיס לסיווג דוחות אקלים

    אימון שכבת סיווג מעליו כדי לקטלג הצהרות סביבתיות בדוחות כספיים באנגלית.

  • חילוץ הקשרים ממאמרים

    הפקת ייצוגים וקטוריים שמבינים טרמינולוגיה סביבתית מתקדמת מתוך תקצירים מדעיים.

  • השלמת מושגים סביבתיים

    משימות fill-mask ממוקדות בטקסטים של קיימות ומדעי כדור הארץ.

איפה זה נופל

חלון ההקשר עומד על 514 טוקנים בלבד, כך שאי אפשר להזין אליו מסמכים שלמים או דוחות קיימות ארוכים בלי לחתוך אותם לפסקאות קצרות קודם לכן. בנוסף, הוא אומן רק באנגלית, כך שהוא לא יעזור לטקסטים בעברית.

המודל מוגדר למשימת fill-mask ולא יודע לענות על שאלות חופשיות או לייצר טקסט כמו מודלים מודרניים. אם אתם צריכים סיווג מסמכים או חילוץ ישויות, תצטרכו לאמן עליו שכבת ראש ייעודית ולא להשתמש בו ישירות מהקופסה.

שאלות
נפוצות

האם המודל הזה מתאים לניתוח טקסטים בעברית?

לא. המודל אומן על קורפוס באנגלית בלבד של מאמרים וחדשות. הזנה של עברית תניב תוצאות לא שמישות, ולצורך כך עדיף לקחת מודל רב-לשוני ולבצע עליו התאמה.

האם אפשר להשתמש בו לצ'אט או לתשובות לשאלות?

לא באופן ישיר. מדובר בארכיטקטורת RobertaForMaskedLM שמיועדת להשלמת טוקנים חסרים, ולא במודל אוטורגרסיבי שמייצר תשובות. כדי לענות על שאלות תצטרכו לאמן אותו ייעודית למשימה.

איזה כוח מחשוב נדרש כדי להריץ אותו בפרודקשן?

מעט מאוד. עם 82 מיליון פרמטרים ומשקל קבצים של 632 מגה בייט, המודל רץ במהירות גבוהה גם על CPU פשוט, ואינו מחייב כרטיס מסך ייעודי כדי לעמוד בעומסי עבודה קלים עד בינוניים.

איך מריצים

בגלל הגודל המזערי שלו, אתם יכולים להריץ אותו כמעט על כל מכונה דרך ספריית transformers, אפילו על מעבד רגיל בלי מאיץ גרפי. הוא דורש זיכרון עבודה מינימלי ומתאים מאוד להרצה מקומית, בקונטיינר קטן או כחלק מצינור עיבוד נתונים קיים.

אין שום הצדקה כלכלית לשלם על API חיצוני בשביל מודל של 82M פרמטרים. אם המטרה היא להשתמש בו למיון או לתיוג, שווה לקחת אותו כבסיס ולעשות לו fine-tuning ישירות על השרת שלכם.

from transformers import pipeline

pipe = pipeline("fill-mask", model="climatebert/distilroberta-base-climate-f")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0, וזה אומר חופש פעולה כמעט מלא. מותר להשתמש בו בפרויקטים מסחריים, לשנות את המשקלים, לשלב אותו בתוך מוצר סגור ולהפיץ אותו. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗