GPT
S

scibert_scivocab_uncased

קוד פתוח

allenaiרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • jax
  • bert
  • en

מודל שפה קלאסי שאימנו מאפס על מאמרים מדעיים מלאים. הוא מתאים למי שצריך לעבד טקסט מחקרי באנגלית ולא רוצה שברט הרגיל ייחנק על שמות כימיים או מונחים טכניים.

  • 512טוקנים בהקשר
  • 841 MBמשקל הקבצים
  • 222,065הורדות בחודש
  • 175לייקים

מה זה

מדובר בארכיטקטורת ברט בסיסית עם 12 שכבות, אבל במקום להסתמך על ויקיפדיה, הצוות אימן אותה על 1.14 מיליון מאמרים ממאגר Semantic Scholar, בהיקף של 3.1 מיליארד טוקנים. החלק המשמעותי הוא שהאימון כלל את גוף המאמרים המלא ולא רק את התקצירים.

ההבדל העיקרי מברט הרגיל הוא אוצר המילים, שנקרא כאן scivocab. מודלים כלליים נוטים לחתוך מילים מדעיות מורכבות להמון תת-מילים קטנות, מה שמבלבל את הניתוח ומבזבז מקום. כאן בנו מילון ייעודי שמזהה מונחים מקצועיים כיחידות שלמות, בגרסה הזו ללא תלות באותיות גדולות או קטנות.

מתאים ל

  • סיווג פסקאות מדעיות

    זיהוי מתודולוגיות או תוצאות בתוך מחקרים בזכות מילון שמכיר את הז'רגון האקדמי.

  • חילוץ ישויות רפואיות

    איתור שמות של תרופות, מחלות ומינונים בטקסט אנגלי שברט רגיל מפרק בצורה עקומה.

  • חיפוש סמנטי במאמרים

    ייצור וקטורים מדויקים לקטעי מחקר באנגלית כדי למצוא תוכן מקצועי חופף.

איפה זה נופל

חלון ההקשר מוגבל ל־512 טוקנים, מגבלה מובנית בברט. זה אומר שאי אפשר להזין אליו מאמר שלם בבת אחת אלא רק פסקאות קצרות, למרות שהוא אומן על טקסטים מלאים. הוא תומך באנגלית בלבד, כך שטקסט בעברית לא יעבוד פה. בנוסף, מדובר במודל ייצוג בלבד שמייצר וקטורים, הוא לא מודל שיחה ולא יודע לכתוב טקסט חופשי.

שאלות
נפוצות

האם כדאי להשתמש בו לטקסט רפואי או מדעי בעברית?

לא. המודל אומן רק על אנגלית והמילון הייעודי שלו לא כולל עברית. אם תנסו להריץ עליו טקסט עברי תקבלו שגיאות או טוקנים לא מזוהים.

מה עדיף, הגרסה הזו או גרסת cased?

הגרסה הזו מתאימה לרוב משימות הניתוח הרגילות, אבל בתחומים כמו ביולוגיה שבהם אות גדולה מסמנת גן ואות קטנה מסמנת חלבון, הגרסה הזו תאבד את המידע הזה ועדיף לקחת את cased.

איך מריצים

המשקל הכולל של הקבצים עומד על 841 מגה בייט, כך שלא צריך שרת מפלצתי או כרטיס גרפי כבד כדי להריץ אותו. הוא רץ ישירות דרך ספריית transformers על כל מעבד מודרני, או על כרטיס פשוט אם רוצים לכוונן אותו על דאטה פנימי שלכם.

הגרסה הזו היא uncased, כלומר הופכת הכל לאותיות קטנות. אם יש לכם צורך קריטי בהבחנה בין שמות גנים לחלבונים שנשענים על אותיות גדולות, עדיף לבחור בגרסת ה־cased שלהם. בגלל הגודל הקומפקטי שלו אין שום סיבה לשלם על API חיצוני, קל להחזיק אותו על תשתית מקומית.

from transformers import pipeline

pipe = pipeline("text-generation", model="allenai/scibert_scivocab_uncased")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 841 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

בעמוד המודל לא דווח רישיון כלל. המפתחים מבקשים לתת ציטוט למאמר המקורי מ־2019, אבל היעדר רישיון רשמי וברור אומר שאתם לוקחים סיכון משפטי אם אתם משלבים אותו ישירות במוצר מסחרי סגור בלי לבדוק קודם את תנאי המאגר המקורי.

הרישיון המלא בעמוד המודל ↗