GPT
S

specter2_base

קוד פתוח

allenaiapache-2.02023-02-16

  • transformers
  • pytorch
  • bert
  • feature-extraction
  • en

זה מודל בסיס לייצור וקטורים ממאמרים מדעיים, שנועד לעבוד יחד עם מתאמים ייעודיים למשימות שונות. הוא מתאים למי שבונה חיפוש, סיווג או המלצות לספרות אקדמית באנגלית.

  • 512טוקנים בהקשר
  • 420 MBמשקל הקבצים
  • 986,946הורדות בחודש
  • 48לייקים

מה זה

הארכיטקטורה מבוססת על bert-base-uncased וכוללת 12 שכבות שאומנו על גבי scibert. המודל למד מעל שישה מיליון שלשות של ציטוטים אקדמיים, שבהם מאמר מקור מוצמד למאמר מצוטט ולמאמר שאינו קשור, במטרה ללמוד קרבה רעיונית בין טקסטים מדעיים לפי כותרת ותקציר.

גרסת הבסיס הזו מספקת ציון ממוצע של 69.1 במבחן SciRepEval וציון של 38.0 במדד MAP במבחן ההמלצות MDCR, לעומת 67.5 ו־30.6 בהתאמה של הגרסה הראשונה. למרות השיפור, המפתחים עצמם מציינים שגרסת הבסיס לבדה לא מיועדת לעבודה ישירה, וכדי להגיע לתוצאות המלאות של 71.1 נקודות יש לטעון עליה מתאמים ייעודיים לפי סוג המשימה שלכם.

מתאים ל

  • בסיס למערכות חיפוש מאמרים

    חיבור מתאם adhoc query או proximity כדי לקשר בין שאילתות קצרות לתקצירי מאמרים מדעיים.

  • חילוץ מאפיינים לסיווג אקדמי

    הזנת וקטורים למסווגים לינאריים כדי למיין מאמרים לתחומים ונושאים לפי כותרת ותקציר.

  • המלצות ציטוטים ומאמרים דומים

    מדידת קרבה בין מאמרים קיימים לחיזוי ציטוטים עתידיים על בסיס מבחן MDCR.

איפה זה נופל

המודל מוגבל לחלון של 512 טוקנים, מה שאומר שהוא מסוגל לקרוא רק את הכותרת והתקציר של המאמר ולא את הטקסט המלא. בנוסף, הוא אומן לחלוטין באנגלית בלבד ואינו מיועד לטקסטים בעברית. שימוש במודל הבסיס הזה בפני עצמו, בלי לטעון מתאם מותאם לסיווג, רגרסיה או חיפוש, ייתן ביצועים נחותים כמעט בכל תרחיש.

אותה משפחה

specter2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להשתמש במודל הזה ישירות במוצר?

לא. המודל הזה הוא שלד בסיס שנועד לעבודה עם מתאמים. לשימוש כללי של דמיון בין מאמרים עדיף להוריד את allenai/specter2 שמכיל כבר את מתאם הקרבה, או להצמיד לבסיס מתאם ספציפי למשימה שלכם.

האם הוא מסוגל לקרוא מאמרים מדעיים בעברית?

לא, המודל אומן על טקסטים באנגלית בלבד באמצעות אוצר המילים של scibert. הזנת טקסט בעברית תוביל לחיתוך לא תקין של מילים ותוצאות וקטוריות חסרות משמעות.

איך מריצים

במשקל של 420 מגה בייט ודיוק float32, אפשר להריץ אותו בלי בעיה על מעבד רגיל בכל מחשב פיתוח, אם כי לטעינה של נפחי מאמרים גדולים מומלץ כרטיס גרפי בסיסי עם לפחות 4 ג'יגה זיכרון. הריצה מתבצעת בספריית transformers הרגילה, אך מצריכה גם את ספריית adapters כדי לשלב את הראשים המתאימים.

אם כל מה שאתם צריכים זה וקטורים כלליים לחיפוש דמיון בין מאמרים, אין טעם להרכיב את הבסיס והמתאם לבד. עדיף להוריד ישירות את allenai/specter2 שכולל כבר את מתאם הקרבה המובנה, או לפנות לגרסה המעודכנת aug2023refresh אם אתם עובדים עם מאמרים שנכתבו אחרי 2018.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="allenai/specter2_base")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 420 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 מאפשר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או חיצונית בתוך מוצרים. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי חובת שחרור של קוד המוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗