GPT
P

PatentSBERTa

קוד פתוח

AI-Growth-Labרישיון לא דווח2022-03-02

  • sentence-transformers
  • pytorch
  • mpnet
  • feature-extraction
  • sentence-similarity

המודל מייצר וקטורים ייעודיים לטקסטים של פטנטים כדי לחשב מרחק סמנטי ולסווג אותם. תרצו אותו אם אתם בונים חיפוש על מסמכי קניין רוחני ומודל כללי מפספס לכם את הז'רגון.

  • 514טוקנים בהקשר
  • 418 MBמשקל הקבצים
  • 29,798הורדות בחודש
  • 54לייקים

מה זה

מדובר במודל שמבוסס על ארכיטקטורת MPNet עם 12 שכבות, שעבר אימון ייעודי עבור טקסטים מעולם הפטנטים באמצעות שיטת Augmented SBERT. התפקיד שלו הוא לקחת משפטים או פסקאות ולהמיר אותם לווקטור דחוס בגודל 768 ממדים, כך שתוכלו לחשב דמיון קוסינוס ישיר בין רעיונות טכנולוגיים שונים.

רוב מודלי השפה הכלליים מתקשים עם השפה המשפטית והטכנית הכבדה של פטנטים. המודל הזה אומן עם פונקציית מחיר של CosineSimilarityLoss במטרה לתפוס את ההבדלים הדקים בניסוחים של תביעות והגדרות המצאה, מה שמאפשר לקבץ מסמכים דומים או למצוא תקדימים בצורה מדויקת יותר ממה שייתן מודל רגיל.

מתאים ל

  • חיפוש תקדימים בפטנטים

    זיהוי פטנטים קיימים שחופפים לרעיון חדש על בסיס דמיון סמנטי בניסוח התביעות.

  • סיווג אוטומטי של בקשות

    שיוך טקסטים של פטנטים לקטגוריות טכנולוגיות לפי קרבה וקטורית למסמכים קיימים.

  • ניתוח אשכולות טכנולוגיים

    קיבוץ מסמכי קניין רוחני לקבוצות כדי לזהות מגמות מחקר ופיתוח בתחום מוגדר.

איפה זה נופל

חלון ההקשר מוגבל ל־514 טוקנים בלבד, בפועל 512 טוקנים לפי הגדרת השכבה. פטנטים הם מסמכים ארוכים מאוד, ולכן המודל הזה פשוט לא מסוגל לקרוא מסמך שלם. תצטרכו לחתוך את הטקסט לתקצירים, תביעות בודדות או פסקאות ספציפיות לפני שאתם מעבירים אותם אליו.

בנוסף, הכרטיס מציג אימון של תקופה אחת בודדת עם חמישה צעדים בלבד ב־DataLoader שהוגדר שם, בלי נתוני הערכה מפורטים בכרטיס עצמו. חייבים לבדוק אותו מול הנתונים שלכם לפני שסומכים עליו בעיניים עצומות.

שאלות
נפוצות

האם אפשר להעביר למודל פטנט שלם בבת אחת?

לא. המודל חותך את הקלט אחרי 512 טוקנים, שזה בקושי שניים או שלושה עמודים של טקסט רגיל, ובפטנטים זה לרוב רק התקציר או תביעה אחת. כדי להשתמש בו על מסמך מלא תצטרכו לפצל אותו לפסקאות ולייצר וקטור לכל חלק בנפרד.

האם הוא מתאים לטקסטים בעברית?

המודל מבוסס על MPNet ואומן על מאגרי פטנטים בינלאומיים שכתובים באנגלית. הוא לא מיועד לניתוח טקסטים משפטיים או טכניים שנכתבו בעברית, והתוצאות על עברית יהיו חסרות תועלת.

איך מריצים

המשקל הכולל של הקבצים עומד על 418 מגה בייט, כך שאין שום סיבה לשלם ל־API חיצוני על משימות כאלה. המודל ירוץ בקלות על מעבד רגיל בכל שרת פשוט, ובטח על לפטופ פיתוח, בלי צורך בכרטיס מסך ייעודי אם אתם לא מעבדים מיליוני פטנטים בבת אחת.

ההרצה מתבצעת ישירות דרך ספריית sentence-transformers בשלוש שורות קוד, או ישירות דרך transformers של Hugging Face תוך שימוש ב־cls pooling. מכיוון שיש רק גרסה אחת כזו והיא זעירה, מריצים אותה מקומית וחוסכים עלויות ענן.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("AI-Growth-Lab/PatentSBERTa")
v = m.encode(["שלום עולם"])

הרישיון

היוצרים לא דיווחו על רישיון שימוש בעמוד המודל. מבחינה משפטית, היעדר רישיון אומר שאין לכם היתר מפורש להשתמש בו במוצר מסחרי, וזה יוצר סיכון שאי אפשר להתעלם ממנו בארגון. אם אתם מתכננים להכניס אותו למערכת פעילה, תצטרכו לפנות לחוקרים שפרסמו אותו באוניברסיטת אולבורג כדי לקבל אישור כתוב.

הרישיון המלא בעמוד המודל ↗