GPT
B

bert-for-patents

קוד פתוח

anfericoapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • safetensors
  • fill-mask

התאמה של ברט לארג' שגוגל אימנה על מעל מאה מיליון פטנטים מרחבי העולם. הוא מיועד למי שמנתח טקסטים משפטיים וטכנולוגיים כבדים באנגלית.

  • 346Mפרמטרים
  • 512טוקנים בהקשר
  • 4.0 GBמשקל הקבצים
  • 13,275הורדות בחודש

מה זה

מדובר במודל שפותח במקור על ידי גוגל ומבוסס על הארכיטקטורה של ברט לארג', עם עשרים וארבע שכבות וקרוב ל־346 מיליון פרמטרים. במקום להתאמן על טקסטים כלליים מהרשת או מוויקיפדיה, הוא ראה יותר ממאה מיליון מסמכי פטנטים ממדינות שונות, מה שנותן לו אוצר מילים והבנה של ניסוחים משפטיים והנדסיים מורכבים מאוד.

המשימה הבסיסית שלו היא השלמת מילים חסרות בתוך טקסט. בשונה ממודלי שפה גנרטיביים מודרניים, הוא לא כותב פסקאות ולא מנהל שיחה, אלא מחזיר ייצוג וקטורי מדויק של שפה טכנית לצורכי חיפוש, סיווג או חילוץ מידע בעולם הפטנטים.

מתאים ל

  • סיווג פטנטים

    אימון שכבת סיווג עליונה כדי למיין בקשות פטנט לקטגוריות טכנולוגיות לפי הניסוח המקצועי שלהן באנגלית.

  • חיפוש דמיון סמנטי

    הפקת וקטורים מתביעות פטנט כדי לאתר מסמכים קודמים בעלי משמעות הנדסית זהה, מעבר להתאמת מילים פשוטה.

  • חילוץ ישויות טכניות

    זיהוי רכיבים, חומרים ותהליכים מוגדרים מתוך תיאורים הנדסיים מורכבים בבקשות רישום.

איפה זה נופל

הוא מבין רק אנגלית, כך שמסמכים בעברית או מונחים מקומיים לא יעבדו כאן בכלל. חלון ההקשר מוגבל ל־512 טוקנים, מה שאומר שאי אפשר להזין פטנט שלם בבת אחת וחייבים לחתוך את הטקסט לחלקים קטנים. בנוסף, זהו מודל ייצוג בלבד שמיועד למשימות מסוג fill-mask או כבסיס לאימון נוסף, ולא כלי שמסכם מסמכים או עונה על שאלות חופשיות.

שאלות
נפוצות

האם המודל יודע לקרוא פטנט ישראלי?

רק אם הוא כתוב באנגלית. המודל אומן על שפה זו בלבד, ולכן אין לו יכולת לנתח טקסטים או מונחים טכניים בעברית.

אפשר להשתמש בו כמו צ'אטבוט לשאלות על פטנטים?

לא. זהו מודל מסוג מסיכה שמנחש מילים חסרות או מייצר ייצוג מספרי לטקסט. הוא לא יודע לייצר תשובות ארוכות או לנהל שיחה, אלא לשמש תשתית לחיפוש וסיווג.

איך מריצים

כדי להריץ אותו דרך ספריית transformers תצטרכו להוריד קבצים במשקל כולל של ארבעה גיגהבייט. המודל דורש כרטיס מסך סביר עם לפחות שישה עד שמונה גיגהבייט זיכרון כדי לעבוד בנוחות עם חלון של 512 טוקנים, במיוחד אם אתם מתכננים לעשות לו כוונון עדין.

הוא רץ בקלות על שרת עצמאי או אפילו על מחשב פיתוח חזק. אם אתם רק צריכים לסווג כמה אלפי מסמכים פעם אחת, שירות ענן שמספק גישה למודלים לפי שימוש יחסוך את התחזוקה, אבל לעבודה שוטפת זול בהרבה להרים אותו בעצמכם.

from transformers import pipeline

pipe = pipeline("fill-mask", model="anferico/bert-for-patents")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 4.0 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 מאפשר שימוש חופשי לחלוטין, כולל פיתוח מוצרים מסחריים ושילוב בקוד סגור. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי חובה לפתוח את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗