GPT
B

bert-tiny

קוד פתוח

prajjwal1mit2022-03-02

  • transformers
  • pytorch
  • BERT
  • MNLI
  • NLI

גרסה מכווצת במיוחד של ברט ששוקלת רק 17.2 מגה בייט. בוחרים בה כשחייבים להריץ עיבוד שפה על חומרה חלשה מאוד או בתוך אפליקציה בלי לפגוע בביצועים.

  • 512טוקנים בהקשר
  • 17.2 MBמשקל הקבצים
  • 1,442,766הורדות בחודש
  • 148לייקים

מה זה

מדובר בהמרה לפייטורץ' של מודל קומפקטי שגוגל שחררו במקור בטנסורפלו, עם שתי שכבות בלבד וממד נסתר של 128. הוא נולד מתוך מחקר שבדק חשיבות של אימון מקדים במודלים קטנים, והועלה לספריית הטרנספורמרים לצורך בדיקת הכללה במשימות הסקת שפה טבעית. הוא לא מגיע מוכן לשימוש ישיר מהקופסה, אלא מהווה בסיס שמיועד לאימון נוסף על משימה מוגדרת.

ההבדל בינו לבין שאר הדגמים בסדרה, כמו מיני, סמול ומדיום, מסתכם בעומק וברוחב הרשת. כאן קיבלתם את הגרסה הכי רזה שיש, מה שאומר שהיא תרוץ במהירות חריגה אבל גם תבין פחות ניואנסים לעומת האחים הגדולים שלה.

מתאים ל

  • סיווג טקסט במכשירי קצה

    שוקל 17.2 מגה בייט ולכן מתאים למיון מהיר של הודעות או קלטים ישירות על מכשיר טלפון ללא שרת.

  • בדיקות מהירות בסביבת פיתוח

    נטען בשבריר שנייה ומאפשר לבדוק את תקינות צינור המידע בקוד לפני שמשקיעים כסף במודלי ענק.

  • סינון ראשוני בצינור עיבוד

    מזהה כוונות בסיסיות של משתמשים באנגלית במהירות גבוהה כדי להחליט אם לנתב את הבקשה הלאה.

איפה זה נופל

המודל תומך באנגלית בלבד ולא יבין עברית, כך שאם המוצר שלכם פונה לשוק המקומי תצטרכו לחפש פתרון אחר. מעבר לזה, עם שתי שכבות בלבד הוא מוגבל מאוד בהבנת טקסטים מורכבים ולא מסוגל להתמודד עם משימות עמוקות. הדף שלו מבהיר במפורש שחובה לאמן אותו על משימה ספציפית לפני שרואים תוצאות כלשהן, כך שאי אפשר פשוט לזרוק אליו טקסט ולצפות לתשובות.

שאלות
נפוצות

האם אפשר להשתמש בו ישירות לשאלות ותשובות בלי אימון?

לא, המודל מגיע עם ידע שפתי בסיסי בלבד ודף המודל מציין שהוא נועד לאימון נוסף על המשימה שלכם. כדי להוציא ממנו תועלת תצטרכו לאמן אותו על סט נתונים מסווג משלכם.

האם הוא יעבוד עם טקסט בעברית?

לא, המודל אומן על אנגלית בלבד. אם תזינו לו עברית הוא יפרק את המילים לגורמים חסרי משמעות ולא יספק שום תוצאה סבירה.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון עם שתי שורות קוד. אין פה שום צורך בכרטיס מסך ייעודי, המודל רץ בלי למצמץ על מעבד רגיל של שרת זול או אפילו ישירות בתוך אפליקציית מובייל ודפדפן בזכות המשקל המזערי שלו.

מי שצריך עוד קצת דיוק יכול לבחור באותה סדרה בגרסאות mini או small, שמוסיפות שכבות וממד רחב יותר תמורת עוד זיכרון. אין שום סיבה לשלם על API חיצוני כשמריצים משהו בסדר גודל כזה, כי העלות החישובית שלכם עצמאית שואפת לאפס.

from transformers import pipeline

pipe = pipeline("text-generation", model="prajjwal1/bert-tiny")
print(pipe("שלום"))

הקבצים

5 קבצים במאגר, 17.2 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון MIT פתוח ומתירני לחלוטין. מותר לכם להוריד את המשקלים, לאמן אותם מחדש, לשלב אותם במוצר מסחרי סגור ולמכור אותו, בלי לשלם תמלוגים ובלי לפתוח את הקוד שלכם. התנאי היחיד הוא שמירת הודעת זכויות היוצרים של הרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗