GPT
T

text_summarization

קוד פתוח

Falconsaiapache-2.02023-10-21

  • transformers
  • pytorch
  • coreml
  • onnx
  • safetensors

גרסה מכווננת של T5-small שמיועדת לתמצות קצר ומהיר באנגלית. היא מתאימה למי שחייב תגובה מיידית בחומרה בסיסית ובלי לשלם על מודלי ענק.

  • 61Mפרמטרים
  • 512טוקנים בהקשר
  • 1.5 GBמשקל הקבצים
  • 43,175הורדות בחודש

מה זה

מדובר במודל שמבוסס על T5-small עם 61 מיליון פרמטרים, שאומן ספציפית לקחת טקסט ולהוציא ממנו תקציר תמציתי. היוצרים כיוונו אותו עם קצב למידה של 2e-5 וגודל אצווה של 8 על מסמכים שחוברו להם תקצירי אנוש, כך שהוא ממוקד אך ורק במשימה הזו ולא אמור לשמש לשום דבר אחר.

בכרטיס המודל מדווח ציון ROUGE של 0.95 לצד מדדים שנראים כמו מספרים רנדומליים או דוגמת קוד שלא נערכה. במציאות, ציון כזה בתמצות מופשט כמעט ולא קיים, וסביר להניח שזה אינדיקטור לבדיקה על דאטהסט ספציפי או שגיאת דיווח, לכן צריך לקחת את ההבטחות האלו בעירבון מוגבל ולבדוק אותו ישירות מול הטקסטים שלכם.

מתאים ל

  • תקצור מבזקי חדשות

    הוא קולט פסקה או שתיים באנגלית ומייצר משפט תמציתי בלי להעמיס על השרת.

  • עיבוד פניות שירות קצרות

    מאפשר לייצר שורת תקציר לכרטיסי תמיכה קצרים שנכנסים באנגלית.

  • הרצה מקומית על מחשב קצה

    הגודל הזעיר מאפשר להריץ אותו ישירות על מחשב אישי רגיל ללא כרטיס גרפי.

איפה זה נופל

המגבלה הכי קשה היא חלון הקשר של 512 טוקנים בלבד. אי אפשר לדחוף אליו מאמרים ארוכים, מסמכים משפטיים או ספרים, אלא רק פסקאות קצרות וידיעות חדשותיות ממוקדות. מעבר לזה, המודל אומן על אנגלית בלבד ולא יפיק שום דבר בעל ערך בעברית. הכרטיס מציין במפורש שהוא מיועד אך ורק לתמצות ולא יתפקד במשימות שפה אחרות.

שאלות
נפוצות

האם המודל תומך בתמצות טקסטים בעברית?

לא. המודל אומן על אנגלית בלבד לפי המפרט שלו. אם תזינו לו טקסט בעברית תקבלו פלט משובש לחלוטין או ג'יבריש.

איך אפשר לתמצת בעזרתו מסמך של כמה עמודים?

אי אפשר להכניס אליו מסמך ארוך בפעם אחת בגלל מגבלת 512 הטוקנים. תצטרכו לפצל את המסמך לחתיכות קטנות, לתמצת כל פסקה בנפרד, ואז לתמצת שוב את התוצאות.

איך מריצים

בזכות גודל של 61 מיליון פרמטרים ומשקל קבצים של 1.5 גיגה בייט בפורמט float32, אפשר להריץ אותו בקלות על כל מעבד מודרני בלי להזדקק לכרטיס מסך ייעודי. טוענים אותו ישירות דרך ספריית transformers של פייתון בפייפליין של תמצות.

אם יש לכם שרת עצמאי זול, להריץ אותו מקומית יעלה פרוטות ויוריד תלות ברשת. לעומת זאת, אם אתם צריכים לטפל במסמכים של אלפי מילים או בשפות אחרות, אין היגיון להתאמץ כאן ועדיף לקרוא ל־API חיצוני של מודל גדול יותר.

from transformers import pipeline

pipe = pipeline("summarization", model="Falconsai/text_summarization")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון apache-2.0. זה רישיון פתוח ומתירני שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והפצה פנימית או חיצונית, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים את נוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗