GPT
S

superprompt-v1

קוד פתוח

roborovskimit2024-02-13

  • transformers
  • safetensors
  • t5
  • text2text-generation
  • en

הוא מרחיב פרומפטים קצרים לתיאורים עשירים שמיועדים למודלי תמונה. עם 77 מיליון פרמטרים בלבד, הוא רץ בכל מקום בלי להעמיס על השרת.

  • 77Mפרמטרים
  • 512טוקנים בהקשר
  • 297 MBמשקל הקבצים
  • 11,150הורדות בחודש

מה זה

מדובר במודל T5 שעבר כוונון ייעודי על דאטה-סט שנקרא SuperPrompt, במטרה לקחת משפט בסיסי ולהפוך אותו לפרומפט מפורט שמתאים למודלי טקסט לתמונה. במקום לחבר מודל שפה ענק של מיליארדי פרמטרים רק כדי לנפח תיאור של תמונה, יש כאן פתרון ממוקד של 297 מגה-בייט בלבד שמבצע רק את הפעולה הזו.

הוא מקבל את הטקסט שלכם, מוסיף פרטים על תאורה, סגנון ורקע, ומכוון לפלט קצר יחסית. המודל מחזיר תיאורים שמותאמים לעבודה ישירה מול מחוללי תמונות, כשהרעיון הוא לשים אותו כשלב מקדים בצינור העבודה לפני ששולחים את הבקשה למודל הכבד.

מתאים ל

  • קדם-עיבוד לתמונות

    ניפוח תיאור בסיסי של משתמש לפרומפט ויזואלי עשיר לפני שליחה למחולל תמונות.

  • בוטים מקומיים

    שילוב בצינור יצירת מדיה שרץ כולו על מעבד רגיל בלי עלויות של כרטיסי מסך.

  • התאמה לסטייבל דיפיוז'ן

    חיתוך והתאמה של פלט טקסטואלי בדיוק למגבלת 77 הטוקנים של המודל הגרפי.

איפה זה נופל

הוא תומך באנגלית בלבד ואין לו שום הבנה בעברית, כך שתצטרכו לתרגם כל קלט לפני השליחה אליו. חלון ההקשר עומד על 512 טוקנים, אבל בפועל מומלץ להגביל את הפלט ל־77 טוקנים בדיוק בגלל מגבלות האורך של מודלים כמו סטייבל דיפיוז'ן. בנוסף, אם לא תספקו את משפט הקידומת המדויק שהיוצר הגדיר, איכות ההרחבה תיפגע, והוא עלול לחזור על מילים או להמציא פרטים שלא קשורים לבקשה המקורית.

שאלות
נפוצות

האם המודל יודע לעבוד עם פרומפטים בעברית?

לא. המודל אומן על אנגלית בלבד. אם תזינו לו טקסט בעברית הוא לא ידע מה לעשות איתו, ולכן חובה לתרגם את הקלט לאנגלית לפני הפנייה אליו.

למה להגביל את הפלט דווקא ל־77 טוקנים?

זו המגבלה המקורית של מודלים כמו סטייבל דיפיוז'ן. המטרה של המודל הזה היא לייצר תיאור קולע שנכנס בדיוק במסגרת הזו בלי להיחתך באמצע המשפט.

איך מריצים

ההרצה פשוטה מאוד ודורשת רק את ספריית transformers הרגילה של פייתון. בגלל הגודל המזערי שלו, 77 מיליון פרמטרים בפורמט float32, אין שום צורך במעבד גרפי ייעודי ואפשר להריץ אותו ישירות על מעבד רגיל בכל מכונה מקומית או שרת פשוט.

חובה להשתמש בקידומת המדויקת שהוגדרה לו כדי לקבל תוצאות טובות, ולהגביל את מספר הטוקנים ביציאה ל־77. אין שום סיבה לשלם על API חיצוני בשביל משימה כזו, כי המודל שוקל פחות מ־300 מגה-בייט ומייצר תשובות כמעט בלי לצרוך זיכרון.

from transformers import pipeline

pipe = pipeline("text-generation", model="roborovski/superprompt-v1")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 297 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הוא מופץ תחת רישיון MIT. המשמעות היא חופש מלא לשימוש מסחרי ואישי, כולל שינוי הקוד והטמעה במוצרים סגורים, בלי דרישה לחשוף את הפיתוח שלכם. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים ונוסח הרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗