GPT
F

Florence-2-Flux-Large

קוד פתוח

gokaygokayapache-2.02024-08-25

  • transformers
  • safetensors
  • florence2
  • image-text-to-text
  • art

גרסה מכווננת של פלורנס 2 שמיועדת כנראה לחילוץ או תיאור פרומפטים עבור מודל התמונות פלוקס. שוקלת מעט ויכולה לרוץ מקומית בלי לחנוק את המעבד הגרפי שלכם.

  • 823Mפרמטרים
  • 1,024טוקנים בהקשר
  • 3.1 GBמשקל הקבצים
  • 1,882הורדות בחודש

מה זה

מדובר במודל ראייה ושפה קטן יחסית של כ־823 מיליון פרמטרים, שמבוסס על הארכיטקטורה של פלורנס 2 מבית מיקרוסופט ופותח על ידי גוקאי איידואן. לפי השם שלו הוא מכוון לעבודה מול פלוקס, כלומר לקחת תמונה ולייצר ממנה תיאור טקסטואלי מפורט שמתאים ליצירת תמונות מחדש, אם כי היוצר כמעט ולא שיתף פרטים יבשים על אופי האימון עצמו.

היתרון המרכזי בגודל כזה הוא המהירות. במקום להרים ענק ראייה שדורש עשרות גיגה־בייטים של זיכרון, המשקל של הקבצים פה מגיע לכ־3.1 גיגה בלבד. הוא מקבל תמונה והוראת טקסט ופולט טקסט בחזרה, בהתאם לסטנדרט של מודלי תמונה לטקסט מהדור הזה.

מתאים ל

  • תיוג תמונות לפלוקס

    יצירת פרומפטים מפורטים באנגלית מתמונות קיימות, כדי להכין דאטה לאימון מודלי תמונה.

  • חילוץ תיאור ראייה מקומי

    ניתוח תמונות מהיר במחשב מקומי בלי לשלוח מידע פרטי לשרתים חיצוניים.

  • פייפליין אוטומטי של תמונות

    עיבוד אצוות גדולות של תמונות בזכות משקל קל של כשלושה גיגה וצריכת זיכרון נמוכה.

איפה זה נופל

הבעיה העיקרית כאן היא חוסר תיעוד קיצוני. היוצר לא צירף דוגמאות קוד, לא ציין על איזה דאטה־סט הוא אימן, ולא סיפק מדדי ביצועים או השוואה מול מודל הבסיס. חלון ההקשר מוגבל ל־1,024 טוקנים בלבד, כך שלא תוכלו לייצר תיאורים ארוכים ומורכבים מאוד. בנוסף, המודל מוגדר עבור השפה האנגלית בלבד, כך שאין מה לבנות עליו לפלט או קלט בעברית.

שאלות
נפוצות

האם המודל מבין או כותב בעברית?

לא. לפי ההגדרות שלו הוא תומך באנגלית בלבד. אם תזינו לו טקסט בעברית או תבקשו ממנו לכתוב בעברית, סביר להניח שתקבלו ג'יבריש או סירוב.

מה בדיוק ההבדל בינו לבין פלורנס 2 הרגיל?

היוצר לא פירט את תהליך האימון בעמוד המודל. השם מעיד על התאמה לסגנון הפרומפטים של מודל יצירת התמונות פלוקס, אך אין בנצ'מרק שמוכיח במה הוא טוב יותר ממודל הבסיס.

איזה כרטיס מסך צריך כדי להשתמש בו?

בגלל שמדובר בכ־823 מיליון פרמטרים ומשקל של 3.1 גיגה בדיוק חצי, כרטיס מסך מודרני עם 6 עד 8 גיגה זיכרון וידאו יספיק לעבודה רציפה.

איך מריצים

כדי להריץ אותו צריך פייתון עם ספריית transformers, ובנוסף תלויות של einops, timm, flash_attn ו־datasets. המשקל הכולל של הקבצים עומד על 3.1 גיגה בערך, ובדיוק של float16 אפשר לדחוף אותו בקלות לכרטיס מסך ביתי עם 6 עד 8 גיגה זיכרון וידאו בלי להזיע.

אם אתם רק צריכים לתאר עשר תמונות ביום, API חיצוני של מודל ענן יחסוך לכם את ההתקנות של פלאש אטנשן שידועה כבעייתית לפעמים. אבל אם אתם מתכוונים לתייג מאגר של אלפי תמונות לקראת אימון לורה של פלוקס, הרצה מקומית על החומרה שלכם תהיה זולה ומהירה בהרבה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="gokaygokay/Florence-2-Flux-Large")
print(pipe("שלום"))

הרישיון

הפרויקט משוחרר תחת רישיון אפאצ'י 2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה מחדש, כל עוד אתם שומרים על הודעת זכויות היוצרים ומציינים את השינויים שביצעתם. אין כאן הגבלות מיוחדות על שילוב במוצר מסחרי סגור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗