GPT
L

Lumina-mGPT-7B-768

קוד פתוח

Alpha-VLLMרישיון לא דווח2024-07-29

  • transformers
  • safetensors
  • chameleon
  • text-generation
  • Any2Any

מודל רב מודלי של שבעה מיליארד פרמטרים שמייצר תמונות מטקסט ומטפל במשימות חזותיות ומילוליות באותו מקום. הוא מעניין בעיקר למי שרוצה ארכיטקטורה אוטורגרסיבית אחת לשני הכיוונים.

  • 7Bפרמטרים
  • 4,096טוקנים בהקשר
  • 13.1 GBמשקל הקבצים
  • 2,840הורדות בחודש

מה זה

מדובר במודל שמבוסס על ארכיטקטורת Chameleon, שבה טקסט ותמונות מעובדים יחד באותה רשת בדיוק של bfloat16 עם 32 שכבות. הוא מסווג תחת משימת any-to-any, כלומר הוא לא רק רואה תמונה ומנתח אותה, אלא יודע לייצר תמונות פוטו-ריאליסטיות מתוך תיאור טקסטואלי.

רוב המודלים הפתוחים בגודל שבעה מיליארד מתמקדים או בטקסט בלבד, או בראייה ממוחשבת שמחזירה תשובה כתובה. כאן יש ניסיון לחבר את היצירה הגרפית עצמה ישירות לתהליך האוטורגרסיבי, בלי להסתמך על מודל דיפוזיה נפרד בצד, מה שמפשט את הצינור ברגע שהוא כבר רץ.

מתאים ל

  • מחקר על מודלים מאוחדים

    הוא מטפל ביצירת תמונות ובטקסט ברשת אוטורגרסיבית יחידה, בלי להפריד תהליכים בין שני מנועים שונים.

  • יצירת תמונות מקומית בקוד

    הוא מפיק תמונות מתיאור מילולי ישירות מתוך סביבת פייתון פתוחה, בלי תלות בשירותי ענן חיצוניים.

  • ניסויי ראייה ויצירה משולבים

    הארכיטקטורה שלו בנויה לקבל ולפלוט גם טקסט וגם פיקסלים באותו רצף עיבוד.

איפה זה נופל

היוצרים לא פרסמו תוצאות מדידה או מבחני ביצועים ישירים בדף המודל, כך שאי אפשר לדעת מראש איך הוא מתמודד מול מודלים ייעודיים ליצירת תמונות או להבנת טקסט. חלון ההקשר עומד על 4,096 טוקנים, שזה מעט מאוד כשמייצרים או מעבדים טוקנים של תמונה שלוקחים נפח גדול מהזיכרון. תצטרכו לבדוק בעצמכם את איכות התוצר ואת זמני ההפקה לפני שאתם בונים עליו למשהו אמיתי.

שאלות
נפוצות

האם המודל תומך בעברית?

הכרטיס לא מציין תמיכה בשפות שאינן אנגלית. רוב מודלי התמונה המאוחדים מאומנים בעיקר על דאטה באנגלית, ולכן הנחיות בעברית כנראה יתנו תוצאות גרועות או יכשלו לחלוטין בלי תרגום מקדים.

האם אפשר להשתמש בו ישירות באפליקציה מסחרית?

לא מומלץ כרגע. בהיעדר רישיון רשמי ומתועד, אין אישור חוקי להריץ אותו במוצר שמניב הכנסות, וצריך לחכות שהיוצרים יעדכנו את תנאי השימוש.

איך מריצים

כדי להריץ אותו מקומית דרך ספריית transformers תצטרכו להוריד קבצים במשקל כולל של 13.1 גיגה בייט. מבחינת חומרה, כרטיס גרפי עם 16 גיגה זיכרון וידאו הוא המינימום המעשי לטעינת המשקלים ב־bfloat16, אבל אם תרצו לייצר תמונות ברזולוציה מלאה ולנצל את חלון ההקשר של 4,096 טוקנים, עדיף להחזיק כרטיס עם 24 גיגה כמו RTX 3090 או כרטיס שרת.

המפתחים מפנים לקוד הדגימה במאגר הגיטהאב שלהם לצורך הפעלה. אם אין לכם גישה למעבד גרפי חזק וייעודי, אין פה פתרון מהיר של שרת מנוהל פשוט, ותצטרכו לבנות שרת עצמאי שיחזיק אותו פעיל.

from transformers import pipeline

pipe = pipeline("any-to-any", model="Alpha-VLLM/Lumina-mGPT-7B-768")
print(pipe("שלום"))

הרישיון

המפתחים לא ציינו רישיון בעמוד המודל. מבחינה משפטית, היעדר רישיון אומר שאין לכם הרשאה מפורשת להשתמש במשקלים, להפיץ אותם או לשלב אותם במוצר מסחרי. כל שימוש מעבר למחקר אישי כרוך בסיכון עד שהיוצרים יבהירו את התנאים בגיטהאב או בקובץ נפרד.

הרישיון המלא בעמוד המודל ↗