GPT
J

Janus-Pro-1B

קוד פתוח

deepseek-aimit2025-01-26

  • transformers
  • pytorch
  • multi_modality
  • muiltimodal
  • text-to-image

זה מודל משולב קטן במיוחד שמנתח תמונות וגם מייצר תמונות חדשות באותה ארכיטקטורה. הוא מתאים למי שרוצה יכולות מולטימודל מגוונות בלי להחזיק שרת יקר או כמה מודלים נפרדים.

  • 3.9 GBמשקל הקבצים
  • 11,908הורדות בחודש
  • 485לייקים

מה זה

המודל מבוסס על DeepSeek-LLM-1.5b-base ומשלב הבנת תמונה עם יצירת תמונה ברשת אחת. כדי לפתור את ההתנגשות הרגילה בין שתי המשימות, הוא מפריד את הקידוד החזותי לשני נתיבים שונים. להבנה וניתוח הוא משתמש ב־SigLIP שתומך בתמונות של 384 על 384, וליצירה הוא משתמש בטוקנייזר של LlamaGen.

רוב המודלים בגודל הזה יודעים לעשות רק דבר אחד, או לכתוב טקסט על תמונה או לייצר תמונה מטקסט. כאן מקבלים כלי קל משקל של 3.9 גיגה בייט שמבצע את שתי הפעולות ישירות דרך ספריית transformers, בלי לפצל את התשתית למערכות שונות.

מתאים ל

  • ניתוח תמונות במכשיר קצה

    הוא שוקל 3.9 גיגה בייט בלבד ומסוגל לתאר תמונות ישירות על חומרה מקומית וצנועה ללא חיבור לענן.

  • ייצור תמונות פשוטות מקומית

    הוא מייצר תמונות ישירות מתוך מודל שפה קטן, בלי להרים תשתית מורכבת של מודל דיפוזיה נפרד.

  • בוט משולב לניסויים

    הארכיטקטורה מאפשרת לקבל תמונה ולהחזיר תמונה או טקסט באותה מערכת, מעולה לאבות טיפוס מהירים.

איפה זה נופל

קלט התמונה להבנה מוגבל לרזולוציה של 384 על 384 פיקסלים בלבד, מה שמקשה על זיהוי פרטים עדינים או טקסט זעיר במסמכים. ביצירת תמונות, הטוקנייזר עובד עם דחיסה של פי 16, כך שהפלט מוגבל באיכותו לעומת מודלי דיפוזיה ייעודיים. בנוסף, בסיס השפה קטן יחסית, ולכן הוא נוטה לטעויות בהבנת הנחיות מורכבות.

אותה משפחה

Janus-Pro יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב נייד בלי כרטיס מסך ייעודי?

כן, המודל שוקל 3.9 גיגה בייט בלבד ודורש מעט זיכרון עבודה. הוא יכול לעבוד על מעבד רגיל, אם כי יצירת תמונות תהיה איטית משמעותית ביחס לכרטיס מסך.

האם הוא יכול להחליף מודלים כמו Stable Diffusion ליצירת גרפיקה?

לא. מנגנון היצירה מבוסס על טוקנייזר מכווץ בתוך מודל שפה קטן של 1.5 מיליארד פרמטרים. התוצאות מתאימות לבדיקות ולאיורים פשוטים, לא לעיצוב גרפי מקצועי.

איך מריצים

בגלל גודל קבצים של 3.9 גיגה בייט ודיוק bfloat16, המודל רץ בקלות על כרטיס מסך בודד עם 6 או 8 גיגה בייט זיכרון, ואפילו על מחשבים אישיים עם מעבדים מודרניים. ההרצה נעשית ישירות דרך transformers והקוד בגיטהאב של הפרויקט.

קיימת לפרויקט גם גרסה גדולה יותר המבוססת על 7 מיליארד פרמטרים. אם אתם צריכים רק בדיקות מקומיות, אבטיפוס או עבודה בלי תלות ברשת, הגרסה הזו מושלמת להרצה עצמית. אם תצטרכו איכות הפקה גבוהה בעומס כבד, עדיף לבדוק פתרונות גדולים יותר או שירות ענן.

from transformers import pipeline

pipe = pipeline("any-to-any", model="deepseek-ai/Janus-Pro-1B")
print(pipe("שלום"))

הרישיון

הקוד פתוח תחת רישיון MIT שמאפשר שימוש מסחרי, שינוי והפצה כמעט ללא הגבלות. עם זאת, משקלי המודל עצמם כפופים לרישיון הדגמים של DeepSeek, ולכן חובה לבדוק את התנאים הספציפיים שלו לפני שמשלבים את המודל במוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗