GPT
E

ERNIE-4.5-VL-28B-A3B-PT

קוד פתוח

baiduapache-2.02025-06-28

  • transformers
  • safetensors
  • ernie4_5_moe_vl
  • image-text-to-text
  • ERNIE4.5

זה מודל ראייה ושפה מבוסס תערובת מומחים שמפעיל 3 מיליארד פרמטרים מתוך 28 בכל פעולה. הוא מתאים למי שצריך ניתוח תמונה והסקה מורכבת בהקשר ארוך בלי לשלם עלויות חישוב מלאות.

  • 29Bפרמטרים
  • 131,072טוקנים בהקשר
  • 54.8 GBמשקל הקבצים
  • 28,690הורדות בחודש

מה זה

מדובר במודל רב מודלי של באידו שמקבל טקסט ותמונות ומחזיר טקסט. המבנה שלו מבוסס על תערובת מומחים עם חלוקה מבודדת בין מודליות: 64 מומחי טקסט ו־64 מומחי ראייה, לצד שני מומחים משותפים. בכל צעד חישוב פעילים רק שישה מומחים מכל סוג, מה ששומר על שלושה מיליארד פרמטרים פעילים בלבד בזמן ריצה ומאפשר ביצועים מהירים יחסית לגודלו הכולל.

הוא עבר אימון מתקדם הכולל כוונון עדין מונחה, אופטימיזציית העדפות, ולמידת חיזוק עם תגמול שניתן לאימות. המערכת יודעת לעבוד בשני מצבים, עם שרשרת חשיבה מפורטת או במענה ישיר ללא חשיבה, ומסוגלת לקלוט חלון הקשר עצום של 131,072 טוקנים כדי לעבד מסמכים ארוכים או רצפי תמונות מורכבים.

מתאים ל

  • ניתוח מסמכים מרובי עמודים

    חלון של 131,072 טוקנים מאפשר הזנת תמונות רבות של עמודי מסמך וקבלת מענה על סמך הטקסט והתרשימים.

  • הסקה חזותית מורכבת

    תמיכה מובנית בשרשרת חשיבה מאפשרת לפרק ניתוח של תמונות מורכבות לשלבים לוגיים לפני מתן הפלט.

  • שילוב מערכות בסינית ואנגלית

    המודל אומן ספציפית לשפות אלו ומתאים למוצרים הפועלים מול השוק הבינלאומי או הסיני.

איפה זה נופל

הכרטיס מצהיר על תמיכה באנגלית ובסינית בלבד, כך שעברית כלל לא נתמכת רשמית ואי אפשר להסתמך עליה בפיתוח מוצר. בנוסף, הדרישה לנעול את ספריית transformers לגרסאות ישנות יחסית עלולה לייצר התנגשויות תלויות עם ספריות מודרניות בסביבת העבודה שלכם. כרטיס המודל גם לא מציג ציוני מבחנים עצמאיים, ולכן אי אפשר לדעת מראש מה רמת הדיוק החזותית או איכות שרשרת החשיבה לפני שמבצעים בדיקות עצמאיות.

שאלות
נפוצות

מה ההבדל בין סיומת PT לסיומת Paddle של המודל?

הסיומת מסמנת את פורמט המשקלים. גרסת PT מכילה משקלים שתואמים לספריית transformers ולסביבת פייתורץ, בעוד שגרסת Paddle מיועדת לעבודה עם מסגרת הלמידה העמוקה PaddlePaddle של באידו.

האם אפשר להריץ את המודל ללא שלב החשיבה הארוך?

כן. לפי כרטיס המודל, מנגנון הראייה והשפה תומך הן במצב חשיבה מפורט והן במצב ללא חשיבה, בהתאם לדרישות המהירות והחישוב של המערכת שלכם.

איך מריצים

המשקלים בגרסת הפייתורץ תופסים 54.8 גיגה בייט ומחולקים ל־27 קבצים בדיוק bfloat16. כדי לטעון אותם לזיכרון כרטיס המסך צריך חומרה ייעודית עם זיכרון וידאו שעולה על נפח המשקלים, במיוחד אם רוצים לנצל את חלון ההקשר המלא של 131,072 טוקנים. אם אין לכם שרת עם כרטיסי שרת מתאימים, עדיף להשתמש בנקודת קצה מנוהלת.

ההרצה מתבצעת ישירות דרך ספריית transformers עם הגבלה לגרסה 4.57.6 ומטה, או בעזרת שרת vLLM מגרסה 0.11.2 ומעלה. בפקודת ההרצה של vLLM יש להפעיל את הדגל שמאשר הרצת קוד מרוחק כדי לטעון את הארכיטקטורה הייעודית של באידו.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="baidu/ERNIE-4.5-VL-28B-A3B-PT")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים זמינים תחת רישיון apache-2.0 המלא. מותר להשתמש בהם ליישומים מסחריים, לשנות את הקוד ולהפיץ אותו, כל עוד שומרים על הודעת זכויות היוצרים של באידו משנת 2025 ומצרפים עותק של תנאי הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗