GPT
E

ERNIE-4.5-VL-424B-A47B-PT

קוד פתוח

baiduapache-2.02025-06-28

  • transformers
  • safetensors
  • ernie4_5_moe_vl
  • image-text-to-text
  • ERNIE4.5

מודל ענק לעיבוד משולב של תמונה וטקסט עם ארכיטקטורת מומחים. פתרון מתאים למי שרוצה חלון הקשר ענק ודיוק ראייתי מתקדם, ומוכן להחזיק תשתית שרתים כבדה במיוחד.

  • 424Bפרמטרים
  • 131,072טוקנים בהקשר
  • 789 GBמשקל הקבצים
  • 450הורדות בחודש

מה זה

מדובר במודל ראייה ושפה רב-מודאלי מבוסס תערובת מומחים (MoE), שמכיל 424 מיליארד פרמטרים בסך הכול, אך מפעיל רק 47 מיליארד פרמטרים בכל טוקן. המבנה שלו מפריד בין ניתוב של מומחי טקסט למומחי תמונה, עם 64 מומחים מכל סוג שמתוכם שמונה פעילים במקביל. ההפרדה הזו שומרת על יכולות השפה בלי שהלמידה הוויזואלית תפגע בהן, והיא מיועדת לייצר מענה מהיר יחסית לגודל כזה של רשת.

הוא עבר כוונון ייעודי למשימות שיחה, הבנת תמונות והסקה רב-מודאלית צעד אחר צעד (CoT), לצד חיזוק באמצעות תגמולים שניתנים לאימות (RLVR). המודל תומך בחלון הקשר עצום של 131,072 טוקנים ומאפשר עבודה בשני מצבים, מצב חשיבה מעמיק ומצב ישיר. סיומת ה־PT מציינת שמדובר במשקולות תואמות PyTorch ולא בסביבת PaddlePaddle הקניינית של באידו.

מתאים ל

  • ניתוח מסמכים חזותיים גדולים

    חלון הקשר של 131 אלף טוקנים מאפשר העלאת עשרות דפים סרוקים, תרשימים וטקסטים לניתוח מעמיק בסינית ובאנגלית.

  • הסקה רב-שלבית מתמונות

    כוונון המודל לחשיבה צעד אחר צעד ושימוש ב־RLVR מתאימים לפענוח בעיות מורכבות שמצריכות קישור בין פרטים גרפיים.

  • מחקר והתאמה לתעשייה

    קוד פתוח תחת רישיון חופשי מאפשר לחקור ארכיטקטורת MoE מופרדת מודאלית ולאמן שכבות נוספות באופן עצמאי.

איפה זה נופל

הכרטיס מצהיר על תמיכה באנגלית ובסינית בלבד. אין שום התייחסות לעברית, ולכן לא מומלץ להסתמך עליו בעיבוד טקסט בעברית או בזיהוי כיתוב עברי בתוך תמונות. בנוסף, מודלים רב-מודאליים שמחייבים הרצת קוד מרוחק ופרמטרים מותאמים אישית (trust-remote-code) דורשים זהירות באבטחת מידע לפני חיבור לסביבות ייצור סגורות.

שאלות
נפוצות

האם אפשר להריץ אותו על שרת GPU בודד?

לא. משקולות המודל שוקלות כמעט 800 גיגה-בייט לפני חישובי זיכרון הריצה, כך שגם גרסאות מכווצות דורשות מערך מרובה כרטיסים. התיעוד הרשמי מגדיר במפורש דרישה של 16 כרטיסי מסך בנפח 80 גיגה-בייט כל אחד.

מה ההבדל בין גרסת PT לגרסאות האחרות של הדגם?

גרסת PT מגיעה עם משקולות מותאמות ל־PyTorch ולתשתיות פתוחות כמו transformers ו־vLLM. גרסאות שמסומנות כ־Paddle נבנו לסביבת PaddlePaddle של באידו ופחות נוחות לעבודה במערכות הקוד הפתוח הנפוצות במערב.

האם המודל יבין שאלות או מסמכים בעברית?

האימון הרשמי הוגדר לאנגלית ולסינית בלבד. ייתכן שהוא יזהה מילים בודדות בזכות נתוני אינטרנט כלליים, אבל הוא לא מכויל לשפה וסביר שייכשל בעיבוד עברית, בניסוח תחבירי או בקריאת טקסט עברי מתוך תמונות.

איך מריצים

המשקולות לבדן תופסות 789 גיגה-בייט ומחולקות ל־187 קבצים בפורמט bfloat16. כדי להריץ את המודל הזה תצטרכו שרת עם לפחות 16 כרטיסי מסך של 80 גיגה-בייט כל אחד, כמו H100 או A100, תוך שימוש בספריית vLLM מגרסה 0.11.2 ומעלה והפעלת חלוקה מקבילית של 16.

אלא אם כן יש לכם חווה כזו שכבר עובדת ומחכה למשימות, אין שום היגיון כלכלי להרים את זה לבד. עבור רוב המפתחים והחברות, הפעלה מקומית תדרוש שרת ייעודי בעלויות חודשיות של אלפי עד עשרות אלפי דולרים, ועדיף להשתמש ב־API מנוהל אם הצורך הוא בדיקות או שילוב פשוט.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="baidu/ERNIE-4.5-VL-424B-A47B-PT")
print(pipe("שלום"))

הקבצים

187 קבצים במאגר, 789 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון Apache 2.0 רשמי. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להריץ אותו בשרתים פרטיים ולשלב אותו במוצרים מסחריים. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים של באידו והכללת עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗