GPT
E

ERNIE-4.5-VL-28B-A3B-Thinking

קוד פתוח

baiduapache-2.02025-11-07

  • transformers
  • safetensors
  • ernie4_5_moe_vl
  • image-text-to-text
  • ERNIE4.5

מודל ראייה ושפה בתצורת תערובת מומחים עם חשיבה מובנית וחלון הקשר ענק. הוא מאקטב רק 3 מיליארד פרמטרים בכל שלב, מה שנותן מענה ויזואלי מורכב בלי לשרוף שרתים שלמים.

  • 30Bפרמטרים
  • 131,072טוקנים בהקשר
  • 55.3 GBמשקל הקבצים
  • 1,193הורדות בחודש

מה זה

ביידו מציגה כאן ארכיטקטורת תערובת מומחים שכוללת קרוב ל־30 מיליארד פרמטרים בסך הכל, אך בזמן ריצה פעילים כ־3 מיליארד פרמטרים בלבד. המודל מיועד לעיבוד תמונה, וידאו וטקסט, וכולל מנגנון חשיבה מובנה לצד תמיכה בהפעלת כלים חיצוניים כמו חיפוש תמונות ותקריב לפרטים קטנים. חלון ההקשר מגיע ל־131,072 טוקנים, מה שמתאים לניתוח סרטונים ארוכים ומסמכים מרובי עמודים.

הייחוד לעומת מודלים צפופים בגודל דומה נמצא ביחס שבין כוח החישוב הדרוש לביצועים. המודל אומן בחיזוק למידה על משימות הניתנות לאימות, ומכוון לפתרון בעיות מדעיות מורכבות מתמונות, קריאת תרשימים, איתור עצמים במרחב הוויזואלי וזיהוי שינויים לאורך ציר זמן בווידאו.

מתאים ל

  • ניתוח וידאו ואירועים

    זיהוי שינויים בציר הזמן ואיתור אירועים ברצף פריימים ארוך תודות לתמיכה בווידאו וחלון הקשר נרחב.

  • פתרון בעיות ותרשימים

    הסבר גרפים, חישובי מדעים מתמונות ופיענוח נתונים הנדסיים הדורשים חשיבה מרובת שלבים.

  • סוכנים מבוססי ראייה

    הפעלת כלים וזיהוי מיקום אלמנטים בתמונה לפיתוח תהליכים אוטומטיים מונחי ממשק משתמש.

איפה זה נופל

השפות הנתמכות רשמית הן אנגלית וסינית בלבד, כך שעבור טקסטים בעברית או ניתוח תמונות עם כיתוב מקומי הוא עלול לזייף קשות או להיכשל לחלוטין. בנוסף, חבילת הקוד דורשת הרצת קוד צד שלישי לא בדוק דרך transformers או הגדרות מיוחדות ב־vLLM כולל טלאי תוכנה ספציפיים לתמיכה בווידאו, מה שמסבך את הטמעתו בסביבות ייצור סגורות או מאובטחות.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב מקומי עם כרטיס מסך ביתי?

לא. משקל הקבצים עומד על 55.3 גיגה־בייט והרצה ללא שגיאות זיכרון דורשת לפחות 48 גיגה־בייט של זיכרון גרפי בקוונטיזציה, או כרטיס של 80 גיגה־בייט להרצה נקייה. כרטיסי מסך ביתיים פשוט לא יחזיקו את המשקל שלו בזיכרון.

איך המודל מחזיר את שלבי החשיבה וקריאות הכלים?

בזמן שימוש במנועי הסקה כמו vLLM צריך להגדיר מנתחי פלט ייעודיים בשם ernie45. הגדרות אלו מפרידות את שלבי ההסקה הלוגית מתשובת הטקסט הרגילה ומאפשרות קריאה אוטומטית לפונקציות חיצוניות.

איך מריצים

כדי להריץ אותו עצמאית תצטרכו שרת עם כרטיס גרפי חזק מאוד. הרצה מלאה ב־vLLM דורשת כרטיס יחיד של 80 גיגה־בייט זיכרון וידאו, תוך שימוש בדגל trust remote code. אם משתמשים בכלי FastDeploy של החברה ומפעילים קוונטיזציה של שמונה ביט, הדרישה יורדת לכרטיס עם 48 גיגה־בייט לפחות.

המודל דורש גרסאות תוכנה תואמות, כמו transformers שאינה עולה על 4.57.6, ומנתחי פלט ייעודיים לצורך חילוץ שרשרת החשיבה וקריאות הכלים. מי שאין לו גישה לתשתיות כאלה בענן או בחומרה מקומית, ימצא שהתעסקות עם המשקל הכבד של 55.3 גיגה־בייט פשוט לא משתלמת מול שירותי ענן מוכנים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="baidu/ERNIE-4.5-VL-28B-A3B-Thinking")
print(pipe("שלום"))

הקבצים

43 קבצים במאגר, 55.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ ברישיון Apache 2.0 המאפשר שימוש מסחרי מלא, שינוי קוד והפצה מחדש. אין כאן הגבלות שימוש של שירותי צד שלישי או חובת תשלום תמלוגים, כל עוד שומרים על הודעות זכויות היוצרים של באידו מתוך הקבצים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗