GPT
P

Pixtral-12B-2409

קוד פתוח

mistralaiapache-2.02024-09-11

  • vllm
  • mistral-common
  • en
  • fr
  • de

מודל מולטימודלי של 12 מיליארד פרמטרים עם מפענח תמונה ייעודי. הוא נותן מענה חזק לניתוח תמונות לצד טקסט ברישיון קוד פתוח מלא.

  • 23.6 GBמשקל הקבצים
  • 7,401הורדות בחודש
  • 696לייקים

מה זה

הארכיטקטורה משלבת מפענח טקסט של 12 מיליארד פרמטרים עם אנקודר תמונה של 400 מיליון פרמטרים שתומך ברזולוציות משתנות. הוא אומן ישירות על שילוב של טקסט ותמונות, עם חלון הקשר של 128 אלף טוקנים שמאפשר להזין מסמכים ארוכים או מספר תמונות ברצף באותה שיחה.

במבחני ביצועים מול מודלים בגודל דומה הוא מוביל בבירור בניתוח גרפים עם תוצאה של 81.8 במדד ChartQA לעומת מתחרים שנשארים רחוק מאחור, ומציג 72.0 במבחן הקוד HumanEval. עם זאת, במבחן DocVQA להבנת מסמכים סרוקים הוא קיבל 90.7, שזה מעט מתחת ל־Qwen2 7B שעומד על 94.5.

מתאים ל

  • ניתוח גרפים ותרשימים

    התוצאה במבחן ChartQA עומדת על 81.8, מה שמבטיח דיוק גבוה בחילוץ נתונים ויזואליים.

  • קריאת מסמכים מרובי עמודים

    חלון הקשר של 128k מאפשר לטעון מספר עמודים כרצף תמונות בשיחה אחת.

  • סיווג תמונות טכניות וקוד

    שילוב יכולת הקוד הגבוהה יחד עם ראייה ממוחשבת מתאים לניתוח צילומי מסך של שגיאות תוכנה.

איפה זה נופל

המודל מגיע ללא שום מנגנון סינון תוכן מובנה, עובדה שהיוצרים מציינים במפורש. הוא עלול לפלוט תוכן פוגעני או לא מבוקר בלי התרעה מוקדמת, מה שמחייב שכבת בדיקה חיצונית לפני חשיפה ללקוחות קצה.

בנוסף, רשימת השפות הרשמית כוללת שמונה שפות עיקריות בלבד, ללא תמיכה מוצהרת בעברית, כך שיכולות פענוח הטקסט בתמונות בעברית עשויות להיות חלשות.

שאלות
נפוצות

האם המודל מתאים לשימוש מסחרי באפליקציה?

כן, רישיון Apache 2.0 מאפשר שילוב מלא במוצרים מסחריים ללא תשלום. רק קחו בחשבון שאין מנגנון ניטור תוכן, ותצטרכו לבנות שכבת הגנה משלכם.

האם אפשר להריץ אותו על מחשב נייד רגיל?

לא, קובצי המודל שוקלים 23.6 גיגה־בייט ודורשים כרטיס מסך מקצועי עם זיכרון וידאו גדול. מחשב נייד סטנדרטי יקרוס מחוסר זיכרון.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־23.6 גיגה־בייט בפורמט safetensors. כדי לטעון אותו בזיכרון מלא תצטרכו כרטיס מסך עם לפחות 32 גיגה־בייט זיכרון וידאו, או לעבוד עם כרטיס כמו A100 או זוג כרטיסי 24 גיגה־בייט כשמשלבים קוונטיזציה.

ההרצה מתבצעת בעיקר דרך ספריית vLLM שכוללת תמיכה מובנית בשרת תואם OpenAI, או בעזרת ספריית mistral-inference לבדיקות מהירות במחשב מקומי. אם אין לכם גישה לשרת ייעודי עם חומרה כבדה, עדיף להשתמש ב־API מנוהל כדי לא לשלם על שרת שיושב ללא שימוש.

pip install -U huggingface_hub
hf download mistralai/Pixtral-12B-2409

הקבצים

5 קבצים במאגר, 23.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0 מלא. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצר סגור, בלי לשלם תמלוגים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗