GPT
C

command-a-plus-05-2026-w4a4

קוד פתוח

CohereLabsapache-2.02026-05-18

  • transformers
  • safetensors
  • cohere2_vision
  • image-text-to-text
  • conversational

גרסה מכווצת בארבעה ביטים של מודל ענק עם ראייה והפעלת כלים. היא נבנתה לחסוך חומרה יקרה בלי להקריב את איכות ההסקה.

  • 219Bפרמטרים
  • 200,000טוקנים בהקשר
  • 123 GBמשקל הקבצים
  • 5,083הורדות בחודש

מה זה

מדובר במודל מבוסס תערובת מומחים עם מאתיים ותשעה עשר מיליארד פרמטרים בסך הכול, כאשר עשרים וחמישה מיליארד פעילים בכל טוקן. המערך כולל מאה עשרים ושמונה מומחים, שמתוכם שמונה נבחרים פר טוקן לצד מומחה אחד משותף. הוא מקבל טקסט ותמונות, תומך בארבעים ושמונה שפות כולל עברית וערבית, ומגיע עם חלון קלט של מאה עשרים ושמונה אלף טוקנים ויכולת פליטה של שישים וארבעה אלף טוקנים.

הייחוד בגרסה הזו הוא שיטת הכיווץ. במקום לכווץ את כל הרשת ולשלם בירידת ביצועים, כיווצו בשיטת NVFP4 רק את שכבות המומחים, בזמן שמנגנון תשומת הלב נשאר ברמת דיוק מלאה. בנוסף ביצעו זיקוק מותאם כיווץ מול מודל המקור כדי לצמצם סטיות, מה שמאפשר לפי נתוני הבדיקה שלהם להציג איכות זהה כמעט לחלוטין לגרסאות הלא מכווצות.

מתאים ל

  • ניתוח מסמכים חזותיים

    קריאת טקסט וטבלאות מתמונות או סריקות מורכבות הודות לשילוב יכולות ראייה וטקסט.

  • סוכני אוטונומיה והפעלת כלים

    קריאה לפונקציות ושאילתות בסיסי נתונים בזכות תמיכה מובנית בחיבור כלים וציטוט מקורות.

  • הסקה רב לשונית מקומית

    ביצוע משימות מורכבות בארבעים ושמונה שפות ישירות על שרת ארגוני מאובטח.

איפה זה נופל

ארכיטקטורת הראייה שלו מחזירה טקסט בלבד ולא תמונות חדשות, מה שמגביל אותו למשימות ניתוח והבנה. הדחיסה אמנם מתוחכמת, אבל כרטיס המודל מודה בפה מלא שדחיסה בארבעה ביטים מייצרת שגיאות מצטברות בתהליכי חשיבה ארוכים. המודל מחייב תלויות קוד ספציפיות כמו cohere_melody ופרסרים ייעודיים לצורך הפעלת כלים וחילוץ ציטוטים, ולכן הטמעה בצנרת קיימת דורשת התאמה אישית ולא עובדת באופן עיוור.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך ביתי כמו RTX 4090?

לא. המודל שוקל מאה עשרים ושלושה ג'יגה בייט ודורש תמיכה בארכיטקטורת כיווץ מתקדמת. דרישת המינימום היא כרטיס B200 בודד או שני מאיצי H100, כך שחומרה ביתית אינה רלוונטית כאן.

איך המודל מתמודד עם תמיכה בעברית?

עברית היא אחת מארבעים ושמונה השפות שהמודל אומן עליהן במקור. עם זאת, תמיד מומלץ לבדוק את איכות ההסקה במשימות קונקרטיות מול נתונים שלכם לפני שמשלבים אותו בסביבת ייצור.

איך מריצים

כדי להריץ אותו עצמאית נדרש לפחות כרטיס B200 בודד או שרת עם שני כרטיסי H100. זה שיפור עצום לעומת גרסת הדיוק המלא שדורשת שמונה כרטיסי H100, אך מדובר עדיין בציוד enterprise יקר וכבד שלא קיים בתחנות עבודה מקומיות.

בצד התוכנה, הרצה עם vLLM מחייבת גרסה 0.25.0 ומעלה יחד עם הספרייה cohere_melody להפעלת מנגנון הדחיסה והפרסרים. מי שאין לו גישה ישירה לשרתי Blackwell או Hopper מתקדמים יגלה שעדיף לפנות ל־API בענן או להתנסות בסביבת ההדגמה ברשת במקום לנסות לדחוף את המשקלים למאיצים ישנים יותר.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="CohereLabs/command-a-plus-05-2026-w4a4")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון Apache 2.0 המלא. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להריץ אותו בשרתים פרטיים ולשלב אותו במוצרים סגורים בלי לשלם תמלוגים, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗