GPT
C

command-a-plus-05-2026-fp8

קוד פתוח

CohereLabsapache-2.02026-05-18

  • transformers
  • safetensors
  • cohere2_vision
  • image-text-to-text
  • conversational

מודל ענק בקוד פתוח שמשלב ראייה ממוחשבת, הסקת מסקנות והפעלת כלים חיצוניים. הוא מפעיל רק 25 מיליארד פרמטרים מתוך 218 מיליארד בכל צעד, ומאפשר ריצה יעילה יותר לחברות.

  • 219Bפרמטרים
  • 200,000טוקנים בהקשר
  • 210 GBמשקל הקבצים
  • 1,686הורדות בחודש

מה זה

מדובר בארכיטקטורת Mixture of Experts שמחזיקה בסך הכל 218 מיליארד פרמטרים על פני 128 מומחים שונים, אבל רק שמונה מהם פלוס מומחה משותף קבוע פעילים בכל טוקן נתון. המבנה הזה נותן את העומק והאיכות של מודל ענק בלי לדרוש את כוח החישוב המלא בכל צעד ייצור. הוא יודע לקבל קלט משולב של תמונות וטקסט, לתכנן צעדים בתוך תגיות חשיבה ייעודיות, ולהחזיר פלט טקסטואלי שמצטט מקורות ספציפיים מתוך תשובות של כלים חיצוניים.

בניגוד למודלים רבים בגודל כזה שמתמקדים רק באנגלית, הוא אומן על 48 שפות שונות, כולל עברית וערבית. הוא מתוכנן מראש לפעולות סוכן שמחייבות חיבור למסדי נתונים וקריאות לשרתי API חיצוניים באמצעות תבניות שיחה מובנות של סכמת JSON.

מתאים ל

  • סוכן ארגוני להפעלת API

    הוא כולל תמיכה מובנית בתגיות חשיבה, יצירת קריאות לפונקציות בפורמט JSON ושילוב התוצאות.

  • ניתוח מסמכים ותמונות

    הארכיטקטורה מקבלת קלט משולב של תמונות ומלל ויודעת לספק תשובות מבוססות ציטוטים מדויקים.

  • מערכות שירות מרובות שפות

    הוא אומן על 48 שפות שונות ומאפשר לבנות מערכות שפונות למשתמשים בעברית, ערבית ושפות נוספות.

איפה זה נופל

ההורדה עצומה ומורכבת מ־59 קבצים שדורשים רוחב פס ושטח אחסון מהיר רק כדי להתחיל. יש פער מסוים בין נתוני המטאדאטה של העמוד שמציגים הקשר של 200,000 טוקנים לבין הפירוט בכרטיס המודל שמגדיר תמיכה ב־128 אלף קלט ו־64 אלף פלט, כך שצריך לבדוק בפועל את יציבות ההקשר הארוך. נוסף על כך, פריסת השרת דורשת תלויות תוכנה ספציפיות מאוד כמו ספריות ייעודיות לפענוח הכלים, והכרטיס אינו מספק ציוני מבחנים רשמיים כדי לדעת איפה הוא נכשל יחסית למתחרים.

אותה משפחה

command-a-plus-05-2026 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

כמה כרטיסי מסך חייבים כדי להרים את גרסת ה־FP8 הזו במחשב מקומי?

תצטרכו לפחות ארבעה מעבדי H100 או שני מאיצי B200 כדי לטעון את 210 הגיגה של המשקולות ולהריץ הסקה. מחשב עם כרטיס בודד או שרתים סטנדרטיים של 24 גיגה לא יוכלו להפעיל את הגרסה הזו כלל.

האם המודל מבין ומייצר טקסט בעברית?

כן, עברית מופיעה במפורש ברשימת 48 השפות שעליהן המודל אומן לפי כרטיס היצרן. עדיין כדאי לבדוק את איכות ההסקה בעברית בממשק הניסיון לפני פריסה רחבה.

מה ההבדל בין גרסת FP8 לגרסת W4A4 של המודל הזה?

גרסת FP8 דורשת ארבעה כרטיסי H100 בעוד גרסת W4A4 מכווצת ל־4 ביט ודורשת רק שני כרטיסים כאלה. היוצרים של המודל אף ממליצים על W4A4 לרוב השימושים בזכות מהירות עבודה עדיפה ודרישות חומרה נמוכות יותר.

איך מריצים

כדי להרים את גרסת ה־FP8 הזו תצטרכו לפחות ארבעה כרטיסי H100 של 80 גיגה או שני כרטיסי B200, כי קובצי המשקולות לבדם תופסים 210 גיגה זיכרון לפני חישובי ההקשר. הריצה המקומית בשרת דורשת שימוש בגרסאות קוד עדכניות של transformers ישירות מהמאגר, או שרת vLLM מגרסה 0.21.0 ומעלה יחד עם הספרייה cohere_melody לפענוח קריאות הכלים.

אם אין לכם קלאסטר כזה בענן או בארגון, המפתחים עצמם מציינים שגרסת W4A4 מומלצת לרוב השימושים ומסתפקת במחצית מהחומרה הזו. עבור רוב הצוותים שאין להם צורך מוחלט בפרטיות נתונים על שרתים פנימיים, גישה דרך ה־API או ממשקי הניסיון בענן תהיה זולה ופשוטה משמעותית מתחזוקת תשתית של ארבעה מאיצי Hopper.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="CohereLabs/command-a-plus-05-2026-fp8")
print(pipe("שלום"))

הקבצים

59 קבצים במאגר, 210 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, לשנות את הקוד, לשלב אותו במוצרים פנימיים או למכור שירותים שמבוססים עליו, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗