GPT
A

Apriel-1.5-15b-Thinker

קוד פתוח

ServiceNow-AImit2025-09-24

  • transformers
  • safetensors
  • llava
  • image-text-to-text
  • conversational

מודל מולטימודלי קומפקטי שמביא חשיבה מעמיקה לתמונות וטקסט. הוא מיועד למי שמחפש ביצועים חזקים על כרטיס גרפי בודד בלי להחזיק מודלי ענק.

  • 15Bפרמטרים
  • 262,400טוקנים בהקשר
  • 27.7 GBמשקל הקבצים
  • 2,972הורדות בחודש

מה זה

המודל מגיע עם 15 מיליארד פרמטרים ומבוסס על ארכיטקטורת LlavaForConditionalGeneration, עם חלון הקשר של 262,400 טוקנים. הוא פותח כדי להתמודד עם משימות משולבות של תמונה וטקסט, תוך דגש על פתרון בעיות בשלבים. המפתחים אימנו אותו באימון מקדים רציף על טקסט ותמונות, אבל שלב הכוונון העדין כלל שני מיליון דוגמאות טקסט בלבד, בלי כוונון ייעודי לתמונות ובלי למידת חיזוק.

במדד של Artificial Analysis הוא קיבל ציון 52, תוצאה שמתחרה ישירות במודלים כמו Gemini-Flash וגרסאות DeepSeek R1, למרות שהוא קטן מהם פי עשרה לפחות. במבחני ארגונים הוא השיג 68 בטלקום של Tau2 Bench וציון 62 ב־IFBench. המשמעות בפועל היא יכולת חזקה מאוד במעקב אחרי הוראות מורכבות, קריאות ל־API והסבר של תרשימים, יחסית למשקל שלו.

מתאים ל

  • ניתוח תרשימים וקוד

    פירוק שאלות טכניות מורכבות המשלבות תמונת דיאגרמה והסבר קוד, בזכות שילוב יכולות הראייה וההסקה.

  • סוכנים אוטונומיים

    ביצוע משימות הדורשות קריאה לכלים ול־API עם מעקב מדויק אחרי רצף הוראות ארגוניות.

  • שרת מקומי בארגון

    עיבוד מסמכים ותמונות מאובטחים על חומרה מקומית קטנה בלי להוציא מידע רגיש לשירותי ענן.

איפה זה נופל

המודל נוטה לייצר חשיבה ארוכה וצריכת טוקנים מוגברת גם כשנשאלת שאלה פשוטה, מה שמאט את התגובה שלו. בנוסף, הוא אומן בעיקר באנגלית והביצועים שלו יורדים בשפות אחרות. הכרטיס מבהיר שהוא עלול להמציא עובדות ולא מתאים ליישומים קריטיים של רפואה, משפט או פיננסים ללא בדיקה אנושית.

שאלות
נפוצות

האם המודל תומך בעברית ברמה טובה?

הוא מתמקד בעיקר באנגלית. מפתחי המודל מזהירים במפורש שהאיכות יורדת בשפות עם ייצוג נמוך בנתוני האימון, ולכן לא מומלץ להסתמך עליו לעיבוד שפה טבעית בעברית מורכבת.

למה המודל מחזיר תשובות לאט?

הארכיטקטורה שלו מתוכננת לבצע צעדי חשיבה מפורטים לפני הפלט הסופי. זה משפר את הדיוק בלוגיקה, אבל גורם לו לייצר כמות טוקנים גדולה יותר שמאריכה את זמן ההמתנה.

איך מריצים

המשקל הכולל עומד על 27.7 גיגה בייט בפורמט bfloat16, כך שהוא נכנס במלואו לכרטיס מסך בודד של 32 או 40 גיגה בייט כמו A100. אם תרצו לנצל את מלוא חלון ההקשר שלו או לעבוד בעומס משתמשים, תצטרכו כבר מערך של כמה כרטיסים או קוונטיזציה.

בשלב זה הקוד של vLLM עדיין דורש תמונה מותאמת אישית של דוקר כדי להפעיל את מפענחי הכלים והחשיבה. אפשר להריץ אותו גם ישירות בספריית transformers עם טמפרטורה מומלצת של 0.6. אם אתם צריכים זמני תגובה קצרים במיוחד למשימות פשוטות, עדיף להשתמש ב־API מסחרי, כי המודל הזה מפעיל תהליך חשיבה ממושך כברירת מחדל.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="ServiceNow-AI/Apriel-1.5-15b-Thinker")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, מה שאומר חופש מלא. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להריץ אותו בשרתים פרטיים ולהפיץ אותו בתוך מוצר, בלי תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים המקורית והסרת אחריות מהיוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗