GPT
A

AFM-4.5B

קוד פתוח

arcee-aiapache-2.02025-07-29

  • transformers
  • safetensors
  • arcee
  • text-generation
  • conversational

זהו מודל שיחה שמאומן על 8 טריליון טוקנים עם חלון הקשר של 65 אלף טוקנים. הוא נותן מענה חזק למשימות קוד ומתמטיקה במשקל קל יחסית שמתאים גם לשרת בודד.

  • 4.6Bפרמטרים
  • 65,536טוקנים בהקשר
  • 8.6 GBמשקל הקבצים
  • 11,314הורדות בחודש

מה זה

מדובר במודל הוראות בגודל 4.6 מיליארד פרמטרים, שעבר אימון קפדני שכלל שלב מקדים של 6.5 טריליון טוקנים, ועוד 1.5 טריליון טוקנים שהוקדשו במיוחד לקוד ולחשיבה מתמטית. בשלב הכוונון השתמשו בלמידת חיזוק על סמך תגמולים שניתנים לאימות, לצד העדפות אנושיות, כדי לייצב את התשובות.

השוני המרכזי מול מודלים אחרים בקטגוריית המשקל הזו טמון בארכיטקטורה. במקום להשתמש בפונקציית השפעול הנפוצה SwiGLU, שילבו כאן ReLU בריבוע כדי לאפשר דלילות בחישובים, יחד עם Grouped Query Attention שמאיץ את תהליך ההסקה. התוצאה היא כלי קל יחסית שמכוון להחזיק משימות חשיבה מורכבות בלי לצרוך משאבים של מודל ענק.

מתאים ל

  • הסקה מקומית על כרטיס יחיד

    משקל של 8.6 גיגה בייט מאפשר פריסה מהירה על שרת זול בלי צורך במערך כרטיסי מסך יקר.

  • עיבוד מסמכים בינוניים

    חלון של 65,536 טוקנים נותן מספיק מרחב לניתוח טקסטים ארוכים וקוד בלי לקטוע את הקלט.

  • פתרון בעיות קוד ומדע

    אימון ייעודי של 1.5 טריליון טוקנים על מתמטיקה ותכנות נותן לו יתרון במשימות חישוב.

איפה זה נופל

הכרטיס מציג ציוני בדיקות פנימיים ומציין במפורש שתוצאות של מודלים מתחרים כמו Qwen3 ו־SmolLM נטו להשתנות בחדות בין סביבות בדיקה שונות. מעבר לזה, רשימת השפות הנתמכות כוללת שפות אירופיות וערבית, אך עברית כלל אינה מופיעה בה, ולכן יש לצפות לקשיים ממשיים בעיבוד ופליטה של טקסט מקומי.

שאלות
נפוצות

האם המודל יודע לעבוד בעברית בצורה שוטפת?

השפות שצוינו במפרט כוללות אנגלית, ערבית, ספרדית, צרפתית, גרמנית, איטלקית, פורטוגזית ורוסית. עברית לא נכללת ברשימת השפות הרשמית. סביר להניח שהביצועים בעברית יהיו נמוכים או משובשים.

איזה ערכי הרצה מומלצים למודל בשימוש שוטף?

היוצרים ממליצים להשתמש בטמפרטורה נמוכה של 0.5 לקבלת תשובות עקביות. בנוסף נקבעו ערכי top_k של 50, top_p של 0.95, וקנס חזרתיות של 1.1 כדי למנוע לולאות טקסט.

איך מריצים

המשקל של הקבצים בגרסת ברירת המחדל עומד על 8.6 גיגה בייט בדיוק של bfloat16, כך שכרטיס מסך בודד של 16 גיגה זיכרון יספיק כדי להרים אותו בבית או בשרת ענן קטן. אפשר להריץ אותו מקומית עם ספריית transformers או לפרוס שרת ייעודי באמצעות vLLM מגרסה 0.10.1 ומעלה.

קיימות גרסאות מכווצות של GGUF עבור llama.cpp וגרסה עבור Intel OpenVINO, שמתאימות למי שרוצה לדחוף אותו למחשבים אישיים או למעבדים רגילים. אם אתם לא רוצים להתעסק עם חומרה וניהול שרתים, אפשר לצרוך אותו ישירות דרך ה־API של Together.

from transformers import pipeline

pipe = pipeline("text-generation", model="arcee-ai/AFM-4.5B")
print(pipe("שלום"))

הרישיון

הקוד והמשקולות מופצים תחת רישיון Apache 2.0. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים סגורים ולהפיץ אותו הלאה, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗