GPT
A

AM-Thinking-v1

קוד פתוח

a-m-teamapache-2.02025-05-10

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • conversational

מודל הסקת מסקנות דחוס בגודל 33 מיליארד פרמטרים, שנבנה על בסיס Qwen 2.5. הוא מיועד למי שרוצה ביצועי חשיבה ברמת מודלי ענק, בלי לתחזק קלאסטר של כמה כרטיסים.

  • 33Bפרמטרים
  • 131,072טוקנים בהקשר
  • 61.0 GBמשקל הקבצים
  • 126הורדות בחודש

מה זה

היוצרים לקחו את מודל הבסיס של Qwen 2.5 והעבירו אותו תהליך אימון ממוקד שכולל כוונון עדין ראשוני ושני שלבי למידת חיזוק. במבחני ביצועים של מתמטיקה ותכנות כמו AIME ו־LiveCodeBench, המודל עוקף מודלי ענק כמו DeepSeek-R1 ומתקרב למודלים של מעל 200 מיליארד פרמטרים, למרות שהוא קטן מהם משמעותית.

ההבדל המרכזי כאן הוא שמדובר בארכיטקטורה דחוסה ולא בתערובת מומחים. בזכות זה, זמן התגובה עקבי ואין תקורה של ניתוב בין מומחים שונים. הוא מתמקד בעיקר במשימות שדורשות תבנית של חשיבה לפני מתן התשובה, כמו פתרון בעיות לוגיות, כתיבת קוד מורכב ומענה פתוח.

מתאים ל

  • פתרון בעיות מתמטיקה ולוגיקה

    מציג תוצאות גבוהות במבחני AIME בזכות תהליך אימון ייעודי שמתמקד בצעדי חשיבה.

  • כתיבת אלגוריתמים מורכבים

    עוקף מודלים גדולים במבחן LiveCodeBench ומתאים להפקת קוד שדורש חישובים גיאומטריים או לוגיים.

  • שרתי הסקה בכרטיס בודד

    ארכיטקטורה דחוסה שנכנסת על כרטיס A100 של 80 גיגה-בייט ומספקת זמני תגובה צפויים.

איפה זה נופל

המודל לא אומן כלל על הפעלת כלים חיצוניים או קריאה לפונקציות, ולכן הוא לא מתאים לסוכנים אוטומטיים שצריכים להתממשק למערכות אחרות. היכולת שלו לעקוב אחרי הוראות מורכבות עדיין מוגבלת, והמפתחים מציינים במפורש שההתאמה הבטיחותית שלו נמצאת בשלב ראשוני בלבד ומחייבת בדיקות סיכונים נוספות לפני שחושפים אותו למשתמשי קצה.

שאלות
נפוצות

האם המודל תומך ב־Function Calling לפיתוח סוכנים?

לא. כרטיס המודל מבהיר שהוא לא עבר אימון על קריאות לפונקציות או שימוש בכלים. אם המערכת שלכם תלויה בפעולות על ממשקי API חיצוניים, המודל הזה לא יבצע אותן באופן אמין.

מה החומרה המינימלית הדרושה להרצה של הגרסה המלאה?

המודל שוקל 61 גיגה-בייט, ולכן נדרש כרטיס עם לפחות 80 גיגה-בייט זיכרון, כמו A100. למחשבים עם פחות זיכרון קיימות גרסאות GGUF מכווצות שמתאימות לכלים כמו Ollama.

איך מריצים

המשקל המלא של הקבצים מגיע ל־61 גיגה-בייט בדיוק של bfloat16, כך שתצטרכו כרטיס A100 של 80 גיגה-בייט כדי להריץ אותו כמו שהוא בלי חלוקה לכמה כרטיסים. היתרון הוא שזה נכנס על מאיץ גרפי בודד מהסוג הזה, מה שחוסך סרבול תשתיתי.

אם אין לכם חומרה כזאת בענן או מקומית, יש גרסאות מכווצות בפורמט GGUF שמיועדות לשימוש דרך Ollama ו־llama.cpp על חומרה צנועה יותר. שימו לב שהחוקרים ממליצים בחום להשתמש בפרומפט המערכת המובנה בטוקנייזר, בלעדיו איכות התשובות נפגעת משמעותית.

from transformers import pipeline

pipe = pipeline("text-generation", model="a-m-team/AM-Thinking-v1")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש במודל לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים, בתנאי ששומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗