GPT
A

AgentCPM-Report

קוד פתוח

openbmbapache-2.02026-01-19

  • transformers
  • safetensors
  • minicpm
  • feature-extraction
  • agent

סוכן מקומי שמייצר דוחות מחקר מעמיקים של עשרות אלפי מילים. פתרון ממוקד למי שדורש כתיבה עצמאית על מסמכים רגישים בלי להוציא גרם מידע לרשת.

  • 8.2Bפרמטרים
  • 65,536טוקנים בהקשר
  • 15.3 GBמשקל הקבצים
  • 294הורדות בחודש

מה זה

בבסיס יושב MiniCPM4.1 עם שמונה מיליארד פרמטרים, שעבר התאמה ממוקדת למשימה אחת בלבד: מחקר אוטונומי וכתיבת דוחות ארוכים. הרעיון המרכזי כאן נשען על מדיניות שמשלבת בין כתיבת טיוטה והרחבתה לבין עדכון דינמי של ראשי הפרקים, כשהסוכן מבצע בממוצע ארבעים סבבי אחזור מידע וכמאה שלבי חשיבה לוגיים לפני ובזמן הניסוח.

במבחני ביצועים מול מודלי ענן מסחריים כמו Gemini 2.5 Pro DeepResearch וסוכנים מבוססי Claude Sonnet 4, הוא מציג תוצאות מפתיעות. ב־DeepResearch Gym הוא עוקף את כולם עם ציון עומק ותובנה של 100, ובמדד DeepResearch Bench הכללי הוא מגיע ל־50.11, ציון גבוה מזה של OpenAI DeepResearch שעומד על 46.45.

מתאים ל

  • מחקר על דאטה פנימי סודי

    מייצר סקירות עומק מתוך מאגרי ידע פנימיים בארגון בלי לחשוף שום פיסת מידע לענן חיצוני.

  • סקירת ספרות אקדמית

    רץ על מאגרי מאמרים עצומים ב־Arxiv ומפיק סיכומים מובנים עם עשרות שלבי חשיבה ואחזור.

  • ניתוח מודיעין עסקי מקומי

    מעבד מאות דוחות שוק ומסמכים פיננסיים על תחנת עבודה מבודדת לטובת כתיבת ניירות עמדה.

איפה זה נופל

הנקודה החלשה ביותר שנחשפת במבחנים היא הקריאות, ציון של 44.17 בלבד ב־DeepResearch Bench לעומת 50 של המתחרים, מה שאומר שהטקסט שהוא פולט נוטה להיות צפוף וכבד. גם הציות להנחיות קיבל 48.87, נמוך מרוב מערכות הענן המובילות. מעבר לכך, במבחן DeepConsult הוא הפסיד ב־28.68 אחוז מהמקרים לעומת 7.6 בלבד אצל ג'מיני, כך שלא מדובר במחליף מלא לעבודה אסטרטגית שדורשת ליטוש אנושי.

אותה משפחה

AgentCPM-Report יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל דורש חיבור פעיל לאינטרנט כדי לתפקד?

לא. הוא תוכנן לעבודה מקומית מנותקת לחלוטין. הוא נשען על מסד נתונים פנימי שאתם מחברים אליו דרך UltraRAG ומבצע את כל עשרות שלבי השליפה והניסוח בתוך הרשת המקומית שלכם.

כמה זמן לוקח לו להפיק דוח מלא?

התהליך לא מיידי כמו צ'אט רגיל. בגלל שהוא מבצע בממוצע ארבעים סבבי שליפת מידע ומאה שלבי הסקת מסקנות כדי להפיק דוח של עשרות אלפי מילים, הריצה יכולה לקחת דקות ארוכות בהתאם לעוצמת המעבד או כרטיס המסך.

איך מריצים

במשקל של 15.3 גיגה בייט בפורמט bfloat16, כרטיס בודד של 24 גיגה זיכרון כמו RTX 3090 או 4090 יריץ אותו בקלות דרך vLLM. מי שמוגבל בחומרה יכול לפנות לגרסת GGUF ולהריץ אותה ישירות על המעבד באמצעות llama.cpp, מה שמאפשר עבודה גם בסביבות פיתוח אישיות ללא מאיצים ייעודיים.

היוצרים ארזו סביבת עבודה שלמה הכוללת את תשתית UltraRAG ומסד נתונים וקטורי מסוג Milvus בתוך קובץ docker-compose יחיד. אם אין לכם מאגר מסמכים פרטי של מאות אלפי קבצים שמחייב שמירה על סודיות, פנייה לשירותי ענן מוכנים תהיה מהירה ופשוטה בהרבה מתחזוקת סטאק ה־RAG הזה לבד.

from transformers import pipeline

pipe = pipeline("text-generation", model="openbmb/AgentCPM-Report")
print(pipe("שלום"))

הרישיון

הקוד והמשקולות משוחררים תחת רישיון apache-2.0. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להטמיע במוצר סגור ולהפיץ אותו חופשי, בתנאי ששומרים על הצהרת זכויות היוצרים והודעת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗