חבילת הערכת LLM בעברית
כלי שמריץ מבחני השוואה סטנדרטיים בין מודלי שפה שונים כדי לבדוק מי מהם הכי טוב בעברית - הבנה, ניתוח רגשות, תרגום וידע ישראלי - ומחזיר דוח תוצאות ברור וקל להשוואה.
עובד עם
הכלי הזה נבנה כדי לענות על שאלה שכל מי שמפתח מוצר בעברית נתקל בה במוקדם או במאוחר: איזה מודל שפה באמת מתפקד הכי טוב כשמדובר בעברית? הוא מריץ סט של מבחנים סטנדרטיים שבודקים הבנת טקסט, זיהוי סנטימנט, יכולות תרגום, השלמת משפטים בסטייל וינוגרד, סיכום טקסט, ניקוד וידע כללי על ישראל - ומריץ אותם על מגוון מודלים כמו Claude, GPT, Gemini, AI21 Jamba, DictaLM, Llama ומודלים מקומיים מ-HuggingFace.
הכלי מתאים בעיקר לצוותי פיתוח ומוצר שצריכים להחליט איזה מודל שפה להטמיע במוצר עברי, לאנשי רכש שצריכים תשובות מבוססות נתונים לגבי ביצועים בעברית, ולמי שמכוונן מודל עברי בעצמו ורוצה לבדוק אם השינויים שביצע שיפרו את התוצאות או פגעו בהן.
לדוגמה, אם אתם בונים צ'אטבוט שירות לקוחות בעברית ולא בטוחים אם להשתמש ב-GPT או ב-Claude, אפשר להריץ את הכלי ולקבל כרטיס תוצאות מסודר ב-JSON או ב-Markdown שמשווה ביניהם על כל המדדים הרלוונטיים - ואז לבחור לפי נתונים ולא לפי ניחוש.
איך להשתמש בסקיל הזה
- 1.הורידו וחילצו את קובץ ה-ZIP.
- 2.העתיקו את התיקייה המחולצת לתוך .claude/skills/ בפרויקט (או ~/.claude/skills/ להתקנה גלובלית).
- 3.התחילו סשן חדש - Claude Code יזהה את הסקיל אוטומטית לפי הנושא.
פרומפטים לדוגמה
השוואת מודלים לפני בחירה
הרץ השוואה בין Claude, GPT ו-Gemini על משימות הבנת עברית וסנטימנט והצג לי טבלת תוצאות
בדיקת מודל עברי מכוונן
בדוק את המודל המכוונן שלי על מבחני DictaLM כמו ניקוד וסיכום טקסט בעברית
מעקב רגרסיה אחרי עדכון
השווה את ביצועי הגרסה החדשה של המודל שלנו בעברית לגרסה הקודמת ותן לי דוח שינויים
שאלות נפוצות
אילו מודלים אפשר לבדוק עם הכלי?
אפשר להריץ הערכות על Claude, GPT, Gemini, AI21 Jamba, DictaLM, Llama וגם על מודלים מקומיים מ-HuggingFace, כדי להשוות ביניהם על אותם מבחנים.
איזה סוג פלט מתקבל בסוף הבדיקה?
הכלי מפיק כרטיס תוצאות בפורמט JSON או Markdown שמראה בצורה ברורה איך כל מודל ביצע בכל אחת מהמשימות, כך שקל להשוות בין האפשרויות.
האם הכלי מתאים לבדיקת ערבית, זיהוי דיבור או מבחני אנגלית?
לא, הכלי מיועד ספציפית להערכת ביצועים בעברית ולא נועד לשימוש עבור ערבית, זיהוי דיבור (ASR) או בנצ'מרקים כלליים באנגלית.
מוכנים להתקין את חבילת הערכת LLM בעברית?
סקילס נוספים בכלי פיתוח
מנהל משלוחים ישראלי
כלי שמחבר את חנות האונליין שלכם לחברות המשלוחים הישראליות המובילות - דואר ישראל, צ'יטה, HFD, מהיר לי, UPS ישראל ו-GetPackage - ומייצר עבורכם תוויות משלוח, מעקב ואפשרויות איסוף מלוקרים בלחיצת כפתור.
docx
סקיל רשמי של Anthropic שמלמד את Claude ליצור, לקרוא, לערוך ולנתח קבצי Word (.docx/.dotx) - כולל טבלאות, עימוד, מעקב שינויים והערות - באמצעות כלים כמו docx (npm), pandoc ו-LibreOffice.
SDK של Base44
Base44 SDK היא ספריית התכנות שדרכה האפליקציה שלכם מדברת עם מערכות Base44 - נתונים, פונקציות שרת וסוכני AI. זהו הבסיס הטכני שכל פיצ'ר בפרויקט נשען עליו.
claude-api
סקיל ייחוס טכני של Anthropic שמנחה את Claude עצמו כיצד לכתוב קוד תקין מול Claude API / Anthropic SDK - בחירת מודל, תמחור, streaming, tool use ופרטים ספציפיים לכל שפת תכנות.

