
JEV של TypeSafe AI פותח קטגוריה חדשה: מודל System One שמחזיר החלטות מוקלדות עם הסתברויות וביטחון מכויל, בעשירית שנייה ובשבריר מהעלות של LLM. מה זה אומר על עצי החלטות, ניתוב, ציון לידים ושומרי סף, ובמה הארכיטקטורה שונה ממודל שפה רגיל.
רוב מערכות ה-AI שאני בונה ללקוחות לא צריכות שהמודל ידבר. הן צריכות שהוא יחליט. לאיזה צוות לנתב את הפנייה, האם הליד הזה שווה טלפון היום, האם התשובה שהבוט עומד לשלוח בטוחה מספיק כדי לצאת בלי בן אדם באמצע. ובכל זאת, בכל הצמתים האלה יושב היום LLM שמייצר טקסט, ואנחנו כותבים קוד שמפרק את הטקסט בחזרה לערכים שהתוכנה יכולה להבין. זה עובד, אבל זה איטי, יקר, ושביר בדיוק במקום שהכי כואב: הפורמט.
JEV, המודל הראשון של חברת TypeSafe AI, מציע גישה אחרת. מודל שמקבל את ה-state של המערכת ומחזיר החלטה מוקלדת (typed), עם הסתברויות ורמת ביטחון מכוילת. בלי טקסט חופשי, בלי parsing, בלי לקוות שה-JSON יצא תקין הפעם. במאמר הזה אני מפרק מה המודל הזה בדיוק, במה הוא שונה מ-LLM רגיל ברמת הארכיטקטורה והביצועים, ואיפה הייתי משלב אותו כבר היום, למשל בעצי החלטות של בוטים ואוטומציות.
השם מגיע מדניאל כהנמן. חשיבה מסוג System 1 היא המהירה והאינטואיטיבית, זו שמזהה פרצוף כועס בשבריר שנייה. System 2 היא האיטית והמנומקת, זו שפותרת תרגיל כפל ארוך. TypeSafe טוענים שחלק גדול מאוד ממה שתוכנה צריכה ממודל AI הוא בכלל החלטות מסוג System 1: סיווג, ניתוב, ציון, אימות של טענה. החלטות שאדם מיומן מקבל בשניות בהינתן ההקשר הנכון, ושלא צריכות פסקה מנוסחת אלא תשובה.
ההגדרה שלהם ל-JEV קצרה וקולעת: קריאת פונקציה בעלת אינטליגנציה של מודל חזית. נכנס state לא מובנה, יוצאות החלטות מוקלדות עם הסתברויות. המודל נקרא על שם הכלכלן ויליאם סטנלי ג'בונס, שטבע את העיקרון שלפיו ככל שמשאב נהיה יעיל וזול יותר, הביקוש אליו דווקא מתפוצץ. הרמז ברור: אם החלטת AI עולה כמעט כלום ולוקחת עשירית שנייה, פתאום משתלם לשים אותה בכל מקום.
LLM רגיל מייצר טקסט, וגם כשמבקשים ממנו structured output הוא עדיין מייצר טוקנים שמקווים שיתאימו לסכמה. כל מי שהריץ מערכת כזאת בפרודקשן מכיר את הרגע שבו המודל מחזיר שדה בשם קצת אחר, או עוטף את ה-JSON בהסבר אדיב. JEV מחזיר ערכים מתוך הטיפוס שהגדרתם, ולפי TypeSafe פלט מחוץ לטיפוס הוא בלתי אפשרי מתמטית, לא מסונן בדיעבד. חשוב לדייק: זה מבטל הזיות פורמט, לא טעויות תוכן. המודל עדיין יכול לבחור את האופציה הלא נכונה, אבל הוא טועה בתוך הטיפוס, ועם מספר ביטחון שאפשר לפעול לפיו.
מודל שפה אוטורגרסיבי מייצר טוקן, מחכה, מייצר את הבא. זו הסיבה המבנית לכך שתשובה לוקחת שניות ושפלט עולה פי כמה מקלט. JEV דוגם את כל התשובות במקביל, בלי ייצור סדרתי. זה לא שיפור אינקרמנטלי אלא משחק אחר: זמני תגובה של 70 עד 500 אלפיות שנייה, ותמחור שבו הפלט פשוט חינם, כי אין טוקני פלט.
כשמבקשים מ-LLM רגיל ציון ביטחון, מקבלים מספר שנשמע בטוח כמעט תמיד. המודלים האלה ידועים כבטוחים מדי בעצמם, ובאופן לא עקבי. הטענה המרכזית של TypeSafe היא ש-JEV מאומן כך שהביטחון שלו מתואם עם הדיוק בפועל. מנקודת מבט הנדסית זו אולי התכונה החשובה ביותר: אפשר לכתוב קוד בסגנון אם הביטחון מעל 0.9 תפעל, אחרת תעביר לבן אדם, ושהתנאי הזה באמת יחלק את המקרים נכון. ההחלטה מתי לא להחליט הופכת לחלק מהמערכת.
מודלי שיחה מאומנים עם RLHF, למידת חיזוק מפידבק אנושי, שמלמדת אותם לרצות את הקורא. גישות חדשות יותר כמו RLVR מתגמלות תשובות נכונות שאפשר לאמת. TypeSafe פיתחו לשיטתם אלגוריתם שלישי, RLCD, למידת חיזוק להחלטות מכוילות: המודל מתוגמל לא רק על החלטה נכונה אלא על כך שההסתברויות שהוא מדווח משקפות את הסיכוי האמיתי שהוא צודק.
הממשק של JEV בנוי משלוש פרימיטיבות, וכל בקשה היא state ועליו שאלה אחת או יותר:
Choice: בחר אופציה מרשימה סגורה. זה הכלי לניתוב וסיווג, והתשובה כוללת את הבחירה, התפלגות הסתברויות על כל האופציות, ורמת ביטחון.
Score: תן ציון לפי רובריקה שהגדרתם. ציון לידים, דירוג איכות של שיחה, תעדוף של פניות. גם כאן עם הסתברויות וביטחון.
Noul: האם הטענה הזאת נכונה, כערך רציף בין 0 ל-1. זו הפרימיטיבה המעניינת ביותר בעיניי, כי היא הופכת בדיקת עובדות מול מקור לקריאת פונקציה: האם המשפט שהבוט עומד לשלוח נתמך במסמך שממנו הוא ציטט.
העיקרון המנחה בתיעוד שלהם חד: שאלות אטומיות. שאלה טובה ל-JEV היא שאלה שמומחה היה עונה עליה בכמה שניות עם ההקשר הנכון. את ההרכבה של החלטות קטנות לתהליך גדול עושים בקוד, לא בתוך המודל. מי שבנה סוכני AI מזהה כאן היפוך מרענן: במקום לדחוף עוד ועוד לוגיקה לפרומפט ענק, הלוגיקה חוזרת לתוכנה, והמודל עונה על שאלות קטנות ומדויקות.
TypeSafe מפרסמים בנצ'מרק של workflow תפעולי מלא: JEV סיים ב-0.114 שניות מה שלקח למודל שפה מוביל 8.5 שניות, פי 193 מהר יותר, ופי 444 זול יותר. התמחור הרשמי: 42 דולר למיליארד טוקני קלט, בערך פי 200 פחות ממודלי החזית, ופלט חינם. בזמני תגובה מדובר על 70 עד 500 אלפיות שנייה, מה שמכניס את המודל לטריטוריה שעד היום הייתה שמורה לקוד רגיל: בתוך בקשת HTTP, בתוך לולאה על dataset, בתוך כל הודעה נכנסת.
גילוי נאות מתבקש: אלה מספרים של הספק, על בנצ'מרקים שהספק בחר. הייתי מוריד מהם מקדם ביטחון בריא לפני החלטת רכש. אבל גם אחרי ההנחה, היתרון הוא מבני ולא שיווקי: מודל שלא מייצר טוקנים אחד אחרי השני באמת משחק משחק אחר, והפער הזה לא ייסגר בגרסה הבאה של אף מודל שיחה.
זה החלק שהכי מעניין אותי בתור מי שבונה בוטים ואוטומציות. עץ החלטות קלאסי הוא הכלי הכי בדוק בתוכנה עסקית: תנאים ברורים, מסלולים צפויים, אפשר לדבג אותו ולהסביר אותו ללקוח. הבעיה היחידה שלו היא שהעולם מגיע לא מובנה. האם הפנייה הזאת דחופה זו לא שאלת if, וכאן בדיוק עצים נשברים או מתמלאים בכללי מילות מפתח שמזדקנים רע.
הדפוס שמודל System One מאפשר: העץ נשאר בקוד, גלוי, ניתן לבדיקה ולניהול גרסאות. אבל כל צומת רך, כל מקום שבו עד היום היה צריך בן אדם או ניחוש, הופך לשאלת Choice או Noul. וההסתברויות נותנות לכל צומת ענף שלישי שתמיד היה חסר: לא רק כן או לא, אלא גם לא בטוח מספיק, תעביר לבן אדם. עץ כזה מטפל אוטומטית במקרים הבטוחים ומסלים בדיוק את המקרים שראויים לעיניים אנושיות.
כמה מקומות קונקרטיים שבהם הייתי שם את זה כבר היום: ניתוב כוונות בבוט שירות, הצומת שמחליט אם ההודעה היא שאלת מידע, תקלה או ליד חם. ציון לידים לפני הכנסה ל-CRM, עם סף שמעליו נציג מתקשר היום. שומר סף על תשובות של LLM אחר, בדיקת Noul שכל תשובה נתמכת במקור לפני שליחה ללקוח. ומיון המוני של רשומות, אלפי פניות היסטוריות או מסמכים, שבמחיר של 42 דולר למיליארד טוקנים הופך מפרויקט לשאילתה.
חשוב להבין ש-JEV לא בא במקום ה-LLM, הוא בא לשחרר אותו מהעבודה שהוא גרוע בה. בארכיטקטורה היברידית ההחלטות המהירות עוברות למודל ההחלטות, והניסוח נשאר למודל השפה. בבוט אמיתי זה נראה כך: JEV מנתב את הפנייה ומסנן דחיפות, ה-LLM כותב את התשובה עצמה, ו-JEV בודק אותה מול המקורות לפני שהיא יוצאת. שלוש קריאות, שתיים מהן בעשירית שנייה ובעלות אפסית, והמערכת כולה נהיית גם מהירה יותר וגם אמינה יותר.
כשצריך טקסט, אין על מה לדבר, המודל הזה לא מייצר אותו. כשצריך שרשרת נימוקים ארוכה או תכנון רב שלבי, זו בדיוק עבודת System 2 של מודלי חשיבה. כשכללים קשיחים מספיקים, אל תביאו מודל למקום ש-if מטפל בו מצוין וחינם. ולבסוף, שיקול בוגר של ספק: מדובר במודל צעיר מחברה צעירה, עם קטגוריה שהיא בעצמה חדשה. הייתי עוטף את הקריאות בשכבת הפשטה דקה שמאפשרת להחליף ספק או ליפול חזרה ל-LLM עם structured output, ומריץ תקופת הרצה שבה ההחלטות נרשמות אבל לא פועלות לבד.
רוב ה-AI שעסק באמת צריך ביומיום הוא לא שיחות מרשימות, אלא החלטות קטנות בקצב גבוה: לאן זה הולך, כמה זה דחוף, האם זה בטוח. עד היום המחיר של כל החלטה כזאת, בזמן ובכסף, גרם לנו לחסוך בהן. אם ההבטחה של מודלי System One תחזיק מים, הכיוון הפוך: שכבת החלטות זולה ומהירה שמוטמעת בכל תהליך, עם אסקלציה אנושית בדיוק איפה שצריך. זה סוג המערכות שאני בונה ללקוחות, שילוב של סוכני AI, אוטומציות וכלים פנימיים, ומודלים כמו JEV הולכים להיות עוד כלי מרכזי בארגז. אם אתם רוצים לחשוב יחד איפה שכבת החלטות כזאת פוגשת את העסק שלכם, דברו איתי.
רוצה ייעוץ? לחץ כאן לקביעת שיחה.
קבע שיחה
כולם אומרים "נאמן את ה-AI על המידע שלכם". RAG לא עושה שום דבר כזה: המשקולות לא משתנות, המידע נשאר אצלכם, והתשובות מעוגנות במסמכים בזמן השאלה. מה באמת קורה שם, למה זה עדיף לעסק, ומתי פיין-טיונינג כן במקומו.

FOMO של AI גורם לחברות לקנות פלטפורמות שאף אחד לא משתמש בהן. מסלול האימוץ שעובד הוא משעמם: מיפוי תהליכים, פיילוט עם ROI מדיד, RAG על ידע החברה, מדידה ומנגנוני הגנה, הדרכת צוות. מה זה חוסך, ואיך אני מלווה חברות לשם בשבועות.

איך משלבים צ׳אט AI בצורה בטוחה: גישה מאומתת עם Clerk, סשנים של OpenAI ChatKit, Guardrails לפרומפט/תשובה, וטעינה חכמה בצד לקוח כדי לשמור על ביצועים ב‑Next.js 16 App Router.
בכל מקום שבו אתה נמצא, בוא נעבוד יחד על הפרויקט הבא שלך.
מעדיף לדבר ישירות? קבע שיחה ונדבר על הפרויקט שלך בלייב.
קבע שיחה