מה זה Auto Router ב‑LiteLLM ואיך הוא חוסך זמן וכסף?
|
Getting your Trinity Audio player ready...
|
את המאמר הבא כתבתי לאור עדכונים ב- LiteLLM (אותם אנו מייצגים באופן רשמי),
ולאור שאלות שנשאלנו בנושא זה לאחרונה ע"י מספר לקוחות אותן אנו מלווים בהטמעה של המערכת.
Auto Router של LiteLLM הוא מנגנון ניתוב (routing) חכם בתוך ה‑AI Gateway ,
המחליט אוטומטית לאיזה מודל LLM להפנות כל בקשה, לפי סוג המשימה, המורכבות והמודלים הזמינים, במקום לבחור מודל אחד קשיח לכל הסשנים.

המטרה היא לשמור על איכות תשובה גבוהה,
ולהוריד עלויות באמצעות שימוש חכם במודלים זולים כאשר הם מספיק טובים למשימה,
ולהשתמש במודלי Premium רק כאשר הם באמת נדרשים.
Auto Router כ״מודל חכם״ בתוך LiteLLM
מבחינת המשתמשים והמפתחים/ות, Auto Router נראה כמו כל מודל אחר:
הם קוראים ל‑LiteLLM עם model=auto_router או שם וירטואלי אחר,
וה‑Gateway בוחר מאחורי הקלעים את המודל הספציפי –
Claude, GPT, מודל AWS Bedrock, או כל מודל אחר – לפי מדיניות הארגון.
מנהלי הפלטפורמה מגדירים ב‑UI או בקובץ ההגדרות (yaml file) את רמות (tiers) המודלים
(למשל: לפי קוד, כתיבה, אנליזה) ואת המודלים שמשרתים כל רמה,
כך שמפתחים כבר לא צריכים לזכור איזה מודל מתאים לאיזה משימה.
איך Auto Router עובד בפועל
כאשר בקשה מגיעה ל‑LiteLLM , Auto Router מסווג אותה על בסיס תוכן הטקסט והקונטקסט של השיחה.
הסיווג יכול להשתמש בכללים מבוססי מילות מפתח, במסווג של מודל LLM קטן או בכללים סמנטיים,
כדי לזהות אם מדובר בשאלה על קוד, כתיבה שיווקית, ניתוח נתונים וכדומה.
לאחר הסיווג, הבקשה משויכת לרמה המתאימה – למשל רמת ״קוד״ או רמת ״כתיבה״ – ושם Auto Router בוחר אם להשתמש במודל אחד מוצמד, במאגר (pool) אקראי של מודלים דומים, או ב- pool אדפטיבי שמשתמש ב‑Thompson Sampling כדי ללמוד לאורך זמן איזה מודל נותן יחס איכות‑עלות טוב יותר.
Auto Router v2: ניתוב מורכב בתצורה אחת
v2 הוא שיפור ל- Auto Router שיצא לאחרונה (במהדורה 1.94 , אוגוסט 2026).
Auto Router v2 מאחד לתצורה אחת ניתוב לפי מורכבות, ניתוב סמנטי וניתוב אדפטיבי,
כך שאין צורך להגדיר תצורות נפרדות, וכן הוא מוסיף יכולות נוספות:
- תמיכה במספר סוגי סיווגים (classifiers): heuristic scorer, LLM classifier, וכללים לקסיקליים/סמנטיים.
- אפשרות להגדיר מאגר (pool) מודלים לכל רמה: מודל יחיד, pool אקראי או pool אדפטיבי.
- שליטה ב- Session affinity – האם לשמור משתמש על מודל מסוים לאורך שיחה או לא; ברירת המחדל כיום היא "כבוי" כדי להקל על cache ולקבל החלטות דינמיות יותר.

בהגדרה אחת אפשר להגדיר כללי מילות מפתח, לבחור סוג קלסיפייר (heuristic או LLM), להפעיל pools אדפטיביים, ולהחליט אם להפעיל session affinity לשיחות שבהן חשוב להישאר על אותו מודל לאורך זמן.
בגרסאות האחרונות נוספו גם presets מוכנים למשפחות מודלים של Anthropic ו‑OpenAI,
אפשרות ל‑Test Routing ישירות מתוך ה‑UI,
ויכולת להחליף את ה‑prompt של הקלסיפייר כדי להתאים את הניתוב למדיניות של כל צוות וארגון.
למה טוב להשתמש ב‑Auto Router בארגונים?
בארגונים שבהם יש כמה ספקים ומודלים (GPT, Claude, Bedrock ועוד), בחירת המודל הנכון לכל שימוש הופכת במהירות למשימה כבדה על המפתחים וה‑DevOps.
Auto Router מאפשר להגדיר פעם אחת מדיניות ניתוב מרכזית, ולהסתיר את המורכבות מהמפתחים:
הם עובדים מול ״מודל חכם״ אחד, והצוות שמנהל את ה‑AI Gateway שולט ב‑policy ובשילוב המודלים.
בנוסף, Auto Router מאפשר להבדיל בין ״auto״ ל‑״premium״: מודל ״auto״ יבחר את המודל הזול ביותר שהוא עדיין מתאים למשימה, בעוד מודל ״premium״ יבחר רק בין המודלים החזקים והיקרים ביותר.
כך אפשר לתת למפתחים API אחד, ולבחור ברמת הארגון האם לשים דגש על חיסכון או על איכות מקסימלית.
איך Auto Router חוסך זמן למפתחים ול‑DevOps
בלי Auto Router, יש צורך להגדיר ידנית חוקים: לאיזה מודל להפנות משימות קוד, לאיזה מודל משימות כתיבה, איך לנהל שיחות מרובות פניות, ואיך לשלב מודלים זולים עם מודלים פרימיום.
Auto Router מרכז את כל ההיגיון הזה בקונפיג אחד, עם רמות (tiers) מוכנות וחוקים שאפשר לעדכן –
מה שמקטין משמעותית את הזמן שלוקח לשימוש במערכת, לכוונון ולתחזוקה שלה.
בנוסף, LiteLLM מציע יכולת הקמה בלחיצה אחת: פקודת shell אחת שמזהה את המודלים הקיימים ב‑Gateway, מבקשת שם לניתוב והקצאה ל- tiers, וכותבת config מוכן.
כך אפשר להכניס Auto Router לסביבת פיילוט, בדיקות או פרודקשן במהירות, בלי עבודת אינטגרציה ארוכה ובלי לשבור APIs קיימים.
שיפורים אחרונים מאפשרים למסווג של Auto Router להשתמש גם בהודעות הקצרות כ- context, כדי להבין פניות קצרות כמו ״כן, תעשה את זה״ בשיחות מרובות פניות.
וכך – במקום לכתוב לוגיקה אפליקטיבית מסובכת כדי לפענח את ההקשר, Auto Router עושה זאת במעמד הניתוב, וחוסך זמן פיתוח ו‑debugging.
איך Auto Router חוסך כסף בעלויות מודלי LLM
אחד היעדים המוצהרים של Auto Router הוא להוריד עלויות בלי לפגוע משמעותית באיכות.
לפי נתונים שפורסמו ב‑LiteLLM, בסט משימות אמיתי Auto Router הגיע לשיעור פתרון קרוב מאוד למודל פרימיום כמו Claude Opus, אך בעלות נמוכה יותר בכ‑ 27% לעומת תרחיש שבו כל הבקשות נשלחות תמיד למודל היקר ביותר.

כדי לראות את החיסכון בפועל, LiteLLM מוסיף ללוח הבקרה לשונית ייעודית בשם Auto-Router Usage, תחת Cost Optimization.
כל בקשה שמטופלת על ידי Auto Router מתומחרת גם כאילו הייתה נשלחת למודל היקר ביותר ב- tier הגבוה ביותר, והפער בין העלות בפועל לבין העלות ההיפותטית נרשם כ‑ autorouter_savings_spend.
הלשונית מציגה חיסכון מוערך בדולרים ובאחוזים, מספר sessions ו‑turns, נתוני שימוש בטוקנים, וסטטיסטיקות על prompt caching, כך שניתן להראות להנהלה (בצורה כמותית ואגרגטיבית) כמה כסף Auto Router חוסך לאורך זמן.
עבור צוותים שבוחנים מעבר ל‑AI Gateway מרכזי, זו תשובה ישירה לשאלה ״כמה זה באמת חוסך לנו״.
התאמת איכות מול עלות בעזרת tiers אדפטיביים
במצבי שימוש מתקדמים, Auto Router יכול להשתמש בניתוב אדפטיבי: הוא מודד לאורך זמן את איכות התשובות והעלות לכל מודל ו- tier, ומאזן ביניהם לפי משקולות שמוגדרות במדיניות (למשל 70% איכות, 30% עלות).
כך ניתן לבחור באופן דינמי האם לשים דגש על איכות, על חיסכון, או על איזון ביניהם, בלי לשנות את קוד האפליקציה.
לסיכום: Auto Router כבסיס ל‑AI Gateway חכם
Auto Router של LiteLLM הופך את בחירת מודלי ה‑LLM למדיניות מרכזית מנוהלת, במקום החלטות נקודתיות בכל מיקרו‑שירות.
ה- Auto Router חוסך זמן למפתחים ול‑DevOps, מפחית עלויות שימוש במודלים, מאפשר למדוד את החיסכון בדשבורד ייעודי, ומתאים במיוחד לארגונים שמחפשים לעשות סדר בניתוב למודלי AI ולשלוט בעלויות בקנה מידה גדול.
ניתן להשתמש ב- Auto Router הן במודלים on-premises והן בענן, וכן גם ניתן להתקין אותו כחלק מהתקנת self-hosted LiteLLM .
המאמר נכתב ע"י תמיר גפן, ALM Toolbox .
חברת ALM Toolbox מתמחה בהטמעת כלי AI ומודלים (כולל self-hosted ותשתית AI), וכן בכלים לאופטימיזצית שימוש בהם – כגון LiteLLM, LangFuse ונוספים.
החברה היא גם הנציגה הרשמית של LiteLLM בישראל ובמדינות נוספות.
לפרטים נוספים פנו אלינו: litellm@almtoolbox.com או טלפונית: 072-240-5222
קישורים רלוונטים: