Router AI zwykle wybiera najmniejszy kwalifikujący się model, którego przewidywane możliwości, opóźnienie, prywatność i ryzyko spełniają zadeklarowany próg usługi dla danego żądania.
Domowe polecenie, takie jak sformatowanie wydarzenia w kalendarzu, może pasować do małego modelu już załadowanego na serwerze domowym, podczas gdy długie generowanie kodu lub niejednoznaczne badanie tematu może wymagać większego modelu lokalnego albo zdalnego. Router wydobywa sygnały dotyczące zadania i kontekstu, stosuje twarde ograniczenia zasad, przewiduje prawdopodobieństwo sukcesu i koszt, a następnie przekazuje zadanie do realizacji lub eskaluje je, gdy poziom pewności jest zbyt niski.
Bramki zasad usuwają niekwalifikujące się modele przed oceną
Rezydencja danych, uprawnienia narzędzi, długość kontekstu, modalność, poziom użytkownika, dostępność sprzętu i termin mogą natychmiast wykluczyć kandydatów. Model chmurowy nigdy nie powinien brać udziału w ocenie, gdy poufne pliki muszą pozostać lokalnie. To rozróżnienie pozostaje widoczne podczas późniejszych testów domowych.
Opis lokalnego routingu specjalistycznego przedstawia mały, stale załadowany klasyfikator, który kieruje zadania związane z kodem, rozumowaniem i zadaniami ogólnymi do wyspecjalizowanych modeli. Konstrukcja ta pokazuje, dlaczego routing zaczyna się od inwentaryzacji możliwości, a nie od jednego uniwersalnego rankingu modeli.
Twarde ograniczenia powinny być deterministyczne i możliwe do sprawdzenia. Pozwolenie, by probabilistyczny klasyfikator nadpisywał zasady prywatności lub uprawnień, zamienia błąd routingu w decyzję dotyczącą bezpieczeństwa. Wynik pośredni musi pozostać możliwy do sprawdzenia, zanim automatyzacja podejmie dalsze działania.
Moduł oceniający szacuje trudność, jakość i koszt obsługi
Router może korzystać z reguł, embeddingów, małego klasyfikatora, wcześniejszych etykiet zadań lub predyktorów jakości odpowiedzi. Szacuje, czy każdy kwalifikujący się model osiągnie wymaganą jakość, uwzględniając czas oczekiwania w kolejce, ładowanie z zimnego startu, presję na pamięć i koszt tokenów.
Badania nad routingiem modeli opartym na poziomie pewności analizują strategie routingu i kaskadowania wykorzystujące niepewność oraz zewnętrzną ocenę jakości. Podejścia te optymalizują oczekiwaną jakość i koszt, zamiast zakładać, że sama długość zapytania odzwierciedla trudność. Tę granicę należy mierzyć osobno w realistycznych warunkach pracy.
Decyzja może dotyczyć całego żądania lub pojedynczego podzadania. Przepisywanie zapytania do wyszukiwania może pozostać zadaniem małego modelu, podczas gdy końcowa synteza zostanie przekazana do większego, o ile przepływ pracy zachowuje pochodzenie danych i nie ujawnia ograniczonego kontekstu. Praktyczne znaczenie staje się widoczne, gdy kilka źródeł konkuruje o ograniczony kontekst.
Mechanizm awaryjny zamienia niepewność w drugą szansę
Mały model może wygenerować ustrukturyzowany poziom pewności, nie przejść walidacji lub uruchomić weryfikator, który zażąda eskalacji. Router może ponowić próbę z większym modelem, wykorzystując pierwotne dane dowodowe, jednak ograniczone budżety zapobiegają nieskończonym kaskadom i powielaniu działań narzędzi.
Wyjaśnienie dotyczące sygnałów routingu i mechanizmu awaryjnego wskazuje złożoność, kontekst, metadane i mechanizm awaryjny jako sygnały routingu. Potwierdza to, że wybór jest zasadą obsługi łączącą możliwości modelu z ograniczeniami operacyjnymi. Ta zależność powinna pozostać wyraźna w końcowym interfejsie.
Granica awarii pojawia się, gdy router został wytrenowany na niereprezentatywnych zadaniach lub korzysta z nieaktualnych danych o wydajności modeli. Pewny siebie, lecz błędny routing może po cichu obniżyć jakość odpowiedzi, dlatego przepływy pracy o istotnych konsekwencjach wymagają deterministycznej walidacji lub bezpośredniego przypisania zamiast polegania wyłącznie na przewidywanej trudności.
Zbuduj macierz pomyłek routingu według kosztu i jakości
Oznacz reprezentatywny zestaw żądań klasą prywatności, modalnością, długością kontekstu, rodziną zadań, ryzykiem, terminem, najmniejszym akceptowalnym modelem i zweryfikowanym wynikiem. Odtwórz go w realistycznych warunkach kolejki i pamięci. Wynik należy zatem sprawdzić względem pierwotnych danych dowodowych.
Porównaj architekturę z lokalnym routingiem modeli. Zapisuj wybrany model, przyczynę routingu, koszt zimnego startu, TTFT, opóźnienie ukończenia, wynik jakości, rezultat walidacji, eskalację, wykorzystanie zasobów i naruszenia zasad. To rozróżnienie pozostaje widoczne podczas późniejszych testów domowych.
Ustalaj progi osobno dla routingu do zbyt małego modelu i niepotrzebnego routingu do zbyt dużego modelu. Przypisuj zadania wysokiego ryzyka do zwalidowanych ścieżek, ponownie trenuj modele lub zmieniaj reguły, gdy pojawia się dryf obciążenia, oraz udostępniaj użytkownikom wybrany model i stan mechanizmu awaryjnego. Wynik pośredni musi pozostać możliwy do sprawdzenia, zanim automatyzacja podejmie dalsze działania.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Jak tajny broker przekazuje agentowi AI dane uwierzytelniające bez ujawniania ich w promptach?
Śledź tożsamość obciążenia, zasady, wydawanie tokenów, wstrzykiwanie żądań, redakcję, wygasanie i unieważnianie w ramach bezsekretnej architektury domowego agenta AI.

Jak piaskownica narzędzi ogranicza skutki uboczne działania agenta AI?
Zobacz, jak izolacja, bramki uprawnień, ulotny stan, kontrola ruchu wychodzącego, limity i dzienniki audytowe ograniczają skutki uboczne agentów AI bez dowodzenia, że działania są...

Jak dekodowanie z ograniczeniami generuje JSON zgodny ze schematem?
Zrozum kompilację schematu, maskowanie tokenów, stan parsera, obsługiwane podzbiory, opóźnienia, obcinanie oraz to, dlaczego poprawność strukturalna nie gwarantuje prawidłowych wartości.

