Мазмұнға өту
Tez Base

Обработка на Инфостарте

Стенд проверки запросов нейросети к УТ 11.5

Запрос нейросети, который упал с ошибкой, вы увидите сразу. Опасен тот, что отработал молча и вернул правдоподобное число. Стенд выполняет запрос модели на вашей базе рядом с эталоном и сравнивает каждую строку результата.

Обработка на Инфостарте бесплатно, код открыт, задания вшиты в саму обработку. Проверено на УТ 11.5.22, платформа 8.3.27. Конфигурация не изменяется, расширение не устанавливается.

Модели охотно пишут запросы к типовой УТ, и большая часть из них выглядит рабочей. В нашем прогоне три модели написали по памяти 90 запросов: 35 упали с ошибкой выполнения, 12 выполнились без замечаний и вернули не те строки. Среди них остаток по складам 94 752 штуки вместо 81 838: запрос сложил приход с расходом в физической таблице регистра, а число строк и позиций совпало с эталоном.

Такие вещи не видно ни по факту выполнения, ни по числу строк. Их видно только сверкой значений с запросом, который заранее проверен на той же базе. Стенд держит 30 таких эталонов и делает сверку одной кнопкой, для любой модели: облачной в чате или локальной по адресу.

Что делает стенд

Собирает промпт

Правила ответа и все 30 заданий одним текстом, 7 050 знаков. С флажком "С описанием объектов из метаданных" к каждому заданию добавляются реквизиты, измерения, ресурсы и табличные части нужных объектов вашей базы с типами, промпт вырастает до 113 852 знаков.

Принимает ответ модели двумя путями

Промпт копируется в любой чат, ответ вставляется обратно в формате "### номер" и запрос под ним. Либо стенд сам отправляет задания по одному на OpenAI-совместимый адрес: Ollama, LM Studio или облачный сервис, ключ доступа указывается при необходимости.

Сверяет строки с эталоном

Эталон и запрос модели выполняются на одной базе с одним периодом. Колонки ищутся по именам из задания, порядок строк не важен, числа сравниваются с округлением до двух знаков, NULL в числе считается нулём, строки сравниваются как мультимножество.

Ставит статус каждому заданию

Пять статусов: "верно", "не те строки", "ошибка" с текстом платформы, "нет ответа" и "эталон не выполнился". В таблице видно число строк у эталона и у модели, внизу рядом текст задания, запрос модели и эталон, чтобы спорный случай решил человек.

Принимает свои задания

Задания лежат в JSON на отдельной странице формы. Можно дописать свои под доработки конфигурации, со своим эталоном, и вернуть набор по умолчанию одной кнопкой.

Что показал прогон трёх моделей

УТ 11.5.22 с тестовыми продажами, период 01.06.2026-31.08.2026. Каждая пара "модель и промпт" прогнана один раз, поэтому разницу в один-три запроса мы за эффект не считаем. Таблица показывает, что ловит стенд, рейтингом моделей она не служит.

МодельПо памяти / с описанием объектов
Claude Opus 5.5 Верно 25 / 26, тихих промахов 0 / 0, ошибок 5 / 4. Все ошибки одинаковые: таблица названа псевдонимом "В", а это оператор языка запросов.
Claude Sonnet 5 Верно 10 / 26, тихих промахов 7 / 3, ошибок 13 / 1. Ошибки были про имена, и описание их сняло. Три оставшихся тихих промаха пришлись на задания про цены: какой из двух регистров цен заполнен, по метаданным не видно.
Claude Haiku 4.5 Верно 8 / 9, тихих промахов 5 / 1, ошибок 17 / 20. С описанием выдуманные имена сменились SQL-словами и ресурсами без суффикса в виртуальных таблицах.
Все три по памяти 90 запросов: 35 ошибок выполнения, 12 выполнились с неверными строками. Если не считать три задания, где разошлись сами данные базы, тихих промахов 9.

Как проверяли сам стенд

УТ 11.5.22, платформа 8.3.27, клиент-серверный вариант. Проверка, которая всегда говорит "верно", ничего не проверяет, поэтому до замера моделей стенд прогнан на заранее известных ответах. Пустые места мы не заполняли догадками.

Показатель Значение Как надо Вердикт Что это значит
Эталоны, поданные как ответ модели 30 верно из 30 30 из 30 норма положительный контроль
Ответ без запросов 30 "нет ответа" 30 норма пустой ответ не засчитывается верным
Набор с намеренной порчей шести заданий 4 пойманы, 2 прошли пойманы все порчи смысла норма пойманы старый регистр цен, перечисление строкой, снятый отбор групп, опечатка в СГРУППИРОВАТЬ; ссылка вместо представления и колонки под другими именами проходят по правилам сверки
Время сверки 30 заданий 0,5-1 с - инфо на тестовой базе; первая сверка после перерыва около 6 секунд
Вызов модели по OpenAI-совместимому адресу не проверялось ответ живой модели внимание Ollama на стенде установлена, но без загруженной модели; в замере ответы моделей вставлены на страницу ответа
Релизы УТ без регистра ЦеныНоменклатуры25 не проверялось - инфо по устройству стенда четыре задания про цены получат статус "эталон не выполнился" и в счёт модели не пойдут

Разбор результата

Сверка засчитывает ответ по значениям строк, поэтому остаток, посчитанный по физической таблице регистра, получает "не те строки" при совпавшем числе строк. Обратная сторона: эталон проверен на данных конкретной базы. Если данные кривые, "не те строки" может означать правильный запрос на кривых данных, поэтому эталон и запрос модели всегда видны рядом.

Как запускать

  1. 01

    Открыть на копии базы

    Файл - Открыть в копии УТ 11.5. Запросы модели выполняются с вашими правами, и запрос без отборов по большой таблице может идти долго, поэтому рабочая база в разгар дня для замера не годится.

  2. 02

    Задать период

    Так, чтобы в него попали продажи и движения. Эталоны считают ваши данные, и задание с пустым эталоном ничего не проверяет.

  3. 03

    Получить ответ модели

    На странице "1. Промпт" нажать "Сформировать промпт" и отдать текст модели, ответ вставить на страницу "2. Ответ модели". Для локальной модели указать адрес, например http://localhost:11434/v1/chat/completions, и нажать "Спросить модель по всем заданиям".

  4. 04

    Проверить ответ

    На странице "3. Результат" кнопка "Проверить ответ". Вверху сводка: сколько выполнилось, сколько вернуло верные строки, сколько упало. По строке задания внизу видны задача, запрос модели и эталон.

Өзіңіз шеше алмай жатырсыз ба? Жазыңыз, бірге қараймыз

Для каждого нового вопроса руководителя приходится собирать отдельную выгрузку и объяснять цифры вручную. Вопросы о продажах и запасах на понятном языке с проверяемыми расчётами. Сначала разбираемся в показателях и качестве исходных данных.

Құны
450 000 - 600 000 ₸анализ задачи и погружение; на выходе отчёт и оценка дальнейших работ, внедрение отдельно

Рядом по теме

Жиі қойылатын сұрақтар

Почему не хватает проверить, что запрос модели выполнился?

Ошибку выполнения платформа показывает сама, с местом ошибки, и она чинится быстро. Опасны запросы, которые выполнились и вернули не те строки: в нашем прогоне таких было 12 из 90 запросов по памяти. Совпадение числа строк тоже ничего не доказывает, поэтому стенд сравнивает значения каждой строки с эталоном.

Какую модель можно проверить?

Любую. Промпт копируется в чат, ответ вставляется обратно. Если модель доступна по OpenAI-совместимому адресу, как Ollama, LM Studio или облачный сервис, стенд сам отправит задания по одному и соберёт ответ. Ключ доступа указывается, если сервис его требует.

Может ли запрос модели что-то испортить в базе?

Стенд в базу ничего не пишет, он выполняет запросы на чтение. Но запросы идут с вашими правами, и запрос без отборов по большой таблице может нагрузить сервер, поэтому замер лучше делать на копии базы.

Модель назвала колонки по-своему. Ответ засчитают?

Да, если число колонок совпало: тогда сверка идёт по порядку. Если эталон отдаёт значение типа Строка, а модель ссылку, ссылка сравнивается своим представлением. Порядок строк не важен, числа сравниваются с округлением до двух знаков.

Статус "не те строки" всегда означает ошибку модели?

Нет. Эталон проверен на данных конкретной базы. В нашем прогоне модель брала тип номенклатуры через вид номенклатуры, а у 49 238 позиций тип в карточке пуст при заполненном виде, и результаты разошлись. Поэтому внизу формы запрос модели и эталон стоят рядом: спорный случай решает человек.

У нас доработанная УТ или другой релиз. Стенд подойдёт?

Задания написаны под УТ 11.5 и проверены на 11.5.22. Эталон, который на вашей базе не выполнился, получает статус "эталон не выполнился" и в счёт ошибок модели не идёт. Под свои доработки можно дописать задания с эталоном на странице "Задания", они принимаются сразу.

1С жүйеңізге тегін экспресс-аудит

1-2 күнде базаңызды қарап, өнімділік қайда жоғалып жатқанын табамыз және не істеу керегін айтамыз. Міндеттемесіз.

Тегін экспресс-аудит алу

Тапсырманы талқылайық

Ең жылдамы WhatsApp: тапсырма туралы бірер жол жазыңыз, жұмыс күні ішінде жауап береміз.

+7 707 347 88 04 [email protected]

Өтінімді формамен қалдыру ыңғайлырақ