СНАЧАЛА ДОКАЗАТЕЛЬСТВА · ИСТОРИЧЕСКИЕ РЕЗУЛЬТАТЫ НЕ ДОКАЗЫВАЮТ ТЕКУЩУЮ PRODUCTION-СБОРКУ
Participant contract / R5

Сравнивайте сопоставимое.Не скрывайте границы.

Raw-модели, chat-продукты, coding agents, agent runtimes и оркестраторы — разные участники. Официальный рейтинг строится только внутри зафиксированного протокола.

Разделы сравнения

Треки участников

трек сравненияТолько модельMODEL_ONLY

Один зафиксированный snapshot модели без внешних инструментов и продуктового workflow.

  • pinned_model_snapshot
  • frozen_prompt_protocol
  • no_external_tools
трек сравненияМодель + стандартные инструментыSTANDARD_TOOLS

Зафиксированные модели получают одинаковый браузер, code runner и файловые инструменты.

  • pinned_model_snapshot
  • identical_tool_contract
  • frozen_prompt_protocol
трек сравненияАгент / системаAGENT_SYSTEM

Полные продукты, coding agents, agent runtimes и оркестраторы сравниваются как системы.

  • product_or_system_snapshot
  • interaction_protocol
  • tool_and_model_disclosure
трек сравненияЛучший результат при равном бюджетеEQUAL_BUDGET

Разные классы участников сравниваются только при одинаковых лимитах денег, времени и оператора.

  • shared_money_cap
  • shared_wall_clock_cap
  • shared_operator_protocol
  • actual_cost_and_time_receipts
Охват

Планируемое покрытие

Официальных баллов пока нет. Наличие в каталоге означает планируемое покрытие, а не участие, квалификацию или официальный балл PRO Bench.

RAW_MODELЗафиксированные API-модели

Multiple providers

PLANNEDNOT_EVALUATED

Треки участников:
MODEL_ONLYSTANDARD_TOOLSEQUAL_BUDGET

Политика модели: FIXED_PINNED

  • API

Каждая модель провайдера и её точная версия становятся отдельным snapshot участника только после evidence-bound кампании.

Source: UNKNOWN

CLOUD_CHAT_PRODUCTChatGPT

OpenAI

PLANNEDNOT_EVALUATED

Треки участников:
AGENT_SYSTEMEQUAL_BUDGET

Политика модели: USER_OR_PRODUCT_SELECTED

  • WEB_APP
  • DESKTOP_APP
  • MOBILE_APP

Оценивается полный продуктовый workflow с зафиксированным режимом выбора модели и встроенными возможностями; такой прогон нельзя переименовывать в raw-model.

Заявленный источник продукта

CODING_AGENTCodex

OpenAI

PLANNEDNOT_EVALUATED

Треки участников:
AGENT_SYSTEMEQUAL_BUDGET

Политика модели: USER_OR_PRODUCT_SELECTED

  • DESKTOP_APP
  • CLI
  • IDE
  • CLOUD_SANDBOX

Для каждого snapshot фиксируются поверхность Codex, sandbox/worktree policy, конфигурация модели и все разрешённые инструменты.

Заявленный источник продукта

CODING_AGENTClaude Code

Anthropic

PLANNEDNOT_EVALUATED

Треки участников:
AGENT_SYSTEMEQUAL_BUDGET

Политика модели: USER_OR_PRODUCT_SELECTED

  • CLI
  • WEB_APP
  • DESKTOP_APP

Фиксируются поверхность исполнения, модель, права в репозитории и test/tool policy; результат нельзя приписывать неуказанной модели Claude.

Заявленный источник продукта

AGENT_RUNTIMEOpenClaw

OpenClaw Foundation

PLANNEDNOT_EVALUATED

Треки участников:
AGENT_SYSTEMEQUAL_BUDGET

Политика модели: CONFIGURABLE_PROVIDER

  • SELF_HOSTED
  • MESSAGING_GATEWAY
  • DEVICE_APPS

В один snapshot участника связываются release OpenClaw, host config, provider/model, skills, начальное состояние памяти и выданные права устройства.

Заявленный источник продукта

AGENT_RUNTIMEHermes Agent

Nous Research

PLANNEDNOT_EVALUATED

Треки участников:
AGENT_SYSTEMEQUAL_BUDGET

Политика модели: CONFIGURABLE_PROVIDER

  • SELF_HOSTED
  • CLI
  • MESSAGING_GATEWAY

Фиксируются release Hermes Agent, provider/model, инструменты, skills и начальная память; skills, созданные во время прогона, остаются частью evidence этого прогона.

Заявленный источник продукта

ORCHESTRATORPRO-1

PromanOS

PLANNEDNOT_EVALUATED

Треки участников:
AGENT_SYSTEMEQUAL_BUDGET

Политика модели: SYSTEM_ROUTED

  • API
  • WEB_APP

Раскрываются точный build PRO-1, routing policy, выбранные модели, инструменты, retries, fallbacks, фактическая стоимость, wall-clock time и receipts артефактов.

Заявленный источник продукта

Допуск

Обязательный snapshot участника

  • product_or_model_identity
  • exact_version_or_build
  • access_surface
  • account_plan_and_region
  • model_selection_policy
  • underlying_model_identity_or_disclosure_state
  • enabled_tools_connectors_and_permissions
  • operator_and_interaction_protocol
  • initial_memory_and_workspace_state
  • prompt_retries_fallbacks_and_tool_calls
  • budget_limits_actual_cost_and_wall_clock
  • outputs_artifacts_hashes_and_receipts