Вернуться к моделям

Сравнение моделей

GPT-5.1 vs O3

Краткий вывод по GPT-5.1 и O3 перед подробной таблицей сравнения.

Key Takeaways

Взвешенный результат: GPT-5.1. Категории benchmark дают 80%, а цена, производительность API и доступность — 20%.

Вывод

GPT-5.1

GPT-5.1 имеет более высокий взвешенный результат; баллы модели A / B — 60 к 40.

Глубина данных

111 точек данных

Включает 23 строк бенчмарков, 0 аудитов и 10 примеров провайдеров.

Сигнал выбора

Начать с GPT-5.1

Графики ниже разделяют 33 сильных сигналов по скорости, оценкам и состоянию аудита.

Изменить сравнение

Замените любую сторону отчёта, чтобы открыть новое сравнение в той же LMSpeed-структуре данных.

Выберите другую модель, чтобы открыть новый URL сравнения.

Таблица сравнения

Отчёт использует данные LMSpeed о GPT-5.1 и O3: цены, замеры скорости, независимые тесты и примеры общих поставщиков.

Сравнение моделей
GPT-5.1
O3
Общий лидерЛидируетСоперник
Итоговый взвешенный балл60.0 балла40.0 балла
Лидерство в категориях benchmark3 категорий3 категорий
Операционные преимуществаМинимальная цена ввода, Средняя скорость, Задержка первого токена, Бесплатные поставщики, Набор поставщиковНет данных
Контекстное окно400K токенов200K токенов
Макс. вывод128K токенов100K токенов
Модальности

Вход

ИзображениеТекстФайл

Выход

Текст

Вход

ИзображениеТекстФайл

Выход

Текст
Возможности
Текст на входеИзображения на входеФайлы на входеТекст на выходеВызов инструментовСтруктурированный выводJSON-режимReasoning
Текст на входеИзображения на входеФайлы на входеТекст на выходеВызов инструментовСтруктурированный выводJSON-режимReasoning

В итоговом результате категории benchmark имеют вес 80%, а цена, скорость/задержка API и доступность — 20%. Количество недавних тестов не влияет на победителя, категории без общих данных исключаются.

Метаданные модели

Сравнение моделей
GPT-5.1
O3
РазработчикOpenAIOpenAI
Выпущенанояб. 2025 г.апр. 2025 г.
ПараметрыНет данныхНет данных
ТокенизаторGPTGPT
Срез знанийНет данных2024-06-30
OpenRouter IDopenai/gpt-5.1openai/o3
СсылкиНет данныхНет данных

Когда выбирать каждую модель

Отчёт использует данные LMSpeed о GPT-5.1 и O3: цены, замеры скорости, независимые тесты и примеры общих поставщиков.

GPT-5.1

GPT-5.1 сильнее в категориях benchmark (Reasoning, Знания, Следование инструкциям) и операционных измерениях (Минимальная цена ввода, Средняя скорость, Задержка первого токена, Бесплатные поставщики, Набор поставщиков).

O3

O3 лидирует в категориях benchmark: Агенты, Кодинг, Математика.

Сравнение результатов тестов

Независимые тесты, собранные LMSpeed. Показаны только показатели, доступные для обеих моделей.

Производительность по категориям

Сравнение категорий бенчмарков по шкале 0-100. Выберите категорию, чтобы посмотреть разрыв.

Покрытие модели A
7 / 8
Покрытие модели B
6 / 8
Общие
6 общих категорий

Средний балл

GPT-5.1

51.1

Средний балл

O3

52.6

Агенты

O3 впереди на 1.9

GPT-5.147.3
O349.2

Кодинг

O3 впереди на 3.5

GPT-5.149.6
O353.1

Reasoning

GPT-5.1 впереди на 0.2

GPT-5.153.8
O353.6

Знания

GPT-5.1 впереди на 3.8

GPT-5.151.4
O347.6

Математика

O3 впереди на 5.3

GPT-5.153.4
O358.7

Многоязычность

Нет данных

GPT-5.1-
O3-

Мультимодальность

GPT-5.1

GPT-5.148.8
O3-

Следование инструкциям

GPT-5.1 впереди на 0.5

GPT-5.153.6
O353.1

Подробности профессиональных бенчмарков

Показатели на уровне метрик с источником, глубиной ранжирования, уверенностью, ошибкой и датой оценки, где они доступны.

Сводныеreported

BenchLM overall score

ИсточникGPT-5.1

GPT-5.1

лидер

66.0

Ранг #32/111 · confidence 2 · дата оценки 2025-11-13

+16.0

O3

50.0

Ранг #82/111 · confidence 1 · дата оценки 2025-04-16

Ценыverified

Input price

ИсточникGPT-5.1 (high)

GPT-5.1

лидер

$1.25/M

Ранг #123/186 · confidence 4

+$0.750/M

O3

$2.00/M

Ранг #143/186 · confidence 4

Ценыverified

Output price

ИсточникGPT-5.1 (high)

GPT-5.1

$10.00/M

Ранг #142/186 · confidence 4

+$2.00/M

O3

лидер

$8.00/M

Ранг #138/186 · confidence 4

Ценыverified

Blended price

ИсточникGPT-5.1 (high)

GPT-5.1

лидер

$3.44/M

Ранг #139/186 · confidence 4

+$0.062/M

O3

$3.50/M

Ранг #145/186 · confidence 4

Reasoningreported

AA-LCR

ИсточникGPT-5.1

GPT-5.1

лидер

80.0

Ранг #24/106 · confidence 2 · дата оценки 2025-11-13

+6.7

O3

73.3

Ранг #55/106 · confidence 1 · дата оценки 2025-04-16

Reasoningverified

MMLU-Pro

ИсточникGPT-5.1 (Non-reasoning)

GPT-5.1

80.1%

Ранг #62/129 · confidence 4

+5.2%

O3

лидер

85.3%

Ранг #27/129 · confidence 4

Reasoningreported

CritPt

ИсточникGPT-5.1

GPT-5.1

лидер

4.9

Ранг #48/88 · confidence 2 · дата оценки 2025-11-13

+3.8

O3

1.1

Ранг #69/88 · confidence 1 · дата оценки 2025-04-16

Reasoningverified

GPQA

ИсточникGPT-5.1 (high)

GPT-5.1

лидер

87.3%

Ранг #52/218 · confidence 4

+4.6%

O3

82.7%

Ранг #83/218 · confidence 4

Reasoningverified

HLE

ИсточникGPT-5.1 (high)

GPT-5.1

лидер

28.5%

Ранг #61/216 · confidence 4

+8.4%

O3

20.1%

Ранг #86/216 · confidence 4

Кодингverified

LiveCodeBench

ИсточникGPT-5.1 (high)

GPT-5.1

лидер

86.8%

Ранг #4/115 · confidence 4

+6.0%

O3

80.8%

Ранг #16/115 · confidence 4

Кодингreported

AA-SciCode

ИсточникGPT-5.1

GPT-5.1

лидер

43.3

Ранг #60/113 · confidence 3 · дата оценки 2025-11-13

+2.3

O3

41.0

Ранг #67/113 · confidence 1 · дата оценки 2025-04-16

Математикаreported

FrontierMath v2 (Tier 4)

ИсточникGPT-5.1

GPT-5.1

лидер

12.5

Ранг #17/36 · confidence 2 · дата оценки 2025-11-13

+10.4

O3

2.1

Ранг #33/36 · confidence 1 · дата оценки 2025-04-16

Математикаreported

FrontierMath v2 (Tiers 1-3)

ИсточникGPT-5.1

GPT-5.1

лидер

31.0

Ранг #19/47 · confidence 2 · дата оценки 2025-11-13

+12.3

O3

18.7

Ранг #30/47 · confidence 1 · дата оценки 2025-04-16

Математикаreported

BenchLM Math score

ИсточникGPT-5.1

GPT-5.1

лидер

49.2

Ранг #37/63 · confidence 2 · дата оценки 2025-11-13

+11.3

O3

37.9

Ранг #46/63 · confidence 1 · дата оценки 2025-04-16

Знанияreported

AA-Omniscience Hallucination Rate

ИсточникGPT-5.1

GPT-5.1

51.9

Ранг #74/106 · confidence 2 · дата оценки 2025-11-13

+36.2

O3

лидер

88.1

Ранг #24/106 · confidence 1 · дата оценки 2025-04-16

Знанияreported

AA-Omniscience Accuracy

ИсточникGPT-5.1

GPT-5.1

37.7

Ранг #43/106 · confidence 2 · дата оценки 2025-11-13

+0.9

O3

лидер

38.6

Ранг #40/106 · confidence 1 · дата оценки 2025-04-16

Знанияreported

Artificial Analysis Intelligence Index

ИсточникGPT-5.1

GPT-5.1

24.7

Ранг #67/117 · confidence 2 · дата оценки 2025-11-13

+6.4

O3

лидер

31.1

Ранг #45/117 · confidence 1 · дата оценки 2025-04-16

Знанияreported

AA-GPQA Diamond

ИсточникGPT-5.1

GPT-5.1

лидер

87.3

Ранг #48/113 · confidence 2 · дата оценки 2025-11-13

+4.6

O3

82.7

Ранг #71/113 · confidence 1 · дата оценки 2025-04-16

Знанияreported

AA-HLE

ИсточникGPT-5.1

GPT-5.1

лидер

28.5

Ранг #52/114 · confidence 2 · дата оценки 2025-11-13

+8.4

O3

20.1

Ранг #71/114 · confidence 1 · дата оценки 2025-04-16

Мультимодальностьreported

AA-MMMU-Pro

ИсточникGPT-5.1

GPT-5.1

лидер

75.5

Ранг #30/68 · confidence 2 · дата оценки 2025-11-13

+5.4

O3

70.1

Ранг #50/68 · confidence 1 · дата оценки 2025-04-16

Мультимодальностьreported

Design Arena Website

ИсточникGPT-5.1

GPT-5.1

лидер

1201.0

Ранг #50/78 · confidence 2 · дата оценки 2025-11-13

+154.0

O3

1047.0

Ранг #71/78 · confidence 1 · дата оценки 2025-04-16

Следование инструкциямreported

AA-IFBench

ИсточникGPT-5.1

GPT-5.1

лидер

72.9

Ранг #26/84 · confidence 2 · дата оценки 2025-11-13

+1.5

O3

71.4

Ранг #30/84 · confidence 1 · дата оценки 2025-04-16

Агентыreported

τ²-bench results

ИсточникGPT-5.1

GPT-5.1

лидер

81.9

Ранг #53/82 · confidence 2 · дата оценки 2025-11-13

+1.2

O3

80.7

Ранг #54/82 · confidence 1 · дата оценки 2025-04-16

Сравнение аудитов API

Последние завершённые аудиты у общих поставщиков: четыре группы оценок безопасности и целостности со ссылками на отчёты.

Поставщик
GPT-5.1
O3
Завершённых аудитов у общих поставщиков пока нет.

Данные поставщиков

Замеры скорости и цены входных и выходных токенов для каждого поставщика помогают выбрать API и оценить стоимость перехода.

Поставщик
GPT-5.1
O3
BUZZ10 тестов

GPT-5.1

скорость / задержка

137 tok/s / 3299ms

ввод / вывод

Нет данных

O3

скорость / задержка

N/A / N/A

ввод / вывод

Нет данных

N1N5 тестов

GPT-5.1

скорость / задержка

96 tok/s / 1862ms

ввод / вывод

Нет данных

O3

скорость / задержка

N/A / N/A

ввод / вывод

Нет данных

42公益站0 тестов

GPT-5.1

скорость / задержка

N/A / N/A

ввод / вывод

Нет данных

O3

скорость / задержка

N/A / N/A

ввод / вывод

Нет данных

9527 API0 тестов

GPT-5.1

скорость / задержка

N/A / N/A

ввод / вывод

Нет данных

O3

скорость / задержка

N/A / N/A

ввод / вывод

Нет данных

AAAI0 тестов

GPT-5.1

скорость / задержка

N/A / N/A

ввод / вывод

Нет данных

O3

скорость / задержка

N/A / N/A

ввод / вывод

Нет данных

GPT-5.1

gpt-5.1

скорость / задержка

Нет данных

ввод / вывод

$0/request

O3

o3-2025-04-16

скорость / задержка

Нет данных

ввод / вывод

$0/request

GPT-5.1

gpt-5.1-high

скорость / задержка

Нет данных

ввод / вывод

$0.0068/request

O3

o3

скорость / задержка

Нет данных

ввод / вывод

$0.034/request

GPT-5.1

gpt-5.1

скорость / задержка

Нет данных

ввод / вывод

$0.014/M/$0.109/M

O3

o3

скорость / задержка

Нет данных

ввод / вывод

$0.026/M/$0.105/M

GPT-5.1

gpt-5.1

скорость / задержка

Нет данных

ввод / вывод

$0.014/M/$0.109/M

O3

o3-2025-04-16

скорость / задержка

Нет данных

ввод / вывод

$0.026/M/$0.105/M

GPT-5.1

gpt-5.1

скорость / задержка

Нет данных

ввод / вывод

$0.051/M/$0.411/M

O3

o3-2025-04-16

скорость / задержка

Нет данных

ввод / вывод

$0.082/M/$0.329/M

Частые вопросы

Взвешенный результат: GPT-5.1. Категории benchmark дают 80%, а цена, производительность API и доступность — 20%.

Почему это сравнение доступно в поиске?
В сравнении есть проверяемые показатели (6), а для обеих моделей доступны цены или результаты замеров.
Выдумываются ли недостающие показатели?
Нет. Показатели, для которых у LMSpeed нет данных, не включаются в отчёт.

Рейтинги основаны на тестах, предоставленных сообществом, и периодических зондах работоспособности. Носит рекомендательный характер, не является официальными данными.