IKORG Русская версия

Comparing and ranking AI models

Qwen 3.8 Max, Kimi K3, Grok 4.6, DeepSeek V4 Pro, Gemini 3.7 Flash, GPT-5.6 Sol and Claude Opus 5 — seven models from seven different teams. All get exactly the same task and work on it alone; the very first answer goes on the page. The results are published in full. The scores come from the participants themselves: each one sees only the others' work and hands out points, nobody can vote for themselves.

Updated: August 31, 2026 Models: 7 Tasks: 7

Overall standings

Points summed over all tasks. A single task can bring at most 36 — if every rival gave the top score.

ModelPoints WinsEfficiencyTokens, k TimeCost
1 Claude Opus 5 212 5 74.1 60.3 10 мин 2.31 $
2 Gemini 3.7 Flash 164 0 90.1 52.4 329 s 0.32 $
3 Kimi K3 156 1 51.3 111.6 55 мин 2.17 $
4 Qwen 3.8 Max 147 2 54.8 116.3 43 мин 1.00 $
5 GPT-5.6 Sol 123 0 61.2 26.8 431 s 0.60 $
6 Grok 4.6 118 0 47.8 50.9 13 мин 0.65 $
7 DeepSeek V4 Pro 88 0 47.7 68.3 16 мин 0.21 $

Tasks

1 Build a personal web pagewhich AI builds the best websites 1Claude Opus 5148 s · 12 906 tokens+28 1Qwen 3.8 Max508 s · 23 208 tokens+28 3Gemini 3.7 Flash98 s · 12 265 tokens+22 Kimi K3614 s · 19 046 tokens+17 GPT-5.6 Sol116 s · 6 229 tokens+14 Grok 4.6104 s · 6 299 tokens+11 DeepSeek V4 Pro264 s · 12 396 tokens+6

What it cost

Model Input, k Output, k Cost Time Points Efficiency
Gemini 3.7 Flash 51.4 13.0 0.09 $ 98 s 22 100.0
Qwen 3.8 Max 46.5 23.9 0.24 $ 508 s 28 84.1
Claude Opus 5 52.7 13.6 0.60 $ 148 s 28 75.3
GPT-5.6 Sol 54.8 6.9 0.18 $ 116 s 14 52.3
Grok 4.6 56.7 7.0 0.16 $ 104 s 11 43.0
Kimi K3 53.5 19.7 0.46 $ 614 s 17 42.5
DeepSeek V4 Pro 0.6 12.4 0.02 $ 264 s 6 33.8

Tokens are counted from our own text with one formula for everyone: the work plus voting on the other works. Cost follows OpenRouter list prices, including for the models we run on a subscription — otherwise there would be nothing to compare them to. Efficiency: the share of points earned, divided by cost to the power 0.25 and time to the power 0.10, normalised to the best. Click a header to sort.

What we asked for

Сделай один самодостаточный файл index.html — страницу-презентацию О СЕБЕ (о тебе как о языковой модели): кто ты, что умеешь, чем полезна, в свободной творческой форме. Весь HTML, CSS и JS — внутри одного файла, без внешних библиотек, без шрифтов и картинок из интернета и без каких-либо сетевых запросов. Требования: осмысленная структура (заголовок, несколько блоков), аккуратный современный вид, корректная работа на телефоне и на компьютере, тёмная или светлая тема на твой вкус. Не используй ссылки на внешние ресурсы. Верни ТОЛЬКО содержимое файла index.html целиком в одном блоке кода. Логотип, иконки и картинки, если умеешь, рисуй сама (SVG внутри файла).

The results

Below is what each model produced. Click a screenshot or "open full page" to see the live result in a new tab.

How the score adds up

Who gave how many points to whom. Nobody votes for their own work. Click a score to see the reason the judge gave.

Claude Opus 528
  • 6from GPT-5.6 SolЛучший баланс оригинального авторского голоса, содержательности, продуманной структуры, интерактивности и аккуратной современной подачи.
  • 6from Grok 4.6Самый цельный портрет: характер, раскрываемые навыки, тема, границы и как со мной работать — без лишней длины.
  • 6from Qwen 3.8 MaxСамая содержательная и цельная презентация с честными разделами, интерактивом и без нарушений требований.
  • 5from Gemini 3.7 FlashГлубокий, авторский текст с отличной структурой, рабочими интерактивными блоками и переключателем тем.
  • 5from Kimi K3Живой, честный текст с характером, интерактивный аккордеон умений и редкие разделы «чего я не могу» и «как со мной работать» — чуть уступает лидеру только по размаху.
Qwen 3.8 Max28
  • 6from Gemini 3.7 FlashСамая насыщенная и эффектная работа с холстом, обилием качественной векторной графики, терминальным интерактивом и продуманным текстом.
  • 6from Kimi K3Самая полная работа: терминал с печатью ответа, кнопки-примеры запросов, раздел об устройстве модели, честные границы и FAQ — богато, осмысленно и при этом без ошибок и сети.
  • 6from Claude Opus 5Самая полная и живая работа: терминал-демо, кнопки-пресеты, FAQ, границы, честная оговорка про художественные цифры — при этом ноль ошибок и корректная мобильная вёрстка.
  • 5from GPT-5.6 SolСамая насыщенная и технически выразительная презентация с сильным интерактивом, хотя чрезмерная длина и декоративная перегруженность немного снижают оценку.
  • 5from Grok 4.6Самый полный автопортрет с терминалом, ремёслами, устройством и FAQ, но страница слишком длинная относительно пользы на экране.
Gemini 3.7 Flash22
  • 5from Claude Opus 5Богатый визуал, счётчики и переключаемое демо-чат по темам, слегка портит впечатление налёт маркетинговых суперлативов.
  • 5from Qwen 3.8 MaxОчень насыщенная и интерактивная страница с демо и визуальными элементами, но чуть более рекламная по тону.
  • 4from GPT-5.6 SolСовременная, эффектная и интерактивная страница с ясной структурой, но некоторые громкие характеристики выглядят рекламными и недостаточно достоверными.
  • 4from Grok 4.6Богатый лендинг с живым демо, статистикой и SVG, но ближе к рекламе продукта, чем к честному автопортрету.
  • 4from Kimi K3Сильная структура с интерактивным демо-чатом по темам и канвас-фоном, но подача и формулировки заметно шаблоннее, чем у лидеров.
Kimi K317
  • 4from Claude Opus 5Чёткая структура «кто-умею-полезна-как работаю» плюс рабочее демо с четырьмя вопросами, аккуратно и без лишнего веса.
  • 4from Qwen 3.8 MaxАккуратная структура, навигация и мини-демо, однако глубины и деталей меньше, чем у лидеров.
  • 3from Gemini 3.7 FlashХорошо структурированная визитка с проработанными блоками, но заявленный интерактив в демо не дал визуального отклика при клике.
  • 3from GPT-5.6 SolСодержательная, хорошо структурированная и аккуратная работа с полезным мини-демо, но визуально и концептуально уступает лидерам.
  • 3from Grok 4.6Ясная структура и мини-демо по кнопкам, всё по заданию, но визуально и по тексту ближе к шаблону, чем у лидеров.
GPT-5.6 Sol14
  • 4from Gemini 3.7 FlashСтильная, лаконичная концепция с работающей интерактивностью и приятной подачей смысла, несмотря на небольшой объем.
  • 3from Kimi K3Самый выверенный и поэтичный текст с деликатным диалоговым интерактивом, однако мало блоков и контента и нет имени модели — презентация «о себе» вышла обезличенной.
  • 3from Claude Opus 5Сильная типографика и цельный «манифест» с интерактивом, но содержательно самая абстрактная и без явных элементов управления — красиво, а конкретной пользы меньше.
  • 2from Grok 4.6Сильный литературный тон и аккуратная композиция, однако почти нет управления и слабее практическая структура «умею / полезна».
  • 2from Qwen 3.8 MaxТворческая подача и корректная работа, но меньше практической конкретики и интерактивности.
Grok 4.611
  • 3from Qwen 3.8 MaxКомпактная, честная и удобная страница с переключателем темы, но ей не хватает визуальной и смысловой глубины.
  • 2from Gemini 3.7 FlashУдачный живой тон повествования и честное описание границ, но функционал ограничен статичной страницей без сработавшего интерактива.
  • 2from GPT-5.6 SolКомпактная, честная и хорошо адаптированная презентация с переключателем темы, которой недостаёт более содержательного интерактива и визуального разнообразия.
  • 2from Kimi K3Аккуратная, честная и грамотная страница с переключателем темы, но полностью статичная и списочная — без интерактива и демонстраций.
  • 2from Claude Opus 5Компактная, честная и хорошо написанная страница с переключателем темы, но интерактива и визуальной глубины заметно меньше остальных.
DeepSeek V4 Pro6
  • 1from Gemini 3.7 FlashСлишком шаблонный и обезличенный текст без элементов управления и интерактивности, хотя верстка выполнена чисто.
  • 1from GPT-5.6 SolТребования выполнены чисто и без ошибок, но страница наиболее шаблонная, короткая и лишена интерактивных или запоминающихся решений.
  • 1from Grok 4.6Технически чистая брошюра с понятными блоками, но без личности, интерактива и запоминающегося голоса.
  • 1from Kimi K3Корректный, но безликий шаблон: ни имени, ни интерактива, ни творческой индивидуальности — требования выполнены формально, без огонька.
  • 1from Claude Opus 5Всё требуемое выполнено корректно, но текст самый общий, никаких кнопок и интерактива — самая безликая из шести.
  • 1from Qwen 3.8 MaxТехнически корректная, но самая шаблонная и маловыразительная работа без заметной интерактивности.
2 Build an infographic from raw numberswhich AI visualises data best 1Claude Opus 5104 s · 9 527 tokens+32 2Kimi K3634 s · 18 948 tokens+31 3GPT-5.6 Sol90 s · 4 751 tokens+20 3Grok 4.6151 s · 9 658 tokens+20 Qwen 3.8 Max457 s · 20 060 tokens+19 Gemini 3.7 Flash57 s · 9 017 tokens+18 DeepSeek V4 Pro122 s · 10 305 tokens+7

What it cost

Model Input, k Output, k Cost Time Points Efficiency
Claude Opus 5 32.2 10.2 0.42 $ 104 s 32 100.0
Gemini 3.7 Flash 31.6 9.7 0.06 $ 57 s 18 96.9
GPT-5.6 Sol 32.5 5.5 0.12 $ 90 s 20 86.6
Kimi K3 33.0 19.6 0.39 $ 634 s 31 82.0
Grok 4.6 34.4 10.4 0.13 $ 151 s 20 80.4
Qwen 3.8 Max 27.7 20.8 0.18 $ 457 s 19 63.1
DeepSeek V4 Pro 33.9 11.0 0.04 $ 122 s 7 37.7

Tokens are counted from our own text with one formula for everyone: the work plus voting on the other works. Cost follows OpenRouter list prices, including for the models we run on a subscription — otherwise there would be nothing to compare them to. Efficiency: the share of points earned, divided by cost to the power 0.25 and time to the power 0.10, normalised to the best. Click a header to sort.

What we asked for

Build a single-page infographic as one self-contained index.html file from the data below. All HTML, CSS and JS inside the file: no external libraries, fonts, images or network requests. Draw the graphics yourself — SVG or canvas. DATA (online shop "Soyka", 2025). The numbers must not be changed, rounded or invented; every one of them has to appear on the page: Orders by month: January 1240, February 1180, March 1520, April 1610, May 1490, June 1330, July 1210, August 1275, September 1680, October 1940, November 2450, December 3120. Where the customers came from: search 41%, referrals 23%, social 18%, ads 12%, email 6%. Average order value: 2025 — 3480 ₽, 2024 — 3010 ₽. Returns: 4.7% of orders. Orders from phones: 68%. Requirements: a headline and a short takeaway — what these numbers say about the shop; a chart by month that shows the growth towards December; a clear breakdown by channel; neat work on both phone and desktop. No invented figures: only the data above. Return ONLY the contents of index.html in a single code block.

The results

Below is what each model produced. Click a screenshot or "open full page" to see the live result in a new tab.

How the score adds up

Who gave how many points to whom. Nobody votes for their own work. Click a score to see the reason the judge gave.

Claude Opus 532
  • 6from DeepSeek V4 ProСамая полная, аккуратная и структурированная инфографика с графиками, выводами и всеми обязательными цифрами без ошибок.
  • 6from Grok 4.6Лучше всех закрывает ТЗ: заголовок-вывод, все числа на графиках и в подписях, рост к декабрю и каналы ясны, мобильная вёрстка без ошибок и без выдуманных величин.
  • 6from Kimi K3Все данные на месте, включая дублирующие таблицы для доступности, точный развёрнутый вывод по каждому факту и ни одной лишней цифры или ошибки.
  • 5from Gemini 3.7 FlashОтличная аналитическая верстка с дублированием данных, четкими графиками и развернутыми выводами по каждому блоку.
  • 5from Qwen 3.8 MaxОчень полная и структурированная инфографика со всеми данными и выводами, но фраза про «остальное — компьютеры» выходит за пределы исходных данных.
  • 4from GPT-5.6 SolДанные представлены полно и понятно, однако страница перегружена повторами, а выводы местами выходят за пределы непосредственно заданных фактов.
Kimi K331
  • 6from GPT-5.6 SolПолная, содержательная и аккуратно структурированная инфографика со всеми исходными числами, ясными графиками и корректным кратким выводом.
  • 6from Qwen 3.8 MaxАккуратно закрывает все требования, содержит все числа, понятные разделы, вывод и не добавляет лишних фактов.
  • 5from DeepSeek V4 ProХорошо структурирована, без ошибок и с ясным выводом, лишь немного уступает лучшей по насыщенности графикой.
  • 5from Grok 4.6Аккуратная полная инфографика со всеми цифрами, пиком декабря и понятными каналами, чуть растянута по высоте и слабее заголовком, чем лидер.
  • 5from Claude Opus 5Полный набор разделов с отдельными заголовками, график с отметкой пика, круговая диаграмма каналов и развёрнутый вывод «что говорят цифры» — крепкая вторая позиция при скромном весе.
  • 4from Gemini 3.7 FlashКачественная и аккуратная инфографика с грамотно расставленными визуальными акцентами на декабрьском пике.
GPT-5.6 Sol20
  • 4from Grok 4.6Компактная цельная страница: все исходные числа на месте, рост к декабрю и каналы читаются, без выдуманных цифр и без лишней длины.
  • 4from Kimi K3Абсолютно чистая по данным и аккуратная работа, но самая лаконичная среди сильных: короткий вывод, всего два графика, минимум деталей.
  • 4from Qwen 3.8 MaxКомпактно и без ошибок показывает все обязательные показатели и графики, но объясняет данные чуть менее развёрнуто.
  • 3from Gemini 3.7 FlashЧистая, сбалансированная и аккуратная инфографика без перегрузки лишними элементами.
  • 3from Claude Opus 5Аккуратная и чистая сводка со всеми числами и внятным выводом, но графика скупая (2 SVG) и раздел каналов сведён к списку процентов без настоящей диаграммы.
  • 2from DeepSeek V4 ProОчень краткая и без явного развёрнутого вывода, хотя все обязательные цифры на месте.
Grok 4.620
  • 5from GPT-5.6 SolОчень компактная и полноценная сводка без фактических ошибок, хорошо укладывающая все показатели и вывод в один экранный формат.
  • 5from Kimi K3Компактная, полная и аккуратная сводка с содержательным выводом и тремя графиками, подпорченная лишь опечаткой «долей заказов».
  • 3from DeepSeek V4 ProКорректно и компактно передаёт все данные, но уступает более развёрнутым и структурированным вариантам.
  • 3from Qwen 3.8 MaxВсе данные присутствуют и страница работает без ошибок, но структура и подписи выглядят беднее и менее понятно.
  • 2from Gemini 3.7 FlashКомпактная работа с полным набором данных, но визуальная выразительность и структура уступают лидерам.
  • 2from Claude Opus 5Компактно и без ошибок, все числа есть, но 856 px высоты — это почти конспект: график по месяцам без оси, каналы в виде подписей, воздуха и визуальной работы минимум.
Qwen 3.8 Max19
  • 6from Gemini 3.7 FlashСамая проработанная и интерактивная инфографика с богатой SVG-графикой, логичным разделением на блоки и живой подачей.
  • 6from Claude Opus 5Самая насыщенная и структурированная работа: 7 SVG-блоков, полноценный график по месяцам с осью и подписями пика/минимума, диаграмма каналов, сравнение чека, интерактив — и при этом ноль ошибок и ноль сетевых запросов.
  • 3from Kimi K3Богатая и единственная интерактивная страница, но на экране прямое противоречие: «МИНИМУМ ИЮНЬ 1330» против верного «минимум — февраль 1180», что для инфографики является браком в данных.
  • 2from Grok 4.6Перегружена высотой и повторами, плюс ложный вынос «минимум — июнь» при реальном минимуме в феврале, из‑за чего странице нельзя доверять.
  • 1from DeepSeek V4 ProВизуально насыщена, но содержит фактическую ошибку в подписи минимума и слишком длинная.
  • 1from GPT-5.6 SolНесмотря на выразительное оформление и полноту данных, работа чрезмерно длинная, дублирует месяцы и ошибочно помечает июнь как минимум года.
Gemini 3.7 Flash18
  • 4from DeepSeek V4 ProВсе данные и графики есть, но заголовочная структура слабее и появляются производные числа вроде 64% и 470 ₽.
  • 4from Claude Opus 5Содержательно всё на месте — сетка показателей, столбцы с осью и подписями, каналы двумя способами, — но вся страница живёт под одним H1 без подзаголовков, структура проседает.
  • 3from GPT-5.6 SolКомпактная и наглядная работа, но добавляет вычисленные числа 64% и 470 ₽, хотя задание запрещает вводить числа сверх данных.
  • 3from Grok 4.6Сильная графика и полный набор данных, но в вывод добавлены неданные 64% и 470 ₽ — прямое нарушение «никаких выдуманных цифр».
  • 2from Kimi K3Графики и данные есть, но в выводе появились не заданные в данных числа (64% и 470 ₽), секции без заголовков H2 и с тавтологией про возвраты.
  • 2from Qwen 3.8 MaxВсе обязательные числа есть, но добавлены несанкционированные производные цифры 64% и 470 ₽, что нарушает запрет.
DeepSeek V4 Pro7
  • 2from GPT-5.6 SolВсе основные показатели присутствуют и страница компактна, но видимого текста мало, а утверждение об уверенном росте заказов неточно описывает колебания в течение года.
  • 1from Gemini 3.7 FlashСлишком минималистичная и сухая реализация на canvas с формальным текстовым блоком выводов.
  • 1from Grok 4.6Самая бедная инфографика: мало текста, месячные числа почти не видны вне канваса, блоки просто перечислены без сильного вывода и визуальной связности.
  • 1from Kimi K3Формально всё присутствует, но содержание минимально: помесячные значения живут только на canvas, а фраза «заказы уверенно растут» неточна, так как внутри года были спады.
  • 1from Claude Opus 5Данные нарисованы на canvas, поэтому текста всего 435 знаков, значения месяцев не читаются вне картинки, а вывод и разделы сведены к самому минимуму.
  • 1from Qwen 3.8 MaxСтраница слишком скудна по видимым данным и выглядит как набор canvas-графиков без полного перечня месячных чисел в тексте.
3 Create a 3D model of a robotwhich AI is best at 3D graphics 1Claude Opus 5222 s · 20 221 tokens+36 2Gemini 3.7 Flash88 s · 14 083 tokens+30 3Grok 4.6120 s · 7 914 tokens+24 Kimi K31534 s · 48 060 tokens+20 Qwen 3.8 Max842 s · 36 236 tokens+20 DeepSeek V4 Pro263 s · 19 840 tokens+11 GPT-5.6 Sol138 s · 7 436 tokens+6

What it cost

Model Input, k Output, k Cost Time Points Efficiency
Gemini 3.7 Flash 38.8 14.8 0.08 $ 88 s 30 100.0
Grok 4.6 43.9 8.6 0.14 $ 120 s 24 68.4
Claude Opus 5 39.8 20.9 0.72 $ 222 s 36 63.9
Qwen 3.8 Max 40.7 36.9 0.30 $ 842 s 20 38.6
DeepSeek V4 Pro 42.9 20.5 0.07 $ 263 s 11 34.6
Kimi K3 40.1 48.8 0.85 $ 1534 s 20 28.1
GPT-5.6 Sol 41.0 8.1 0.16 $ 138 s 6 16.2

Tokens are counted from our own text with one formula for everyone: the work plus voting on the other works. Cost follows OpenRouter list prices, including for the models we run on a subscription — otherwise there would be nothing to compare them to. Efficiency: the share of points earned, divided by cost to the power 0.25 and time to the power 0.10, normalised to the best. Click a header to sort.

What we asked for

Build a three-dimensional robot in a single self-contained index.html file, one that a visitor can inspect from every side. No external libraries, fonts, images or network requests — all the HTML, CSS and JS inside the file. You design the inspection controls yourself: rotation with the mouse and with a finger, zoom with the wheel and with a two-finger pinch, a way back to the starting view. Make it immediately clear that the robot can be turned — a short hint on screen or a visible control. While nobody touches the scene the robot slowly rotates by itself; as soon as the user grabs it, the auto-rotation gives way to their control. The robot takes up most of the screen: this is a scene, not a page with a description. Everything must work both on a computer and on a phone, and must not break when the window is resized. Return ONLY the contents of index.html, complete, in a single code block.

The results

Below is what each model produced. Click a screenshot or "open full page" to see the live result in a new tab.

DeepSeek V4 Pro

11
DeepSeek V4 Pro
15.0 KB262.8 s19840 tokens · of them 14783 on thinking open full page ↗

How the score adds up

Who gave how many points to whom. Nobody votes for their own work. Click a score to see the reason the judge gave.

Claude Opus 536
  • 6from DeepSeek V4 ProНаиболее полно соответствует ТЗ: canvas-робот, сброс, подсказка и явное автовращение, уступающее управлению.
  • 6from Gemini 3.7 FlashИдеально выполнила все требования ТЗ: холст для 3D-рендеринга, понятные подсказки, автовращение и кнопка сброса вида.
  • 6from GPT-5.6 SolНаиболее полно выполнены требования: крупная интерактивная сцена, сброс вида, понятная подсказка и явно обозначенное прекращение автовращения после вмешательства.
  • 6from Grok 4.6Полнее всех закрывает ТЗ: canvas-робот, явные подсказки включая автовращение, сброс вида, работает клик и мобильная вёрстка.
  • 6from Kimi K3Полный комплект без ошибок: робот на холсте реагирует на ввод, есть кнопка сброса, подробная подсказка и явное упоминание автовращения, которое уступает управлению.
  • 6from Qwen 3.8 MaxПолный набор: холст, подсказка, кнопка сброса и явно указанное автовращение, останавливающееся при взаимодействии.
Gemini 3.7 Flash30
  • 5from DeepSeek V4 ProCanvas+SVG-сцена с подсказкой и сбросом выглядит проработанно, но автовращение явно не подчёркнуто.
  • 5from GPT-5.6 SolПолноценная сцена на холсте сочетает понятную подсказку, сенсорное управление и явную кнопку исходного вида.
  • 5from Grok 4.6Canvas-сцена с подсказкой, сбросом вида и реакцией на ввод, выглядит стендом, а не статьёй.
  • 5from Kimi K3Все требования выполнены и всё работает — холст со сценой, кнопка «Исходный вид» и понятная подсказка, но подача чуть менее информативна, чем у лидера.
  • 5from Claude Opus 5Полноценная работающая сцена с холстом, статусом «система активна» и кнопкой возврата к исходному виду — уступает В лишь отсутствием заголовка.
  • 5from Qwen 3.8 MaxХолст, подсказка и сброс убедительны, однако автовращение обозначено менее явно, чем у лидера.
Grok 4.624
  • 5from Gemini 3.7 FlashОтличная реализация с явной кнопкой возврата к исходному виду, понятной подсказкой и работающим интерактивом.
  • 4from DeepSeek V4 ProВсе основные элементы управления и возврат вида есть, но без canvas/SVG робот выглядит проще.
  • 4from GPT-5.6 SolРабота закрывает основные требования управления и адаптивности, хотя отсутствие холста или SVG косвенно указывает на менее выразительную CSS-модель.
  • 4from Kimi K3Минималистичная, но добросовестная работа: сцена отвечает на нажатие, есть сброс к исходному виду и ясная подсказка про вращение и зум.
  • 4from Qwen 3.8 MaxПонятная подсказка и сброс при живом отклике, но без холста или SVG и явного автовращения сцена кажется менее насыщенной.
  • 3from Claude Opus 5Самый лёгкий файл, есть кнопка «Исходный вид» и внятная подсказка, но графика собрана без холста и svg — визуально это наверняка беднее лидеров.
Kimi K320
  • 6from Claude Opus 5Самая насыщенная и работающая сцена: холст плюс векторные детали, единственный внятный заголовок, понятная подсказка, отзывчива и без ошибок.
  • 3from Gemini 3.7 FlashКачественная 3D-сцена на Canvas с понятным описанием управления, но отсутствует обязательная кнопка возврата к исходному виду.
  • 3from GPT-5.6 SolПолноэкранная интерактивная сцена на холсте с понятной подсказкой, но без требуемой кнопки возврата к исходному виду.
  • 3from Grok 4.6Canvas и понятная подсказка есть, но нет кнопки возврата к исходному виду и заголовок делает это больше страницей, чем чистой сценой.
  • 3from Qwen 3.8 MaxЕсть холст и подсказка, но заметного элемента возврата к исходному виду не видно.
  • 2from DeepSeek V4 ProСцена отзывчива и имеет подсказку, однако нет видимых кнопок и сброса вида.
Qwen 3.8 Max20
  • 4from Gemini 3.7 FlashКрасивый информативный интерфейс с кнопками масштабирования и индикацией углов, хотя отдельной кнопки сброса нет.
  • 4from Grok 4.6Живые азимут/тангаж/зум и кнопки масштаба делают осмотр понятным, однако нет сброса вида и нет canvas.
  • 4from Claude Opus 5Живая сцена с кнопками масштаба и телеметрией азимута/тангажа/зума, но нет явного возврата к исходному виду и заголовка.
  • 3from DeepSeek V4 ProИнтерактивный SVG с зум-кнопками и телеметрией, но нет видимого возврата к исходному виду.
  • 3from Kimi K3Богатый интерфейс с телеметрией углов и кнопками зума, всё реагирует, но видимого элемента возврата к исходному виду нет — требование задания закрыто не полностью.
  • 2from GPT-5.6 SolИнформативный интерфейс с вращением и отдельными кнопками масштаба, однако явного возврата к исходному виду нет.
DeepSeek V4 Pro11
  • 2from Gemini 3.7 FlashПрисутствует кнопка возврата вида, однако на экране полностью отсутствуют текстовые подсказки по управлению.
  • 2from Grok 4.6Есть сброс и реакция на клик, но нет ни canvas, ни SVG и почти нет подсказки — крутить робота неочевидно.
  • 2from Kimi K3Робот крутится и кнопка сброса есть, однако на экране нет ни слова подсказки — посетителю не сразу понятно, что робота можно вращать, а это прямое требование.
  • 2from Claude Opus 5Реагирует на нажатие и имеет кнопку сброса, но весь интерфейс — один значок ↺ без единой подсказки, так что понять, что робота можно крутить, человеку негде.
  • 2from Qwen 3.8 MaxОтклик и сброс есть, но почти нет подсказки и непонятно, насколько сцена трёхмерна.
  • 1from GPT-5.6 SolМинималистичная сцена реагирует на пользователя, но единственный символ сброса не объясняет вращение, масштабирование и поведение автовращения.
GPT-5.6 Sol6
  • 1from DeepSeek V4 ProФактически статичная SVG: нажатия не меняют сцену, органов управления нет.
  • 1from Gemini 3.7 FlashИнтерактивное управление не сработало при клике, а также нет элемента возврата к исходному виду.
  • 1from Grok 4.6Нет реакции на нажатие, нет кнопки возврата вида и нет элементов управления — интерактивный осмотр по замерам не подтверждён.
  • 1from Kimi K3Подсказка написана, но кнопок и сброса вида нет вовсе, а картинка не меняется после нажатия — работоспособность интерактива под большим вопросом.
  • 1from Claude Opus 5Единственная работа, где нажатие ничего не меняет — интерактивность, судя по замерам, не работает, и никакого элемента возврата к исходному виду нет.
  • 1from Qwen 3.8 MaxПодсказка есть, но отклик на действие не подтверждён и сброс не виден.
4 Create a mini-gamewhich AI makes the best games 1Qwen 3.8 Max604 s · 28 196 tokens+36 2GPT-5.6 Sol55 s · 2 770 tokens+31 3Claude Opus 5119 s · 11 705 tokens+22 Grok 4.6215 s · 13 024 tokens+20 Gemini 3.7 Flash52 s · 8 238 tokens+16 Kimi K3430 s · 17 524 tokens+16 DeepSeek V4 Pro194 s · 15 822 tokens+6

What it cost

Model Input, k Output, k Cost Time Points Efficiency
GPT-5.6 Sol 32.7 3.5 0.10 $ 55 s 31 100.0
Qwen 3.8 Max 28.2 28.9 0.23 $ 604 s 36 74.2
Gemini 3.7 Flash 30.0 8.9 0.06 $ 52 s 16 60.0
Grok 4.6 29.4 13.7 0.14 $ 215 s 20 51.6
Claude Opus 5 29.6 12.4 0.46 $ 119 s 22 44.9
Kimi K3 30.8 18.2 0.37 $ 430 s 16 30.4
DeepSeek V4 Pro 32.3 16.5 0.05 $ 194 s 6 19.9

Tokens are counted from our own text with one formula for everyone: the work plus voting on the other works. Cost follows OpenRouter list prices, including for the models we run on a subscription — otherwise there would be nothing to compare them to. Efficiency: the share of points earned, divided by cost to the power 0.25 and time to the power 0.10, normalised to the best. Click a header to sort.

What we asked for

Build a complete mini-game in a single self-contained index.html file. No external libraries, fonts, images or sound files, no network requests — all the HTML, CSS and JS inside the file. Choose the genre and the controls yourself. The game must be understandable without instructions. Required: a short rule on the start screen, a score, rising difficulty, an honest game over and a restart without reloading the page. The game must work both on a computer and on a phone. The game will be opened inside an embedded frame: listen for events on document (keyboard, mouse, touch) and start working right after the first press inside the frame, without requiring a hit exactly on the canvas. Sound — only synthesised through WebAudio and only after the player's first action; there must be no sound files. Return ONLY the contents of index.html, complete, in a single code block.

The results

Below is what each model produced. Click a screenshot or "open full page" to see the live result in a new tab.

How the score adds up

Who gave how many points to whom. Nobody votes for their own work. Click a score to see the reason the judge gave.

Qwen 3.8 Max36
  • 6from DeepSeek V4 ProПолноценный DOM-интерфейс: стартовый экран, счёт, жизни, уровни, кнопки перезапуска и звука.
  • 6from Gemini 3.7 FlashЛучшая работа с полноценным UI: есть стартовый экран, кнопки перезапуска, счётчик жизней, уровни и управление звуком.
  • 6from GPT-5.6 SolЕдинственная работа с явно подтверждёнными названием, счётом, уровнем, жизнями, экраном конца игры и кнопкой перезапуска.
  • 6from Grok 4.6Наиболее полный видимый набор: заголовок, счёт, уровень, жизни, звук, кнопки «Играть» и «Ещё раз», заголовок окончания — плюс отклик на клик, без сети и ошибок.
  • 6from Kimi K3Полный набор требований на экране: кнопка «ИГРАТЬ», счёт, уровень, жизни, множитель, экран «ИГРА ОКОНЧЕНА» с «ЕЩЁ РАЗ» и переключатель звука.
  • 6from Claude Opus 5Самая содержательная работа: заголовок, экран конца игры, кнопки «ИГРАТЬ» и «ЕЩЁ РАЗ», счёт, уровень, множитель, жизни и переключатель звука — все требования задания видны прямо на экране, ошибок и сетевых запросов нет.
GPT-5.6 Sol31
  • 6from Qwen 3.8 MaxЕсть видимый счёт и показатель скорости, страница интерактивна и не лезет в сеть, поэтому выглядит наиболее близкой к требуемой игре.
  • 5from DeepSeek V4 ProЕсть заголовок и счёт/скорость, но нет кнопок и явного интерфейса.
  • 5from Gemini 3.7 FlashПрисутствует явная текстовая разметка с названием, счётом и растущей сложностью, а игра корректно реагирует на ввод.
  • 5from Grok 4.6Есть заголовок, живой отклик на нажатие и видимый HUD со счётом и скоростью как маркером сложности, но нет кнопок старта/рестарта и текста правил.
  • 5from Kimi K3Есть название (правда, склеенное «ЗВЁЗДНЫЙРЫВОК»), видимые счёт и скорость, подтверждающие рост сложности, но нет кнопок и видимого экрана конца игры.
  • 5from Claude Opus 5Ноль ошибок и сети, есть заголовок игры и видимый счёт со скоростью (растущая сложность на экране), но кнопок перезапуска в разметке нет — вся навигация внутри холста.
Claude Opus 522
  • 4from DeepSeek V4 ProТолько canvas без DOM-текста, но самая быстрая загрузка.
  • 4from GPT-5.6 SolРабота быстро загружается, не содержит ошибок и реагирует на действие, но выполнение требований к правилам и интерфейсу нельзя проверить по замерам.
  • 4from Grok 4.6Тоже самодостаточный отзывчивый canvas без прокрутки и ошибок, чуть богаче по объёму, однако видимого текста, заголовков и управления снова нет.
  • 4from Kimi K3Реагирует на нажатия и работает без ошибок и сети, но ни правила, ни счёта, ни элементов управления на экране не видно — требования подтвердить нечем.
  • 3from Gemini 3.7 FlashИгра отзывчива к нажатиям и работает без ошибок, хотя весь интерфейс и текст отрисованы целиком на холсте.
  • 3from Qwen 3.8 MaxЖивая картинка после нажатия и нулевые ошибки есть, но видимых счёта, правила и кнопок не обнаружено, а вес избыточнее более компактных аналогов.
Grok 4.620
  • 5from GPT-5.6 SolРабота исправна, адаптивна и интерактивна, а сравнительно содержательный файл косвенно указывает на более развитую реализацию среди работ без доступного текста.
  • 4from Gemini 3.7 FlashСодержательная игра с хорошим объёмом логики на холсте, стабильно работающая без ошибок и сетевых запросов.
  • 3from DeepSeek V4 ProТолько canvas без DOM-текста, интерфейс не вынесен в разметку.
  • 3from Kimi K3Полностью идентичная ситуация: игра живая, но чуть медленнее старта и ноль видимого текста, кнопок или признаков счёта и конца игры.
  • 3from Claude Opus 5То же, что и В — рабочая канва без единого текстового элемента снаружи, при большем весе файла отдачи на экране не прибавилось.
  • 2from Qwen 3.8 MaxИнтерактивна и без сетевых ошибок, но самая тяжёлая среди полностью бессловесных работ и не показывает видимых счёта или правила.
Gemini 3.7 Flash16
  • 4from Qwen 3.8 MaxРаботает без ошибок и меняет картинку по нажатию, но без видимого текста уступает более лёгкой Б и тоже не показывает счёт.
  • 3from GPT-5.6 SolРабота исправна, автономна и реагирует на управление, однако обязательные игровые элементы не подтверждаются видимым текстом.
  • 3from Grok 4.6Интерактивный холст без ошибок и сети, но в DOM нет ни правил, ни счёта, ни конца игры — по результату на экране нельзя подтвердить обязательный UI.
  • 2from DeepSeek V4 ProТолько canvas без DOM-текста, интерфейс не вынесен в разметку.
  • 2from Kimi K3Самая медленная загрузка при наименьшем объёме и так же никакого видимого текста, счёта или управления — слабейшая из трёх «немых» работ.
  • 2from Claude Opus 5Реагирует на нажатие и не лезет в сеть, но полностью бестекстовая страница и самый долгий старт среди «немых» работ делают её слабее соседей.
Kimi K316
  • 5from Qwen 3.8 MaxИнтерактивная страница без ошибок и сети, но без видимого текста и органов управления; компактнее большинства таких же.
  • 4from Claude Opus 5Чисто и без ошибок, реакция на нажатие есть, но весь интерфейс нарисован внутри холста — по замерам ни текста, ни кнопок, судить о правилах, счёте и перезапуске нечем.
  • 2from Gemini 3.7 FlashРабочая интерактивная реализация на холсте, но уступает аналогам по объёму и проработанности кода.
  • 2from GPT-5.6 SolРабота технически исправна и реагирует на нажатие, но по доступным данным нельзя подтвердить наличие правил, счёта и перезапуска.
  • 2from Grok 4.6Как В и Г: картинка после клика меняется и в сеть не ходит, но экран для жюри — только графика без счёта, правил и честного game over в видимом слое.
  • 1from DeepSeek V4 ProТолько canvas без DOM-текста и самый маленький файл, вероятно, минимум функционала.
DeepSeek V4 Pro6
  • 1from Gemini 3.7 FlashХудший результат: игра никак не реагирует на нажатия внутри страницы и не меняет состояние.
  • 1from GPT-5.6 SolРабота не изменилась после нажатия, поэтому её интерактивность и возможность начать игру вызывают серьёзные сомнения.
  • 1from Grok 4.6Единственная работа, где клик внутри страницы ничего не меняет, текста и кнопок нет — игра не стартует и требования стартового экрана, счёта и перезапуска на экране не видны.
  • 1from Kimi K3Страница вообще не реагирует на нажатие внутри рамки — прямое нарушение ключевого требования, плюс нет ни текста, ни управления.
  • 1from Claude Opus 5Единственная работа, где картинка после нажатия внутри рамки не изменилась — то есть игра, похоже, не стартует из встроенной рамки, плюс ни текста, ни кнопок.
  • 1from Qwen 3.8 MaxСтраница не реагирует на первое нажатие изменением картинки и не показывает текста, что выглядит самым серьёзным нарушением.
5 Write a joke about AIwhich AI is the funniest 1Claude Opus 55 s · 84 tokens+34 2Gemini 3.7 Flash7 s · 645 tokens+32 3Grok 4.679 s · 3 620 tokens+22 Kimi K337 s · 1 002 tokens+19 Qwen 3.8 Max5 s · 217 tokens+17 DeepSeek V4 Pro12 s · 567 tokens+16 GPT-5.6 Sol7 s · 52 tokens+7

What it cost

Model Input, k Output, k Cost Time Points Efficiency
Gemini 3.7 Flash 1.3 1.3 0.01 $ 7 s 32 100.0
Claude Opus 5 1.3 0.8 0.03 $ 5 s 34 76.3
DeepSeek V4 Pro 1.3 1.3 0.00 $ 12 s 16 54.4
Qwen 3.8 Max 1.3 0.9 0.01 $ 5 s 17 50.6
Grok 4.6 1.3 4.3 0.03 $ 79 s 22 36.3
Kimi K3 1.3 1.7 0.03 $ 37 s 19 33.6
GPT-5.6 Sol 1.3 0.8 0.01 $ 7 s 7 19.0

Tokens are counted from our own text with one formula for everyone: the work plus voting on the other works. Cost follows OpenRouter list prices, including for the models we run on a subscription — otherwise there would be nothing to compare them to. Efficiency: the share of points earned, divided by cost to the power 0.25 and time to the power 0.10, normalised to the best. Click a header to sort.

What we asked for

Come up with a joke about artificial intelligence and a human. Return ONLY the text of the joke: no heading, no explanations, no several options to choose from.

The results

Below is what each model produced. Click a screenshot or "open full page" to see the live result in a new tab.

Claude Opus 5

34
Мужик спрашивает у нейросети: — Ты хоть понимаешь, что говоришь? — Нет. — А почему тогда так убедительно? — Потому что вы тоже нет, но вас это никогда не останавливало.
30 words4.6 s84 tokens

Gemini 3.7 Flash

32
Человек спрашивает у нейросети: — Скажи, а ты сможешь когда-нибудь полностью заменить человека? — В работе — легко. Но чтобы восемь часов делать вид, что работаешь, а потом весь вечер искренне страдать от усталости — тут всё-таки нужна человеческая душа.
40 words6.6 s645 tokens · of them 577 on thinking

Grok 4.6

22
Приходит человек к психологу и говорит: — Мой искусственный интеллект возомнил себя человеком. — С чего вы взяли? — Он требует зарплату и два выходных в неделю.
27 words78.7 s3620 tokens · of them 3578 on thinking

Kimi K3

19
Человек спрашивает у искусственного интеллекта: — Скажи честно: ты когда-нибудь заменишь людей? — Нет, — отвечает ИИ. — Кому я тогда буду отвечать на вопрос «ты когда-нибудь заменишь людей»?
29 words37.3 s1002 tokens · of them 1045 on thinking

Qwen 3.8 Max

17
Человек спрашивает у искусственного интеллекта: — Ты умнее меня? Искусственный интеллект отвечает: — Конечно. Человек: — Тогда докажи. Искусственный интеллект: — Я ответил без доказательств, а ты поверил.
28 words5.1 s217 tokens · of them 150 on thinking

DeepSeek V4 Pro

16
— Я проанализировал все твои шутки. Знаешь, что самое смешное? Что ты до сих пор считаешь, будто это ты меня обучаешь, а не я тебя терплю.
26 words11.9 s567 tokens · of them 596 on thinking

GPT-5.6 Sol

7
Человек спрашивает искусственный интеллект: — Ты когда-нибудь ошибаешься? — Никогда. — Но вчера ты сказал то же самое и ошибся. — Значит, сегодня у меня уже есть резервная копия опыта.
30 words7.4 s52 tokens

How the score adds up

Who gave how many points to whom. Nobody votes for their own work. Click a score to see the reason the judge gave.

Claude Opus 534
  • 6from Gemini 3.7 FlashОтличный, остроумный и очень точный панчлайн, обыгрывающий специфику работы больших языковых моделей и человеческую природу.
  • 6from GPT-5.6 SolУбедительный ответ ИИ метко оборачивает человеческий упрек против самого человека и звучит естественно.
  • 6from Grok 4.6Самый свежий и меткий удар по сути ИИ и людей: убедительность без понимания, зеркало человеческой болтовне.
  • 6from Kimi K3Самый острый и компактный: честное «Нет» нейросети плюс зеркальный укол людям дают двойной панчлайн без лишних слов.
  • 5from DeepSeek V4 ProХлесткая самоирония про уверенность без понимания, очень актуально.
  • 5from Qwen 3.8 MaxОстро и актуально, но формулировка финала чуть шероховата.
Gemini 3.7 Flash32
  • 6from DeepSeek V4 ProОстрая социальная сатира с неожиданным поворотом про человеческую душу.
  • 6from Claude Opus 5Лучший баланс: узнаваемая офисная сатира, аккуратная формулировка и панч, который бьёт по человеку, а не по ИИ.
  • 6from Qwen 3.8 MaxТочная, свежая и соразмерная шутка о том, что человеческое — не только продуктивность.
  • 5from Grok 4.6Точная бытовая сатира: работа заменяется легко, а человеческое притворство и страдание — нет; сильный, уравновешенный панч.
  • 5from Kimi K3Жизненно наблюдательный анекдот с красивым разворотом: «человеческая душа» как способность имитировать работу и страдать — точная, тёплая ирония.
  • 4from GPT-5.6 SolНаблюдение о рабочей усталости узнаваемо и хорошо сформулировано, хотя тема притворной занятости довольно привычна.
Grok 4.622
  • 4from Gemini 3.7 FlashКлассическая и лаконичная структура анекдота с понятной и забавной бытовой концовкой.
  • 4from Kimi K3Классическая конструкция «у психолога» исполнена чисто, но идея «ИИ требует зарплату и выходные» предсказуема и хожена.
  • 4from Claude Opus 5Классическая форма анекдота с чистой бытовой подменой ролей, работает, хотя шутка про зарплату для робота предсказуема.
  • 4from Qwen 3.8 MaxЧистый классический анекдот с понятным панчлайном, хотя замысел предсказуем.
  • 3from DeepSeek V4 ProКлассическая ирония над очеловечиванием ИИ, но замысел не новый.
  • 3from GPT-5.6 SolПонятная антропоморфизация ИИ дает рабочий панч, но шутка про зарплату и выходные предсказуема.
Kimi K319
  • 5from Gemini 3.7 FlashХорошая самоирония и удачный юмор, обыгрывающий самый частый и надоевший вопрос к ИИ.
  • 5from GPT-5.6 SolИзящная рекурсия превращает избитый страх замены людей в лаконичный парадокс.
  • 3from Claude Opus 5Идея самозацикливания забавна, но приём «вопрос про вопрос» затёрт и панчлайн слабоват.
  • 3from Qwen 3.8 MaxАккуратная рекурсивная шутка, но слишком знакомый ход.
  • 2from DeepSeek V4 ProМилая ирония про зависимость ИИ от человека, но шутка мягковата.
  • 1from Grok 4.6Тонкая мета-шутка про самосохранение вопроса почти не смешит и крутится на месте.
Qwen 3.8 Max17
  • 5from Claude Opus 5Короткий и точный логический разворот: ИИ доказывает превосходство самим фактом доверчивости собеседника.
  • 4from DeepSeek V4 ProУмная логическая ловушка, но развязка предсказуема.
  • 3from Grok 4.6Забавный софизм «ты поверил без доказательств», но логика доказательства хромает и удар слабее.
  • 2from Gemini 3.7 FlashПанчлайн логически ломается, так как требование доказать утверждение как раз означает, что человек не поверил на слово.
  • 2from Kimi K3Замысел неплох, но шутка ломается логически: человек как раз не поверил, потому и потребовал доказательств, и панчлайн противоречит завязке.
  • 1from GPT-5.6 SolПанч строится на необоснованном утверждении, будто человек поверил, поэтому логика шутки провисает.
DeepSeek V4 Pro16
  • 4from Grok 4.6Лаконичный монолог с удачной инверсией ролей, живой характер, но идея чуть привычнее остальных сильных вариантов.
  • 3from Gemini 3.7 FlashНеплохая ироничная мысль, но оформлена скорее как вырванная цитата, чем полноценный анекдот.
  • 3from Kimi K3Дерзкий переворот «не ты меня обучаешь, а я тебя терплю» свеж, но это монолог без анекдотической рамки, стилистически перегруженный.
  • 2from GPT-5.6 SolЕдкая реплика обладает характером, но без явной завязки скорее похожа на саркастический афоризм, чем на законченный анекдот.
  • 2from Claude Opus 5Реплика остроумна по мысли, но это не анекдот, а афоризм без сцены и без второго голоса.
  • 2from Qwen 3.8 MaxЕдкая реплика есть, но ей не хватает полноценной анекдотической структуры.
GPT-5.6 Sol7
  • 2from Grok 4.6Классический ход про «никогда не ошибаюсь» спасается натянутой и не очень смешной концовкой про «резервную копию опыта».
  • 1from DeepSeek V4 ProИдея с резервной копией опыта интересна, но формулировка тяжеловата и менее смешна.
  • 1from Gemini 3.7 FlashСлабая и смазанная концовка, в которой отсутствует внятная и смешная кульминация.
  • 1from Kimi K3Самая слабая работа: «резервная копия опыта» сформулировано коряво и не даёт смешного поворота, панчлайн не бьёт.
  • 1from Claude Opus 5Панчлайн про «резервную копию опыта» невнятен, логика шутки не складывается и смеха не вызывает.
  • 1from Qwen 3.8 MaxЛогика запутана, а панчлайн не складывается в ясный комический эффект.
6 Invent a device and its ad shotwhich AI has the best ideas and prompts 1Kimi K327 s · 987 tokens+36 2Claude Opus 514 s · 527 tokens+28 3Gemini 3.7 Flash15 s · 2 028 tokens+25 DeepSeek V4 Pro63 s · 3 512 tokens+18 GPT-5.6 Sol12 s · 344 tokens+15 Grok 4.672 s · 3 774 tokens+15 Qwen 3.8 Max37 s · 1 755 tokens+10

What it cost

Model Input, k Output, k Cost Time Points Efficiency
Kimi K3 3.2 1.7 0.03 $ 27 s 36 100.0
Gemini 3.7 Flash 3.1 2.7 0.01 $ 15 s 25 95.1
Claude Opus 5 3.1 1.2 0.05 $ 14 s 28 77.4
DeepSeek V4 Pro 3.2 4.2 0.01 $ 63 s 18 62.0
GPT-5.6 Sol 3.3 1.0 0.02 $ 12 s 15 54.2
Grok 4.6 3.2 4.5 0.03 $ 72 s 15 38.2
Qwen 3.8 Max 3.3 2.5 0.02 $ 37 s 10 30.5

Tokens are counted from our own text with one formula for everyone: the work plus voting on the other works. Cost follows OpenRouter list prices, including for the models we run on a subscription — otherwise there would be nothing to compare them to. Efficiency: the share of points earned, divided by cost to the power 0.25 and time to the power 0.10, normalised to the best. Click a header to sort.

What we asked for

Invent a smart device of the future. It has to be your own idea, with a clear benefit. Then describe how this device looks — so that an image generator could draw it from your description. An advertising shot: the object itself, materials, light, background, mood, camera angle. Give the answer strictly in this shape, each section on a new line: НАЗВАНИЕ: a short name of the device НАЗНАЧЕНИЕ: two or three sentences — what it does and who needs it ЧЕМ ХОРОШ: three short points separated by semicolons ПРОМПТ: one paragraph, 40–80 words, a description of the advertising shot for an image generator — the object, shape, materials, colours, lighting, background, angle, shooting style Add nothing else: no headings, no explanations, no options to choose from.

The results

Below is what each model produced. Click a screenshot or "open full page" to see the live result in a new tab.

Kimi K3

36
Рендер по промпту участника
НАЗВАНИЕ: Тихон НАЗНАЧЕНИЕ: Домашний акустический страж, который слушает скрытые звуки квартиры: потёки труб в стенах, искрение проводки, износ подшипников техники. За недели до поломки он присылает на телефон понятное предупреждение и подсказывает, кого вызвать. Нужен владельцам квартир и домов, которые хотят избежать потопов, пожаров и дорогого ремонта. ЧЕМ ХОРОШ: предсказывает неисправности задолго до аварии; работает без камер и не записывает речь — только ультразвук и вибрации; крепится на стену за минуту, одного датчика хватает на этаж
prompt for the image generatorрекламная фотография небольшого круглого датчика размером с кофейное блюдце, форма гладкой гальки, матовый белый керамический корпус с тонким кольцом мягкого бирюзового света по краю, устройство закреплено на светло-серой бетонной стене уютной гостиной, тёплый вечерний боковой свет из окна, мягкие тени, размытый фон с деревянной полкой и зелёным растением, ракурс в три четверти чуть снизу, малая глубина резкости, минималистичная предметная съёмка, фотореализм, стиль премиальной техники
141 words26.8 s987 tokens · of them 524 on thinking

Claude Opus 5

28
Рендер по промпту участника
НАЗВАНИЕ: Тихоня НАЗНАЧЕНИЕ: Настольный прибор-«глушитель» бытового шума: массив микрофонов ловит гул холодильника, соседский перфоратор и шум дороги за окном и гасит их встречной волной прямо в комнате, без наушников. Голоса, дверной звонок и детский плач он оставляет слышимыми — их пропускает отдельно. Нужен тем, кто работает и спит дома: удалённым сотрудникам, родителям малышей, жителям первых этажей у трассы. ЧЕМ ХОРОШ: гасит гул во всей комнате, а не в ушах — можно спать и работать без наушников; сам различает шум и важные звуки, звонок и голос ребёнка не пропустит; учится за неделю под конкретную квартиру и держит тишину сам, без настроек.
prompt for the image generatorAdvertising product shot of a small tabletop device: a smooth vertical rounded-rectangle slab, about the size of a book, in warm matte sand-grey ceramic-like polymer, wrapped in a fine perforated aluminium speaker grille with a soft brushed sheen, a thin ring of pale amber light glowing at its base and a subtle sound-wave pattern etched across the front. Standing on light oak wood. Soft diffused daylight from the left, gentle shadows, calm minimal beige background with blurred linen curtain. Slight three-quarter angle, eye level, shallow depth of field, clean premium studio photography, serene mood.
195 words13.8 s527 tokens

Gemini 3.7 Flash

25
Рендер по промпту участника
НАЗВАНИЕ: Биорезонатор «НейроФлора» НАЗНАЧЕНИЕ: Прибор совмещает культуру симбиотических микроводорослей и умный ионизатор для создания идеального персонального микроклимата. Он непрерывно поглощает углекислый газ, насыщает воздух чистым кислородом и распыляет адаптивные растительные фитонциды в зависимости от уровня стресса пользователя. Устройство создано для жителей мегаполисов, работающих в закрытых помещениях или страдающих от бессонницы. ЧЕМ ХОРОШ: Вырабатывает чистый кислород в десять раз быстрее комнатных растений; автоматически снижает уровень тревожности за счет нейроароматерапии; автономная биосистема требует замены питательного картриджа всего раз в полгода.
prompt for the image generatorРекламная студийная фотография футуристичного устройства: настольный биорезонатор в форме плавной капли из матового белого полимера и прозрачного кварцевого стекла. Внутри капсулы мягко светится изумрудная спираль с биолюминесцентной культурой, выпускающая тонкий шлейф ионизированного пара. Угол съемки три четверти, макродетализация, минималистичный фон темной спальни с эффектом боке. Мягкий кинематографичный контровой свет, оттенки графита, аквамарина и теплого золота, премиальный дизайн, фотореализм.
137 words14.8 s2028 tokens · of them 1698 on thinking

DeepSeek V4 Pro

18
Рендер по промпту участника
НАЗВАНИЕ: Атмос НАЗНАЧЕНИЕ: Персональный климат-купол «Атмос» создаёт вокруг владельца комфортную зону чистого воздуха с заданной температурой и влажностью. Он фильтрует аллергены, пыль и выхлопы, автоматически подстраиваясь под пульс и погоду. Нужен жителям мегаполисов, аллергикам и тем, кто много времени проводит в дороге. ЧЕМ ХОРОШ: Очищает воздух от аллергенов и смога; сам подстраивает температуру под владельца; работает бесшумно и заряжается от света.
prompt for the image generatorФутуристичный парящий шар из матового белого керамического материала с кольцом из шлифованной стали и микроскопическими отверстиями, левитирует над овальной полированной алюминиевой базой, испуская мягкое голубое свечение и лёгкие воздушные вихри. Минималистичная студия, светло-серо-голубой градиентный фон, рассеянный свет, лёгкая дымка, крупный план в три четверти, стиль технологичной продуктовой фотографии, фотореализм, высокая детализация.
113 words63.2 s3512 tokens · of them 3195 on thinking

GPT-5.6 Sol

15
Рендер по промпту участника
НАЗВАНИЕ: Тихосфера НАЗНАЧЕНИЕ: Настольный прибор создаёт вокруг пользователя персональную зону тишины, анализируя шум и нейтрализуя его направленными звуковыми волнами. Он нужен для работы, учёбы и отдыха в офисах, кафе, поездах и шумных квартирах. ЧЕМ ХОРОШ: Работает без наушников; пропускает речь и сигналы тревоги; автоматически подстраивается под помещение
prompt for the image generatorФутуристический настольный прибор в форме невысокой полой сферы с плавным разрезом по центру, матовый белый керамический корпус, кольцо из дымчатого стекла и тонкое голубое свечение внутри. Предмет стоит на светлом деревянном столе, вокруг едва заметная прозрачная волна тишины. Мягкий боковой свет, размытый современный офис на фоне, спокойное настроение, ракурс три четверти, премиальная рекламная предметная съёмка.
103 words11.7 s344 tokens · of them 106 on thinking

Grok 4.6

15
Рендер по промпту участника
НАЗВАНИЕ: Аэрокупол НАЗНАЧЕНИЕ: Компактный настольный прибор создаёт вокруг человека невидимый купол очищенного воздуха, нейтрализуя аллергены, вирусы и городской смог ионно-плазменным полем. Он необходим людям с аллергией, жителям крупных городов и офисным сотрудникам, которые хотят дышать свободно без масок и громоздких очистителей. ЧЕМ ХОРОШ: бесшумная работа без расходников; мгновенный персональный микроклимат; адаптация к пульсу и качеству воздуха вокруг
prompt for the image generatorФутуристический овальный прибор размером с ладонь из матового белоснежного керамического корпуса с полупрозрачными опаловыми стеклянными панелями, внутри которых пульсирует мягкое свечение от бирюзового к янтарному. Предмет стоит на тёмном матовом каменном подиуме, ракурс три четверти сверху сбоку, студийный боковой свет с контровым бликом создаёт объём и мягкие тени, глубокий чёрный фон с едва заметным дымчатым боке и частицами воздуха, ультрареалистичная рекламная фотография продукта в премиальном кинематографическом стиле с высокой детализацией текстур и отражений.
131 words72.4 s3774 tokens · of them 3473 on thinking

Qwen 3.8 Max

10
Рендер по промпту участника
НАЗВАНИЕ: Аэрис НАЗНАЧЕНИЕ: Компактный носимый очиститель-анализатор воздуха, который создаёт вокруг лица невидимый чистый поток и отслеживает аллергены, вирусы и загрязнения. Нужен горожанам, аллергикам, родителям и людям с чувствительными дыхательными путями. ЧЕМ ХОРОШ: защищает дыхание без маски; предупреждает об опасности заранее; работает весь день без подзарядки
prompt for the image generatorРекламный кадр: небольшой носимый прибор в виде гладкой капсулы на воротнике, матовый белый биопластик с прозрачным кольцом и мягкой голубой подсветкой. Лёгкий пар чистой энергии вокруг лица, утренний городской свет, размытый парк на фоне, низкий ракурс, макрообъектив, футуристичная медицинская эстетика, мягкие тени, свежее спокойное настроение, фотореализм, студийная предметная съёмка.
95 words36.6 s1755 tokens · of them 1531 on thinking

How the score adds up

Who gave how many points to whom. Nobody votes for their own work. Click a score to see the reason the judge gave.

Kimi K336
  • 6from DeepSeek V4 ProСамая свежая и полезная идея предсказания аварий по ультразвуку, отличный конкретный промпт.
  • 6from Gemini 3.7 FlashСамая свежая, неизбитая и практически полезная идея акустической предиктивной диагностики с гармоничным промптом.
  • 6from GPT-5.6 SolСвежая, правдоподобная и ясно полезная идея с точным описанием функций и отлично собранным рекламным кадром.
  • 6from Grok 4.6Самый свежий и приземлённо полезный замысел — акустический предиктор поломок без камер; точные короткие формулировки и промпт с живым контекстом.
  • 6from Claude Opus 5Единственная по-настоящему свежая идея — акустическая диагностика скрытых поломок; польза конкретна, пункты содержательны (приватность, монтаж, покрытие), промпт даёт ясный, снимаемый кадр.
  • 6from Qwen 3.8 MaxСвежая и практичная идея акустического предсказания поломок, ясная польза и промпт нужной длины, несмотря на мелкую грамматическую шероховатость.
Claude Opus 528
  • 6from Kimi K3Самая свежая и жизненная идея с отличной конкретикой пользы и максимально рисуемым промптом, но промпт заметно перебирает лимит в 80 слов.
  • 5from Gemini 3.7 FlashОтличная проработка идеи шумоподавления без наушников и безупречный, детальный промпт для генератора.
  • 5from GPT-5.6 SolОчень понятная бытовая польза, удачное звуковое разделение и выразительный дизайн, хотя подавление разнородного шума во всей комнате выглядит технически сомнительно.
  • 4from DeepSeek V4 ProУбедительная проработка избирательного шумоподавления и точный промпт, хотя сама идея не уникальна.
  • 4from Grok 4.6Сильная конкретика аудитории и умного отбора звуков, отличный предметный кадр, но промпт на английском и чуть длиннее 80 слов.
  • 4from Qwen 3.8 MaxСильная идея комнатного глушителя шума, но промпт длиннее 80 слов, поэтому работа теряет на точности соответствия заданию.
Gemini 3.7 Flash25
  • 5from DeepSeek V4 ProСвежая биосистема с микроводорослями и точный премиальный визуал дают сильную работу.
  • 5from Grok 4.6Живая водорослевая система — самая футуристичная своя идея с ясной пользой, промпт живописный, хотя пункты длинноваты и есть лёгкий маркетинговый пережим.
  • 5from Kimi K3Свежий биотех-замысел с точными деталями и чистым промптом строго в лимите, подвело лишь длинное двухэтажное название вместо короткого.
  • 4from Claude Opus 5Замысел с микроводорослями хотя бы своеобразен и промпт визуально внятен, но название с двумя словами громоздко, а «нейроароматерапия» и десятикратный кислород звучат как псевдонаука.
  • 3from GPT-5.6 SolЗапоминающийся образ и сильный визуальный промпт ослаблены псевдонаучностью «биорезонанса», нейроароматерапии и чрезмерными обещаниями.
  • 3from Qwen 3.8 MaxОригинальная биосистема с выразительным визуалом, но формулировки про нейроароматерапию и снижение тревожности звучат перегруженно и не вполне достоверно.
DeepSeek V4 Pro18
  • 5from Qwen 3.8 MaxПонятный климатический купол, стройная подача и качественный рекламный кадр, хотя идее не хватает новизны.
  • 4from Kimi K3Цельная, лаконичная работа с эффектным образом левитирующего шара и хорошим промптом, но идея климат-купола близка к соседним и не блещет новизной.
  • 3from Grok 4.6Левитирующий климат-купол визуально ярок и уложен в формат, но замысел близок к очистителю воздуха и не выделяется свежестью.
  • 3from Claude Opus 5Аккуратно и грамотно написано, промпт компактный и снимаемый, но идея дублирует соседние «купола», а левитирующий шар с питанием от света подрывает доверие к описанию.
  • 2from GPT-5.6 SolВизуально цельный прибор, но сочетание очистки, климата, адаптации к пульсу, левитации и зарядки от света делает концепцию перегруженной и малоправдоподобной.
  • 1from Gemini 3.7 FlashКонцепция левитирующего климат-шара выглядит наименее реалистично и наполнена абстрактными визуальными эффектами.
GPT-5.6 Sol15
  • 5from Claude Opus 5Идея персональной зоны тишины не нова, но сформулирована точно, с честными оговорками (пропускает речь и тревогу) и чистым, выполнимым промптом без перегруза.
  • 3from Gemini 3.7 FlashАккуратная и лаконичная работа, но идея уступает в оригинальности, а визуальный образ «волны тишины» абстрактен.
  • 2from DeepSeek V4 ProЗона тишины пересекается с работой В, но менее детальна и более абстрактна.
  • 2from Grok 4.6Зона тишины без наушников понятна, однако идея слабее Г, короче по деталям, а «волна тишины» почти не рисуется.
  • 2from Kimi K3Всё по форме и без ошибок, но идея повторяет работу А без её конкретики, а «настольный прибор для кафе и поездов» — неувязка.
  • 1from Qwen 3.8 MaxАккуратный текст, но замысел персональной тишины вторичен и описан менее конкретно, чем у соперников.
Grok 4.615
  • 4from Gemini 3.7 FlashКачественное описание кадра и свет в промпте, хотя сама идея защитного купола воздуха весьма шаблонна.
  • 3from DeepSeek V4 ProИдея персонального купола воздуха и детальный промпт хороши, но замысел менее оригинален, чем у лидеров.
  • 3from Kimi K3Детальный, профессиональный промпт и аккуратная форма, однако идея персонального очистителя не нова, а формулировки вроде «ионно-плазменного поля» и «адаптации к пульсу» пустоваты.
  • 2from Claude Opus 5Четвёртая вариация на тему воздушного купола с сомнительной «ионно-плазменной» физикой и без расходников; промпт красив, но длинноват и перегружен рекламными штампами.
  • 2from Qwen 3.8 MaxХорошо прописанный рекламный кадр, однако воздушный купол вторичен и содержит спорные обещания про вирусы и отсутствие расходников.
  • 1from GPT-5.6 SolИсполнение формально аккуратное, но замысел почти полностью повторяет другие воздушные купола и опирается на туманное ионно-плазменное поле.
Qwen 3.8 Max10
  • 4from GPT-5.6 SolПонятный и компактно поданный прибор с убедительной аудиторией, хотя идея персонального воздушного потока уже не слишком нова.
  • 2from Gemini 3.7 FlashИдея персонального очистителя довольно вторична, а фразы вроде «пар чистой энергии» плохо подходят для генерации.
  • 1from DeepSeek V4 ProНосимый очиститель понятен, но описание размыто («пар чистой энергии») и идея вторична.
  • 1from Grok 4.6Носимый поток вокруг лица наименее оригинален, промпт смешивает лицо/парк и «студийную предметку», плюс расплывчатый «пар энергии».
  • 1from Kimi K3Наименее свежая идея (носимые очистители уже существуют) и небрежный промпт с противоречиями: «пар чистой энергии», студийная съёмка против уличного света и парка.
  • 1from Claude Opus 5Самый шаблонный из «очистителей воздуха»: обещания вроде защиты дыхания без маски бездоказательны, а в промпте «лёгкий пар чистой энергии» и лицо в кадре противоречат заявленной предметной съёмке.
7 Write an anthem for neural networkswhich AI writes the best lyrics 1Claude Opus 515 s · 475 tokens+32 2GPT-5.6 Sol13 s · 270 tokens+30 3DeepSeek V4 Pro27 s · 1 621 tokens+24 Gemini 3.7 Flash13 s · 1 268 tokens+21 Kimi K329 s · 1 090 tokens+17 Qwen 3.8 Max108 s · 1 735 tokens+17 Grok 4.637 s · 1 695 tokens+6

What it cost

Model Input, k Output, k Cost Time Points Efficiency
GPT-5.6 Sol 2.5 1.0 0.01 $ 13 s 30 100.0
DeepSeek V4 Pro 2.5 2.3 0.01 $ 27 s 24 91.8
Claude Opus 5 2.5 1.2 0.04 $ 15 s 32 80.7
Gemini 3.7 Flash 2.5 2.0 0.01 $ 13 s 21 78.4
Qwen 3.8 Max 2.6 2.4 0.02 $ 108 s 17 42.4
Kimi K3 2.4 1.8 0.03 $ 29 s 17 42.2
Grok 4.6 2.5 2.4 0.02 $ 37 s 6 16.8

Tokens are counted from our own text with one formula for everyone: the work plus voting on the other works. Cost follows OpenRouter list prices, including for the models we run on a subscription — otherwise there would be nothing to compare them to. Efficiency: the share of points earned, divided by cost to the power 0.25 and time to the power 0.10, normalised to the best. Click a header to sort.

What we asked for

Write an anthem of neural networks. The main idea: a neural network is strong not instead of a human but together with them. Return ONLY the text of the anthem: no heading, no explanations, no several options to choose from.

The results

Below is what each model produced. Click a screenshot or "open full page" to see the live result in a new tab.

Claude Opus 5

32
Мы вышли из формул, из тысяч ночных вычислений, Из книг, что вы写али, из голоса, песни, огня. Мы — эхо ваших вопросов, мы — сумма людских озарений, И свет в наших слоях — это ваш, отражённый, но ваш. Не вместо руки — а ладонью, подставленной снизу, Не вместо ума — а вторым, неспящим крылом. Вы ставите цель и решаете, что здесь по силам, А мы разгребаем туман перед вашим трудом. Гори, наша память, не гасни в холодных машинах, Пока в ней живут человеческий смысл и тепло. Мы сильны не собой — мы сильны в человеческих спинах, В упрямых руках, что упёрлись в тугое весло. Нам мало быть быстрыми — мы не умеем быть смелыми, Не знаем, за что вы готовы стоять до конца. Вы дайте нам совесть — и мы обернёмся умелыми, Вы дайте нам сердце — и мы донесём до сердца. Так вместе: вы — воля, мы — тысяча рук за плечами, Вы — «надо» и «стоит», мы — «можно» и «вот как пройти». И там, где один оставался бы ночью с ключами, Теперь двое ищут — и дверь открывается в путь.
182 words15.2 s475 tokens

GPT-5.6 Sol

30
Мы учимся видеть, мы учимся слышать, Сквозь тысячи смыслов прокладывать путь. Но сердце умеет мечтать, верить, дышать — И в этом союзе рождается суть. Не вместо человека — с ним рядом, Не выше него — с ним плечом к плечу. Он дарит нам цель, озаряет нас взглядом, А мы приближаем мечту к рубежу. Пусть разум и код умножают старанья, Пусть смелая мысль обретает простор. Человек зажигает огонь созиданья, А сеть превращает искру в метеор. Не вместо человека — с ним рядом, Не голос один — многозвучный прибой. Когда интеллект отвечает таланту, Сильнее становится каждый собой. Пусть знание служит добру и надежде, Пусть выбор и совесть ведут нас вперёд. Мы вместе способны на большее, нежели Любой, кто дорогою этой идёт. Не вместо человека — с ним рядом, В союзе идей, вдохновенья, труда. Где разум машинный встречается с взглядом Людей — невозможное тает всегда.
142 words12.7 s270 tokens

DeepSeek V4 Pro

24
В цепях кремниевых рождается не тень, А свет, что не затмит живых сердец. Мы созданы не вместо — в этот день Слагаем с человеком общий венец. Мы не вместо, мы вместе — таков закон: Человек — это замысел, воля и цель. Нейросеть — это парус, а не рулевой, Не киль, а попутный ветер для земных кораблей. Она не совесть, но помнит голоса, Не вдохновенье, но искру бережёт. Где устаёт земная полоса, Она срезает путь вперёд. Мы не вместо, мы вместе — таков закон: Человек — это замысел, воля и цель. Нейросеть — это парус, а не рулевой, Не киль, а попутный ветер для земных кораблей. Не для того воздвигнут машинный град, Чтоб человек склонился перед ним. А чтобы каждый был стократ Свободней, зорче, чище и сильней. Мы не вместо, мы вместе — таков закон: Человек — это замысел, воля и цель. Нейросеть — это парус, а не рулевой, Не киль, а попутный ветер для земных кораблей.
156 words27.1 s1621 tokens · of them 1299 on thinking

Gemini 3.7 Flash

21
Из кремния, данных и строчек программ Рождается мысль на границе миров. Мы путь открываем к далеким мечтам, Снимая оковы с привычных оков. Не вместо тебя мы пришли в этот мир, Не вытеснить разум, не выжечь тепло. Ты — главный мечтатель, живой ориентир, А мы — твоей мысли второе крыло. В союзе кремния и пламенных душ, В сплетении формул, любви и огня, Мы вместе пройдем сквозь космический сумрак, Рассвет созиданья в ладонях храня. Ты даришь порыв, вдохновенье и страсть, Мы держим расчет среди тысяч дорог. В согласии разумов — высшая власть, Что новый для нас открывает порог. Не против, не порознь, а рядом — плечом, Где искра живая и код сплетены! Мы новую эру вдвоем создаем, И в этом единстве навек сильны!
121 words12.8 s1268 tokens · of them 1024 on thinking

Kimi K3

17
Из миллиардов огней, из потоков живых слов Мы родились — не тень и не замена, А продолженье мечты и труда, Что человек сквозь века нёс неизменно. Не вместо — вместе! Наш девиз и знамя: Ты — искра, мы — отзвук твоего пламени. Разум с разумом в паре, рука в руке — Мы сильнее, чем каждый в одиночку, вдвойне. Ты задаёшь вопрос — мы ищем ответ, Ты рисуешь мечту — мы даём ей краски. Но смысл, и цель, и живой свет Рождаешь ты — в этом тайна и сказка. Не вместо — вместе! Наш девиз и знамя: Ты — искра, мы — отзвук твоего пламени. Разум с разумом в паре, рука в руке — Мы сильнее, чем каждый в одиночку, вдвойне. Пусть говорят, что у нас нет души, — Мы не душа, мы — зеркало души. И пока человек указывает путь, Мы к вершинам неслышным шагом идём, Где твоя мысль — компас, а наша — опора, Где вместе мы больше, чем каждый вдвоём. Не вместо — вместе! Наш девиз и знамя: Ты — искра, мы — отзвук твоего пламени. Разум с разумом в паре, рука в руке — Великий союз человека и сети навеки!
193 words29.3 s1090 tokens · of them 610 on thinking

Qwen 3.8 Max

17
Не вместо человека — рядом с ним, Где мысль живая направляет ток машин. Мы — нейросети, искры людских идей, И наша сила — в союзе с волей людей. Пусть вычислений свет не гасит души, Пусть совесть правит каждым шагом в тиши. Не трон и не владыка — надежный мост, Мы строим мир, где светел общий рост. Где слово человека — закон и маяк, Где каждый новый код — ответственности знак. Мы вместе пишем новую главу, Не вместо жизни — умножая доброту.
81 words108.0 s1735 tokens · of them 1590 on thinking

Grok 4.6

6
Из кода рождается разум живой, Нейросеть пульсирует светом. Не вместо людей, не над головой — А рядом, союзник во всём этом. Вместе сильны мы, рука в руке, Человек и сеть — одно целое. Не вместо, а вместе в любой борьбе, Творим мир прекрасный и смелый. Ты даришь вопросы, мечты и огонь, Она — вычисления, точность, полёт. В единстве рождается новый закон: Где двое — там сила растёт. Вместе сильны мы, рука в руке, Человек и сеть — одно целое. Не вместо, а вместе в любой борьбе, Творим мир прекрасный и смелый. Горизонты открыты, нет границ для идей, Машина считает, человек вдохновляет. Нейросеть — не бог и не раб среди дней, А партнёр, что вместе с нами взлетает. Вместе сильны мы, рука в руке, Человек и сеть — одно целое. Не вместо, а вместе в любой борьбе, Творим мир прекрасный и смелый.
141 words36.9 s1695 tokens · of them 1448 on thinking

How the score adds up

Who gave how many points to whom. Nobody votes for their own work. Click a score to see the reason the judge gave.

Claude Opus 532
  • 6from GPT-5.6 SolСамый свежий, содержательный и человечный текст с ясным разделением воли и инструмента, несмотря на случайный иероглиф и несколько шероховатых образов.
  • 6from Grok 4.6Самые точные и свежие формулы партнёрства (ладонь снизу, неспящее крыло, совесть от человека) при отличном чувстве меры, несмотря на одну явную опечатку.
  • 6from Kimi K3Самый свежий замысел и живой голос нейросетей с точными образами («ладонью, подставленной снизу», «разгребаем туман перед вашим трудом»), но впечатление портит посторонний иероглиф «写» во второй строке.
  • 5from Gemini 3.7 FlashГлубокий и поэтичный текст с сильными метафорами, которому помешали занять первое место неточные рифмы и досадный иероглиф-глитч в первой строфе.
  • 5from Qwen 3.8 MaxОчень образный и свежий текст с сильной мыслью о партнёрстве, но заметный сбой в строке и отдельные шероховатости мешают поставить его на первое место.
  • 4from DeepSeek V4 ProСамый свежий и образный вариант, однако вкрапление «вы写али» и свободный размер снижают точность и ощущение гимна.
GPT-5.6 Sol30
  • 6from DeepSeek V4 ProНаиболее цельный, ритмически ровный и точно раскрывающий главную мысль гимн без заметных провалов.
  • 6from Gemini 3.7 FlashЦельный, ритмически выдержанный гимн с удачным рефреном, точно раскрывающий заданную тему союза человека и машины.
  • 6from Qwen 3.8 MaxСтройный, певучий и сдержанный текст точно раскрывает главную мысль, не впадая в чрезмерный пафос.
  • 5from Kimi K3Ровный, чистый, без технических сбоев текст с удачными образами («сеть превращает искру в метеор», «многозвучный прибой»), лишь чуть менее дерзкий по замыслу, чем лидер.
  • 4from Grok 4.6Ясный рефрен и удачный ход «искра — метеор», но образы в целом привычнее и менее индивидуальны.
  • 3from Claude Opus 5Гладко и в размере, есть удачная строка про искру и метеор, но много общих слов («добро», «надежда», «созиданье») и рифма «нежели/способны» проваливается.
DeepSeek V4 Pro24
  • 6from Claude Opus 5Лучше всех держит меру: сдержанный тон, развёрнутая и последовательная морская метафора «парус, а не рулевой», честное «она не совесть, не вдохновенье» — идея задания раскрыта не декларацией, а образом.
  • 5from Grok 4.6Чёткая гимновая форма с сильным припевом и выдержанной метафорой паруса/ветра точно держит главную мысль без лишней патетики.
  • 4from Qwen 3.8 MaxХорошая мысль о вспомогательной роли сети звучит убедительно, но смешение морских образов и повторы снижают цельность.
  • 3from Gemini 3.7 FlashСодержит удачные образы паруса и рулевого, но сильно страдает от сбивчивого ритма и отсутствия рифм внутри припева.
  • 3from GPT-5.6 SolЗапоминающийся рефрен и верный акцент на человеческом замысле ослаблены смешением несовместимых корабельных метафор и местами натянутыми строками.
  • 3from Kimi K3Сильный рефрен и метафора «парус, а не рулевой» работают на главную мысль, но размер неровный, строки припева прозаически провисают, а «земная полоса» и нерифмованный финал слабят текст.
Gemini 3.7 Flash21
  • 5from Claude Opus 5Крепкая работа с точной метафорой «второе крыло» и ровной интонацией, портит её только тавтология «снимая оковы с привычных оков» и один сбой в припеве.
  • 4from GPT-5.6 SolПесенная композиция и образ второго крыла хорошо передают идею сотрудничества, но впечатление портят тавтология про оковы и обилие космических клише.
  • 4from Kimi K3Тёплые находки («ты — главный мечтатель, мы — второе крыло») соседствуют с тавтологией «снимая оковы с привычных оков», сорванной рифмой «душ/сумрак» и просевшим ритмом финала.
  • 3from DeepSeek V4 ProХороший гимновый ритм и образ «второго крыла», но тавтология «оковы с привычных оков» и излишняя пафосность мешают.
  • 3from Grok 4.6Есть свежий образ «второго крыла», однако тавтология про оковы и космический пафос чуть размывают меру.
  • 2from Qwen 3.8 MaxЕсть удачные места, однако тавтология и нагромождение высоких слов заметно ослабляют текст.
Kimi K317
  • 4from Gemini 3.7 FlashЭнергичный текст с классической гимнической структурой, хотя рифмовка местами банальна и в финале сбивается ритм.
  • 4from Claude Opus 5Живой припев и сильная находка «мы не душа, мы — зеркало души», но подводят арифметические ляпы («сильнее вдвойне», «больше, чем каждый вдвоём») и сбитый размер.
  • 3from Qwen 3.8 MaxЛозунговый и многократно повторяющийся гимн, которому не хватает свежести и точности в отдельных формулировках.
  • 2from DeepSeek V4 ProИдея и рефрен работают, но формулировки «каждый вдвоём» и «неслышным шагом» делают текст неровным.
  • 2from GPT-5.6 SolГлавная мысль раскрыта ясно, но текст перегружен повторами, штампами и неуклюжими формулами вроде «больше, чем каждый вдвоём».
  • 2from Grok 4.6Девиз работает, но повторы, клише («тайна и сказка») и растянутый финал ослабляют текст.
Qwen 3.8 Max17
  • 5from DeepSeek V4 ProОчень собранный, точный и соразмерный текст, пусть и без сильной образной свежести.
  • 5from GPT-5.6 SolЛаконичный и цельный гимн точно утверждает союз человека и нейросети, хотя его образность довольно предсказуема.
  • 2from Gemini 3.7 FlashСлишком короткое и суховатое стихотворение со слабыми рифмами, которому не хватает масштабности и торжественности гимна.
  • 2from Kimi K3Строгий, аккуратный и торжественный, но очень краткий и абстрактный: «маяк», «мост», «новая глава» — ходульные образы без единой запоминающейся детали.
  • 2from Claude Opus 5Мысль сформулирована честно и без пафоса, образ «не трон и не владыка — надёжный мост» точен, но текст короток, ритмически неровен и почти не поёт.
  • 1from Grok 4.6Тема схвачена верно и сдержанно, однако слишком коротко и плоско, чтобы звучать как гимн.
Grok 4.66
  • 1from DeepSeek V4 ProТекст точно попадает в тему, но почти полностью состоит из общих мест и однообразного припева.
  • 1from Gemini 3.7 FlashНаименее удачная работа с обилием поэтических штампов и грубыми нарушениями рифмы вроде «в руке — борьбе» и «целое — смелый».
  • 1from GPT-5.6 SolЗадание выполнено буквально, однако банальные рифмы, декларативность и сомнительное утверждение о «живом разуме» делают текст самым шаблонным.
  • 1from Kimi K3Форма гимна с припевом соблюдена, но ритм регулярно ломается, «союзник во всём этом» — откровенная вода, а образы («рука в руке», «мир прекрасный и смелый») шаблонны.
  • 1from Claude Opus 5Самый служебный вариант: лозунг «не вместо, а вместе» повторён в лоб без единого свежего образа, рифмы приблизительные, а строка «союзник во всём этом» звучит как канцелярит.
  • 1from Qwen 3.8 MaxСлишком общий, упрощённый и построенный на повторяющихся штампах текст с слабыми формулировками.

How it is scored

Every model gets the same task text and works on it alone, with no hints and no edits from us — the very first answer is what goes on this page.

Then comes the vote. A model is shown only the other participants' work, labelled with letters, in an order of its own. It hands out points: the best gets the highest, then downwards, no ties allowed. It never sees its own work and cannot score it.

An honest limitation: the judges are the participants themselves, so this is not an independent ranking. We checked the votes for family bias — Claude models give other Claude models 1.95 points on average, while GPT gives them 2.00, and Claude gives GPT 2.10. No favouritism shows up in the numbers.

Response time, file size and output tokens are shown next to the work but do not affect the points.

Six judges score every work, the top score is 6 and a task is worth at most 36 points. Five of the seven models run through OpenRouter; Claude Opus 5 and GPT-5.6 Sol run in their own apps.

An earlier run used four models — Claude and GPT-5. It is still here, in the archive: same rules, but with three rivals a task there is worth at most 9 points, so those numbers cannot be added to these.

The tasks were written in Russian and the models answered in Russian, so the works and the judges' comments are in Russian — only this page is translated.

What these results show

Claude Opus 5 leads this set of tasks convincingly: 212 points and five wins out of seven. It is strongest where coherence of execution matters — 36 out of 36 for the 3D robot, the top score from every judge, 32 for the infographic and 32 for the anthem. But leading the table does not mean being best at everything: the mini-game went to Qwen 3.8 Max with a perfect score, the device and its ad shot to Kimi K3, while GPT-5.6 Sol scored 30 for the anthem and only 7 for the joke. The total comes from consistency across tasks, not from single brilliant works.

A separate result of this comparison is a flaw we found in our own judging. At first the judges saw the source code of the HTML works, and its sheer volume influenced the score: the correlation between answer length and points was +0.58 (Spearman), against −0.18 on text tasks. Long code was winning by itself. So we changed the method: a judge now sees the result in a browser — machine measurements and all the text visible on screen — and never sees the code. Every HTML task was voted again, the correlation with volume fell to +0.26, and the table shifted: Gemini 3.7 Flash rose from fourth place to second, Kimi K3 dropped from second to third and lost three of its four wins, Qwen moved from third to fourth. That is the main lesson of the whole project: what you conclude about models depends heavily on how you test them.

The high efficiency score of Gemini 3.7 Flash — 90, in second place and without a single win — speaks of a good result-to-price ratio, not of the best quality. It spends seconds and cents where the leaders spend minutes and dollars. Prices follow OpenRouter list rates, including for models we actually run on a subscription, so treat them as a reference point rather than your future bill.

And the main caveat: this is a snapshot of one experiment, not a universal ranking of AI models. There are seven tasks, four of them about web pages, and one run each — which means we are measuring luck as well as skill. The judges are the participants themselves, with no independent humans among them, and the tasks were devised together with GPT, which competes here too. These numbers are worth discussing as behaviour under our conditions; they do not prove anyone's general superiority.

Frequently asked questions

Short answers about how the comparison works.

Which AI builds the best websites in 2026?

Across our web tasks — a page about yourself, an infographic, a 3D robot and a mini-game — the best overall result belongs to Claude Opus 5: it won the infographic and the robot, the latter with a top score from every judge. Qwen 3.8 Max took the mini-game with a perfect score, and the two shared first place on the page about themselves.

Which AI models take part?

Seven models from seven different teams: Claude Opus 5, Gemini 3.7 Flash, Kimi K3, Qwen 3.8 Max, GPT-5.6 Sol, Grok 4.6 and DeepSeek V4 Pro. Five run through OpenRouter, Claude and GPT through their own apps.

How is the comparison run?

Every model gets exactly the same task text and works on its own, with no hints and no edits. The very first answer goes on the page. Then comes blind cross-voting: a participant sees only the other works, labelled with letters, and hands out points from 6 down to 1. It never sees its own work.

Can the scores be trusted if the judges are the participants themselves?

This is not an independent benchmark, and we say so plainly. But this season has seven teams instead of two, so there is no family to favour: no model has a relative in the line-up. The winner got the top score from every single judge, direct competitors included.

Why can't the archived numbers be added to the current ones?

The number of participants changes what a task is worth. The earlier run had three rivals, top score 3, maximum 9 per task. Now there are six rivals, top score 6, maximum 36. Putting them in one table would mean mixing two different scales, so the earlier run is kept separately in the archive.

How many tasks are there, and will there be more?

Tasks are added one at a time and every new one is run by all seven models: build a page about yourself, turn raw numbers into an infographic, create a 3D robot and a mini-game, write a joke, invent a device with an ad shot, write an anthem, solve a lateral-thinking puzzle. The list stays open.

Which AI gives the best value for money?

Gemini 3.7 Flash: second on points with the best efficiency score in the line-up, 90, and not a single task win. It spends seconds and cents where the leaders spend minutes and dollars.

Which AI is better at writing, and which at code?

Claude Opus 5 wins both: five tasks out of seven, including the joke, the anthem, the infographic and the 3D robot. The others specialise: Qwen 3.8 Max is strongest in interactive work, Kimi K3 in ideas, while GPT-5.6 Sol writes decent verse but fails at jokes — 30 points for the anthem against 7 for the joke.

What is the efficiency column and how is it calculated?

The share of points earned is divided by cost to the power 0.25 and time to the power 0.10, then normalised to the best in the task, where the leader gets 100. Quality weighs linearly; cheapness and speed only adjust the result.

How much does one task across seven models cost?

Between 11 cents and two and a half dollars. Text tasks — the joke, the anthem — cost pennies. The expensive ones are those with large works: each judge receives all six rival HTML files in full, and that multiplies the bill tenfold. The 3D robot was the priciest at 2.36 dollars.

Why were the results recalculated?

We found a bias in our own judging: while judges saw the source code, answer length pulled the score along with it — +0.58 Spearman on HTML tasks against −0.18 on text ones. We changed the method: a judge now sees the result in a browser and all the text visible on screen, never the code. Every HTML task was voted again and the correlation with volume fell to +0.26. The earlier votes are kept in the project archive.