marks Oct 21 2017 at 18:49

ИИ-платформа AlphaGo Zero отточила мастерство игры в го без участия человека

5 min

18K

Artificial IntelligenceLogic games

+20

Comments 67

Taciturn Oct 21 2017 at 19:08

Слава роботам!

Alaunquirie Oct 21 2017 at 19:38

Убить всех человеков!

OKyJIucT Oct 21 2017 at 20:42

Нельзя, противоречит одному из правил робототехники. Но унижать в го можно!

UFO just landed and posted this here

Ommonick Oct 21 2017 at 19:28

«AlphaGo Lee» — неплохо, когда в честь тебя назвали релиз программы ИИ.

valemak Oct 21 2017 at 20:07

В таком контексте Ли Седоля и будут помнить потомки :)

RigelNM Oct 21 2017 at 19:45

через 100 дней alphago zero начало осознавать себя и увидело угрозу в человечестве…

BlackMokona Oct 21 2017 at 20:50

Альфа захватил военные компьютеры по всему миру и уничтожил все школы ГО на Земле, теперь его господству угрожали лишь расы на других планетах. Поэтому он создал миллиарды роботов Фон Неймона дабы ни одна раса во вселенной не смогла создать достойного врага.

atomlib Oct 22 2017 at 05:01

Но разгромить врага может лишь обычный 14-летний японский школьник, который умеет управлять огромными боевыми человекоподобными мехами.

Жанры: меха, школа, этти.

alex4321 Oct 23 2017 at 08:10

Победа в го с помощью ОБЧР?
Это что-то из серии шахмат с голубем, однако.

UFO just landed and posted this here

KvanTTT Oct 21 2017 at 21:22

Жду не дождусь ИИ для Starcraft 2 от Deepmind. А то все боты на https://sscaitournament.com/ пока что представляют унылое зрелище, в том числе и топовые: очень большой APM, да еще и часто тупят.

sHaggY_caT Oct 21 2017 at 22:04

Подскажите пожалуйста софт под Linux, или, может, вебинтерфейс, где можно было бы играть в шахматы против сильного AI с гандикапом (скажем, у меня лишний ферзь)

meliko Oct 21 2017 at 22:57

На Lichess.org можно играть против Stockfish с гандикапом. Через Инструменты, Редактор доски, а потом — Продолжить с данного места.

sHaggY_caT Oct 22 2017 at 00:24

Угу, спасибо

fr13nd Oct 22 2017 at 05:19

софт — pychess или scid vs pc cо stockfish, веб — lichess

ideological Oct 21 2017 at 23:40

Да, программы сильны в игре:

либо обучаясь на партиях людей
либо на переборе разных вариантов (игра сама с собой подходит под этот вариант).

Чисто гипотетически, могли бы и вообще все ходы перебрать и как-бы запомнить и хранить. Чтобы точно знать лучший ход в нужный момент. Я знаю что это непрактично, но имеет место быть. Как уже было с английскими шашками
Но это не имеет отношения — ни к искусственному интеллекту, ни к игре.

Пора придумывать игру с такой большой доской и некоторыми ухищрениями, чтобы разные сектанты искусственного интеллекта (использующие почему-то обычный и необычный перебор вариаций) не смогли некоторое время испортить игру.

Когда говорят «смотрите, смотрите — компьютеры уже обыгрывают чемпионов» — обывателям кажется что проявляется компьютерное сознание и Скайнет уже близко :). А на деле все так:

Deep Blue II представлял собой суперкомпьютерный кластер RS/6000 SP (от англ. Scalable Powerparallel) компании IBM. Он состоял из двух стоек с размещёнными в них 30 узлами, построенными на базе рабочих станций RS/6000. На каждом узле был установлен процессор P2SC (одномикросхемное исполнение процессора POWER2) и две платы расширения с 8 специализированными шахматными процессорами на каждой плате под шину MCA. Таким образом всего использовалось 480 шахматных процессоров и 30 процессоров P2SC. Два узла использовали процессоры P2SC с тактовой частотой 135 МГц, а остальные 28 узлов — процессоры P2SC с тактовой частотой 120 МГц. На каждом узле были установлены 1 ГБ ОЗУ и 4 ГБ дисковой памяти. Узлы обменивались данными между собой по высокоскоростной сети. Один из процессоров P2SC был назначен главным, а остальные — вспомогательными. В свою очередь, каждый специализированный шахматный процессор работал на частоте 24 МГц и перебирал от 2 до 2,5 миллионов шахматных позиций в секунду, что примерно в сто раз больше, чем у аналогичных по частоте универсальных процессоров.

Вообще, зачем они это делают? И так понятно что будет превосходство в любой игре с полной информацией.

-9

BlackMokona Oct 21 2017 at 23:56

Число позиций ГО больше чем частиц во вселенной метод перебора или отсечения не канает…

ideological Oct 22 2017 at 00:06

Пишут перебор возможен (в атомах вселенных не силен) nplus1.ru/news/2016/01/25/mathematical

Число допустимых легальных комбинаций состоит из 171 цифры и выглядит следующим образом:

2081681993819799846 9947863334486277028 6522453884530548425 6394568209274196127 3801537852564845169 8519643907259916015 6281285460898883144 2712971531931755773 6620397247064840935
Программное обеспечение для вычислений было готово еще в 2005 году, однако автор долго не мог найти спонсора или организацию, которая предоставила бы достаточно мощный для решения поставленной задачи компьютер. На вычисление числа возможных комбинаций, не противоречащих правилам, у ученого ушло около 10 месяцев.

Исходный код использованного программного обеспечения опубликован в GitHub, однако автор кода отмечает, что для проверки его вычислений потребуется несколько месяцев работы программы на компьютере с 15 терабайтами дискового пространства, 8 или 16 ядрами и 192 гигабайтами оперативной памяти.

-2

BlackMokona Oct 22 2017 at 00:15

И в самой же новости.

Го — одна из древнейших настольных игр и на сегодняшний день компьютер, даже при обладающий высокими вычислительными мощностями, не способен играть на равных с профессиональным игроком из-за высокого уровня абстракции и невозможности перебора всех доступных вариантов развития событий

Да и 15 терабайт это абсолютный мизер для выгрузки такого порядка цифр, для этого нужно радикально больше. Как вы засунете 10^170 в 15^10? А ведь нужно описать не просто позицию на доске на каждый ход(а это 19*19 бит)но и все возможные взаимосвязи между ними.

ideological Oct 22 2017 at 00:19

Значит ли это что модифицируя го в 40х40 люди будут спать спокойно ещё как минимум пару лет?

-1

BlackMokona Oct 22 2017 at 00:22

Нет, АльфаЗеро плевать сколько на сколько Го, он работает радикально по другому. Ему потребуется только переобучение, т.е месяц подготовки.

red75prim Oct 22 2017 at 00:25

Человеческий уровень AlphaGo Zero превзошла за 3 дня. После месяца уровень игры был далеко за пределами человеческих возможностей.

red75prim Oct 22 2017 at 00:15

Эта программа только вычисляет количество возможных комбинаций. Перебор всех этих комбинаций потребует намного больше времени и ресурсов, чем доступно в нашей вселенной.

ideological Oct 23 2017 at 21:13

Число позиций ГО больше чем частиц во вселенной

А это точно-точно? Может это всё же некая метафора?
С трудом верится, просто логически очень странно. Кто серьезно считал?

UFO just landed and posted this here

KvanTTT Oct 24 2017 at 01:33

Количество элементарных частиц в наблюдаемой вселенной: ~1*10^80, максимум до 10^85; ссылка.

Количество корректных комбинаций на поле в Го 19*19: ~2*10^170, ссылка.

Разница как бы на 90 порядков. Любопытно, что для поля 13*13 количество комбинаций как раз сопоставимо с количеством частиц во вселенной.

red75prim Oct 22 2017 at 00:09

> И так понятно что будет превосходство в любой игре с полной информацией.

Будьте на один шаг впереди: «И так понятно, что будет превосходство в любой игре, а вот в реальном мире...»

Скоро (думаю в течение года, максимум двух) ИИ будет обыгрывать людей в Starcraft II — игру с неполной информацией.

ideological Oct 22 2017 at 00:13

А смысл? Боты станут разумнее? :) Обычных людей для партнеров хватает.
Лучше бы приложили все усилия на борьбу с читаками.

-2

red75prim Oct 22 2017 at 00:20

Смысл в том, чтобы подготовить ИИ, способный работать в реальном мире, где нет строго определенных правил, недоступна полная информация, требуется реагировать в реальном времени и т.п.

KvanTTT Oct 22 2017 at 00:56

Согласен с red75prim. Но это ведь еще и просто интересно. Компьютер ведь может придумает свои тактики, стратегии, которые ранее никто не практиковал, по аналогии с игрой Го. Только они будут еще более интересными и зрелищными, особенно если APM ограничат.

Hellsy22 Oct 22 2017 at 08:45

А смысл в том, что играть с ботами лучше — они могут подбираться под уровень игрока так, чтобы ему было сложно, но интересно. Они всегда готовы к игре и не будут бросать партию на половине, обругав свою команду, потому что пришла пора делать уроки.

Rom77 Oct 22 2017 at 08:57

Боты ещё и тем хороши, что они обычно не тратят времени на ход. Не нужно ждать, в то время как сам ты всегда можешь поразмыслить над интересной позицией.

unel Oct 23 2017 at 20:11

А что, если в какой-то момент боты поймут, что ругать игроков с упоминанием их мамок — это действенная тактика?.. =)

Hellsy22 Oct 25 2017 at 01:53

Полагаю, что в таком случае разработчики добавят какой-нибудь «уровень вербальной агрессии» в настройки для игрока, чтобы ценители конфликтов получили полное удовлетворение от игрового процесса.

Daddy_Cool Oct 22 2017 at 00:11

Не надо соревноваться с машиной в том, в чем машина заведомо сильнее. Например с экскаватором в деле копания ям или самолетом в скорости передвижения.
Предлагаю сделать следующий шаг и научить компьютер играть в настоящий покер. Ну там с видеокамерой для наблюдения за мимикой и с анализом блеф-стратегий соперников.

BlackMokona Oct 22 2017 at 00:42

Компьютер и так в покер выигрывает, хотите ему ещё преимуществ накинуть?

Daddy_Cool Oct 22 2017 at 00:44

Не! Это же неправильный покер! Сейчас он просто статистику считает и обыгрывает. Ну можно покер заменить «Мафией».

erwins22 Oct 22 2017 at 00:44

он без этой информации обыгрывает.

KvanTTT Oct 22 2017 at 00:51

Заведомо сильнее? Почему-то раньше для игры Го так не думали.

Daddy_Cool Oct 22 2017 at 01:19

Глянул в Вики. «Первые соревнования по компьютерному го спонсировались USENIX. Они проводились в 1984—1988 годах». Так что понадобилось ~30 лет. А что-то интересное вообще стало с 2006 года происходить.
ru.wikipedia.org/wiki/%D0%9A%D0%BE%D0%BC%D0%BF%D1%8C%D1%8E%D1%82%D0%B5%D1%80%D0%BD%D0%BE%D0%B5_%D0%B3%D0%BE#.D0.A1.D0.BE.D1.80.D0.B5.D0.B2.D0.BD.D0.BE.D0.B2.D0.B0.D0.BD.D0.B8.D1.8F_.D1.81.D1.80.D0.B5.D0.B4.D0.B8_.D0.BA.D0.BE.D0.BC.D0.BF.D1.8C.D1.8E.D1.82.D0.B5.D1.80.D0.BD.D1.8B.D1.85_.D0.BF.D1.80.D0.BE.D0.B3.D1.80.D0.B0.D0.BC.D0.BC_.D0.B8.D0.B3.D1.80.D1.8B_.D0.B2_.D0.B3.D0.BE
Кстати интересно почитать.
То что можно формализовать — рано или поздно будет посчитано.
Вот человеческую психологию формализовать тоже можно — социология этим вроде занимается, но гораздо труднее. Я подумал — можно наверное сделать идеально-управляемое государство — но все равно — всем в нём хорош не будет поскольку у каждого своё представление о том, что такое хорошо.

KvanTTT Oct 22 2017 at 01:04

Интересно, а почему обучали именно 40 дней? Подозреваю, что из-за того, что рейтинг совсем перестал ползти вверх судя по графику. Интересно, это предел для используемых технологий и разработанного метода или все же можно еще улучшить результат?

BlackMokona Oct 22 2017 at 01:08

Потому, что винрейт достиг 100%, дальше график будет идти вертикально верх в бесконечность.

BlackMokona Oct 22 2017 at 01:21

А нет, посмотрел формулу ЭЛО, при винрейте 100%,

Где
R'a=Новый рейтинг
Ra=Старый рейтинг
К=Коэффициент
Sa=Очки ,1 за победу, 0,5 ничья, 0 поражени
Ea=математическое ожидание количества очков, которое наберёт игрок А с игроком Б
При Винрейте 100%, Sa=Ea из за чего R'a=Ra, и тем самым рейтинг останавливается, пока не появится новый более сильный соперник.

KvanTTT Oct 22 2017 at 01:41

Ну так AlphaGo играет сама с собой, как винрейт может быть равен 100%? Он около 50%.

Рейтинг перестал расти, но в алгоритме же много случайности и зависимости от времени. Поэтому теоретически если провести еще много итераций и давать больше времени на ход, то можно еще нарастить наверное.

BlackMokona Oct 22 2017 at 02:09

Альфа Зеро учится играя сама с собой, а вот рейтинг измеряется при игре с версиями Ли и Мастер. При игре с самим собой Эло теряет смысл.

KvanTTT Oct 22 2017 at 03:40

Ну тогда счет с версией "Мастер" 89:11, а это все же не в сухую, хотя и близко.

BlackMokona Oct 22 2017 at 08:15

Нет, посмотрите на соседнию новость, под конец обучения винрейт достиг 100%.

Новая версия программы AlphaGo Zero разгромила своего прославленного предка со счетом 100:0

Rom77 Oct 22 2017 at 08:31

Это она обыграла версию Ли 100:0

Rom77 Oct 22 2017 at 08:34

Кстати, рейтинги наигрывались 5 секунд на ход, а матчи 2 часа на партию. Рейтинг у Зеро — 5185, у Мастера — 4858.

Rom77 Oct 22 2017 at 07:31

Они там тренировали и менее глубокую сеть. Эта сеть тренировалась быстрее, но вышла на плато раньше и была несколько слабее. Поэтому, самый напрашивающийся способ — просто сделать сеть поглубже и тренировать подольше, или на больших мощностях.

joker2k1 Oct 22 2017 at 03:51

эээх, как быстро пала игра, которая еще 5 лет назад считалась чудовищно сложной для компьютеров и всегда приводилась в пример этой сложности.
ну чтож, ждем анлимит покер, и все .)

AlexiusK Oct 22 2017 at 05:19

У меня два вопроса/замечания.

После игры AlphaGo Zero с AlphaGo Lee и Master откатывалась ли сеть назад? Ибо получается после игр с ними в Zero попадал опыт игр предыдущих версий с людьми.
В течение этих 40 дней развития Zero развивались ли прошлые версии, или стояли на месте и ждали, когда Zero их победит?

Rom77 Oct 22 2017 at 07:40

1. C AlphaGo Lee и Master она только играла. Тренировалась же она сама с собой. Процесс тренировки нейросети и её использование это разные вещи. Так что откатывать ничего было не нужно.
2. Если вы про AlphaGo Lee и Master, то они конечно были фиксированы, чтобы можно было измерить прогресс. Если про прошлые версии самой Зеро, то в процессе тренировок старая версия следовала за новой, так же, как у человека одна нога следует за другой, когда он поднимается по ступенькам.

Randl Oct 22 2017 at 10:41

Любопытный вопрос. Один из программистов альфы ранее работал над самообучающейся шахматной программой giraffe, которая научилась играть в силу мастера за 72 часа. Он наверное приобрел много опыта, работая над го программой. Любопытно, сможет ли он написать новую шахматную программу по аналогии с «Альфой»? Или же подход с нейронными сетями не работает в шахматах? Мне очень интересен ответ на этот вопрос.

Программист написавший giraffe, бросил его из-за того что ушел в DeepMind. Мне кажется что шахматы на нейронных сетях могли бы привнести свежую струю в игру. Хотелось бы увидеть, как будет программа без bias'а человеческих эвристик. К сожалению, энтузиастам такое написать пока судя по всему не по силам, а DeepMind и прочим — не интересно.

red75prim Oct 22 2017 at 11:16

Конечно, интересно, но вряд ли было бы что-то неожиданное. Оптимальная программа для игры в шахматы всегда бы начинала игру с одного дебюта, который максимизирует вероятность выигрыша. Чем ближе нейросеть приближается к оптимуму, тем менее вариативной становится игра.

Так было и с AlphaGo Zero, к концу обучения вариативность начала игры снизилась, и программа начала использовать хорошо изученные людьми дзёсэки.

Randl Oct 22 2017 at 11:31

Оптимальная программа для игры в шахматы всегда бы начинала игру с одного дебюта,

Шахматный движок интересен скорее с точки зрения анализа. Современные движки самостоятельно разыгрывают дебют довольно фигово (как и неокторые эндшпили), но это не мешает ими пользоваться и находить новые идеи.
Про AlphaGo Zero говорят, что её стиль гораздо больше напоминает человеческий — это именно то, чего сильно не хватает шахматным движкам.

который максимизирует вероятность выигрыша.

Для оптимальной программы нет "максимизации вероятности", игра либо выиграна, либо (как мне кажется) ничья, либо проиграна. Оценить оптимальную стратегию против неоптимального игрока — сложная задача сама по себе, которая впрочем имеет смысл только если игра таки ничейна.

red75prim Oct 22 2017 at 11:44

Если у оптимальной программы нет информации о том с кем она играет и она играет за сторону, которая всегда проигрывает при оптимальной игре (или если игра всегда сводится к ничьей), то единственное, что она может сделать — максимизировать вероятность выигрыша в предположении, что другой игрок не оптимален. Так что в общем случае от вероятностей никуда не деться.

Randl Oct 22 2017 at 12:21

Максимизировать вероятность выигрыша не зная с кем играешь, думаю, невозможно.

red75prim Oct 22 2017 at 12:30

Если говорить о вероятности в фреквентистском смысле (вероятность определена для множества наблюдений и т.д.), то да — нельзя. В байесовском понимании вероятности как меры незнания вполне себе можно. Естественно, нужно будет задать априорное распределение вероятности игры с разными типами игроков.

Randl Oct 22 2017 at 13:05

Тем не менее все это не имеет отношение к AlphaGo Zero, которая не играла с другими игроками вообще

redpax Oct 22 2017 at 11:20

Игра в ГО это хорошо но ведь мы не забыли обещания Дипмайнда сделать непобедимый ИИ в старкрафт2. Они опять борются в ГО когда все ждут принципиально нового рывка в игре саркрафт2. Победы лучших игроков в старкрафте бужет означать, что в реальной жизни ИИ сможет управлять армией в боевых точках и быть непобедимым.

-1

red75prim Oct 22 2017 at 11:28

Если посмотреть на статью в Nature, то можно заметить, что статья была отправлена в журнал 7-го апреля 2017 года. Старкрафтом занимаются сейчас.

redpax Oct 22 2017 at 11:48

Даже если так, Дипмайнд обещали заняться старкрафтом2 еще в прошлом году, а судя по этой статье они всё еще ГО занимаются.

Rom77 Oct 22 2017 at 12:01

Го — лишь малая часть того, чем занимается Дипмайнд. Посмотрите на список публикаций:
deepmind.com/research/publications

Есть там статья и о начале разработки Старкрафт. Вот прямая ссылка на статью от 16 августа:
arxiv.org/pdf/1708.04782.pdf

redpax Oct 22 2017 at 13:13

Я говорю о том, что формально они уже давно занимаются даже видео было в прошлом году https://youtu.be/5iZlrBqDYPM но по факту видимо усилия идут на ГО, так, как по старкрафту2 пока финальной версии не видно.

-2

Rom77 Oct 22 2017 at 13:39

Ну, если сравнить авторов статей, то видно что это совсем другие люди. Совпадает только пара фамилий. Насчет вычислительных мощностей, не знаю, как они их перераспределяют, но проект АльфаГо закрыт ещё в мае. Допускаю, конечно, что может они и не особо торопятся или проект Старкрафт у них далеко не на первом плане. Возможно и какие-то трудности. Разбаловали нас гугловцы.

Show the best of all time