Multi-Armed Bandit

UCB1 para un problema Bandido Multibrazo (Multi-Armed Bandit)

marzo 26, 2021 Por Daniel Rodríguez Deja un comentario
Tiempo de lectura: 4 minutos

Las diferentes estrategias que hemos visto hasta ahora para resolver un problema tipo Bandido Multibrazo (Multi-Armed Bandit) se basan en la exploración aleatoria de los estados, como puede ser el caso de Epsilon-Greedy, o en un conocimiento previo de los mismos, como es el caso de valores iniciales optimistas. Lo que puede ser problemático en ciertas ocasiones. Epsilon-Greedy … [Leer más...] acerca de UCB1 para un problema Bandido Multibrazo (Multi-Armed Bandit)

Softmax para un problema Bandido Multibrazo (Multi-Armed Bandit)

marzo 19, 2021 Por Daniel Rodríguez Deja un comentario
Tiempo de lectura: 8 minutos

Epsilon-Greedy es una estrategia que ofrece buenos resultados en la optimización de un problema Bandido Multibrazo (Multi-Armed Bandit). Aunque durante la fase de exploración selecciona todos los bandidos con la misma probabilidad. Algo que se puede optimizar seleccionando en esta fase los bandidos en base al valor de su recompensa esperada. Con lo que el agente solamente se … [Leer más...] acerca de Softmax para un problema Bandido Multibrazo (Multi-Armed Bandit)

Valores iniciales optimistas para un problema Bandido Multibrazo (Multi-Armed Bandit)

marzo 12, 2021 Por Daniel Rodríguez Deja un comentario
Tiempo de lectura: 8 minutos

En entradas anteriores hemos aprendido a abordar el problema del Bandido Multibrazo utilizando para ello la estrategia llamada Epsilon-Greedy. Estrategia con la que se obtienen mejores resultados que los de un test A/B. Aunque Epsilon-Greedy tiene un problema cuando el número de episodios a jugar es elevado, continúa explorando los peores bandidos con una probabilidad fija … [Leer más...] acerca de Valores iniciales optimistas para un problema Bandido Multibrazo (Multi-Armed Bandit)

Epsilon-Greedy con decaimiento para un problema Bandido Multibrazo (Multi-Armed Bandit)

marzo 5, 2021 Por Daniel Rodríguez Deja un comentario
Tiempo de lectura: 7 minutos

La semana pasada vimos cómo se podía usar la estrategia Epsilon-Greedy para resolver un problema tipo bandido multibrazo. Una estrategia que nos había dado mejores resultados que un test A/B. Pero esta estrategia tiene un problema, una vez que se sabe cuál es el mejor bandido se continuará jugando una cantidad de veces con bandidos que no son el óptimo. Lo que se puede resolver … [Leer más...] acerca de Epsilon-Greedy con decaimiento para un problema Bandido Multibrazo (Multi-Armed Bandit)

Epsilon-Greedy para el Bandido Multibrazo (Multi-Armed Bandit)

febrero 26, 2021 Por Daniel Rodríguez Deja un comentario
Tiempo de lectura: 6 minutos

La semana pasada hemos visto cómo resolver el problema del Bandido Multibrazo mediante un test A/B. Con el que se jugó con cada uno de los bandidos una cantidad de veces dada hasta que se estaba seguro de cuál era el mejor de los bandidos. Esta aproximación no es eficiente, ya que en muchos casos se puede saber rápidamente cuáles son los peores, por lo que se puede plantear … [Leer más...] acerca de Epsilon-Greedy para el Bandido Multibrazo (Multi-Armed Bandit)

Test A/B para el Bandido Multibrazo (Multi-Armed Bandit)

febrero 19, 2021 Por Daniel Rodríguez Deja un comentario
Tiempo de lectura: 4 minutos

Recientemente hemos visto el problema del Bandido Multibrazo (Multi-Armed Bandit). Una de las posibles soluciones que tenemos en nuestra mano para resolver este problema es utilizar un Test A/B. Esto es, evaluar durante un periodo de tiempo todos los bandidos por igual y decidir una vez finalizado este periodo de prueba cuál es el óptimo. O, si los datos no son concluyentes, … [Leer más...] acerca de Test A/B para el Bandido Multibrazo (Multi-Armed Bandit)

El Bandido Multibrazo (Multi-Armed Bandit)

febrero 12, 2021 Por Daniel Rodríguez Deja un comentario
Tiempo de lectura: 3 minutos

El bandido multibrazo (multi-armed bandit) es uno de los problemas clásicos del aprendizaje por refuerzo. En este problema a un agente se le ofrece la posibilidad de jugar con N máquinas tragaperras, a las que se les suele llamar "bandidos" o "brazos", que ofrecen diferentes recompensas. La recompensa que ofrece cada uno de los bandidos viene dada por una distribución de … [Leer más...] acerca de El Bandido Multibrazo (Multi-Armed Bandit)