强化学习之前言

雪柳花明 2017-08-03

展开全文

# -*- coding: utf-8 -*-
#载入库
import numpy as np
import gym
import time

#Gym的主要作用是为研究者和开发者提供一个方便的强化学习任务环境
env = gym.make('CartPole-v0')
#创建CartPole问题的环境env

env.reset()
#初始化环境

random_episodes = 0

reward_sum = 0#奖励
while random_episodes < 10:
    env.render()#将CartPole问题的图像渲染出来

    observation, reward, done, _ = env.step(np.random.randint(0, 2))
    #使用np.random.randint(0, 2)产生随机的Action
    #然后使用env.step()执行随机的Action,并获取返回值
    #如果done标记为True,则表示这次试验结束，即倾角超过15度或者偏离中心过远导致任务失败

    reward_sum += reward
    if done:#如果试验结束
        random_episodes += 1
        print("game over,Reward for this episode was:", reward_sum)
        #输出这次试验累计的奖励
        reward_sum = 0 #奖励重新置为0

        time.sleep(2)
        env.reset()#重启环境

该仅仅是平衡木的移动，开始到结束。

本站是提供个人知识管理的网络存储空间，所有内容均由用户发布，不代表本站观点。请注意甄别内容中的联系方式、诱导购买等信息，谨防诈骗。如发现有害或侵权内容，请点击一键举报。

转藏分享

QQ空间 QQ好友新浪微博微信

献花（0） +1

来自：雪柳花明 > 《Reinforcement Learning》

举报/认领

0条评论

发表

请遵守用户评论公约

类似文章 更多

雪柳花明

关注对话

TA的最新馆藏

计算机二级新增第8套
计算机二级新增第7套
计算机二级新增第6套
计算机二级新增第5套
计算机二级新增第4套
计算机二级 MS 第18套

喜欢该文的人也喜欢更多

热门阅读换一换