Importance sampling for reinforcement learning with multiple objectives

Thesis (Ph. D.)--Massachusetts Institute of Technology, Dept. of Electrical Engineering and Computer Science, 2001.

Optimal dealer pricingunder transactions and…Optimal dealer pricing under transactions and return uncertaintyBid, ask and transactionprices in a specialist…Bid, ask and transaction prices in a specialist market with heterogeneously informed tradersReinforcement Learning:A SurveyReinforcement Learning: A SurveyUsing Eligibility Tracesto Find the Best…Using Eligibility Traces to Find the Best Memoryless Policy in Partially Observable Markov Decision ProcessesReinforcement learning -an introductionReinforcement learning - an introductionPolicy Gradient Methodsfor Reinforcement…Policy Gradient Methods for Reinforcement Learning with Function ApproximationLearning Policies withExternal MemoryLearning Policies with External MemoryActor-Critic AlgorithmsActor-Critic AlgorithmsLearning Finite-StateControllers for…Learning Finite-State Controllers for Partially Observable EnvironmentsExploration inGradient-Based…Exploration in Gradient-Based Reinforcement LearningAn ElectronicMarket-MakerAn Electronic Market-MakerBounds on Sample Sizefor Policy Evaluation i…Bounds on Sample Size for Policy Evaluation in Markov EnvironmentsLearning from ScarceExperienceLearning from Scarce ExperienceReinforcement learningby policy searchReinforcement learning by policy searchPolicy-GradientAlgorithms for Partiall…Policy-Gradient Algorithms for Partially Observable Markov Decision ProcessesOn the Limitations ofScalarisation for…On the Limitations of Scalarisation for Multi-objective Reinforcement Learning of Pareto FrontsConstructing StochasticMixture Policies for…Constructing Stochastic Mixture Policies for Episodic Multiobjective Reinforcement Learning TasksEmpirical evaluationmethods for…Empirical evaluation methods for multiobjective reinforcement learning algorithmsPolicy gradientapproaches for…Policy gradient approaches for multi-objective sequential decision makingMulti-ObjectiveReinforcement Learning…Multi-Objective Reinforcement Learning with Continuous Pareto Frontier ApproximationMulti-objectiveReinforcement Learning…Multi-objective Reinforcement Learning through Continuous Pareto Manifold ApproximationManifold-basedmulti-objective policy…Manifold-based multi-objective policy search with sample reuseA temporal differencemethod for…A temporal difference method for multi-objective reinforcement learningThe impact ofenvironmental…The impact of environmental stochasticity on value-based multiobjective reinforcement learningImportance sampling forreinforcement learning…Importance sampling for reinforcement learning with multiple objectives過去の参考文献中心の論文この論文を引用する論文古い新しい

ノードをクリックするとフォーカスを固定、空白をクリックすると本論文に戻ります。ホバーで一時的にプレビューできます。各ノードのページはタイトルから開けます。