«Управляемый случайный процесс»

Управляемый случайный процесс в энциклопедиях

Поделиться

Большая Советская энциклопедия

случайный процесс, вероятностные характеристики которого можно изменять с помощью управляющих воздействий. Основная цель теории У. с. п. – отыскание оптимальных (или близких к ним) управлений, доставляющих экстремум заданному критерию качества. В простейшем случае управляемых марковских цепей одна из математических постановок задачи нахождения оптимального управления формулируется следующим образом. Пусть Xd=(xn,Pxd), n =0, 1,..., – семейство однородных марковских цепей с конечным числом состояний Е ={0, 1, ..., N} и матрицами переходных вероятностей Pxy (d)= Pxd{x1= у}, зависящих от параметра d, принадлежащего некоторому множеству управляющих воздействий D.Набор функций a = {а0 (x0), a1 (x0, x1),...}со значениями в D называют стратегией, а каждую из функций an = ап (х0,..., хп) – управлением в момент времени n. Каждой стратегии a отвечает управляемая марковская цепь Xa = (хп,Pxɑ), n =0, 1,..., где

Pxɑ(x0, x1..., хп)=δ(х0, х) Рх0х1(a0 (x0))... Pxn-1xn (an-1(x0, x1,..., xn-1))

Пусть:

где функция f(d, х)0 и f(d,0)=0 (если точка {0} является поглощающим состоянием и f(d, x)=I, dD, x =1,..., N,то Va (x) есть матем. ожидание времени попадания из точки х в точку 0). Функцию

называется ценой, а стратегию а* – оптимальной, если V(x) для всех хЕ.

При довольно общих предположениях о множестве D устанавливается, что цена V(x) удовлетворяет следующему уравнению оптимальности (уравнению Беллмана):

,

где

.

В классе всех стратегий наибольший интерес представляют т. н. однородные марковские стратегии, характеризуемые одной функцией а(х) такой, что an (x0,..., xn) = a(xn) при всех n =0, 1,...

Следовательно, критерий оптимальности (или достаточное условие оптимальности) может быть использован для проверки того, что данная однородная марковская стратегия является оптимальной: пусть существуют функции a* = а*(х) и V* = V*(x) такие, что для любого dD

0= f(x, a*(x))+ La*V*f(x, d)+ LdV*(x)

(Ld= Td– I, I –единичный оператор), тогда V* является ценой (V* = V) и стратегия α* = α*(х) является оптимальной.

Лит.: Ховард Р.-А., Динамическое программирование и марковские процессы, пер. с англ., М. 1964.

А. Н. Ширяев.

Математическая энциклопедия

случайный процесс, вероятностные характеристики к-рого могут изменяться по ходу наблюдений в зависимости от поставленной цели, заключающейся в минимизации (максимизации) того или иного функционала, определяющего качество управления. Различают разные виды управляемых процессов как по способу их задания и описания, так и но типу целей управления. Наиболее продвинута теория управляемых скачкообразных марковских процессов и управляемых диффузионных процессов, в случае наблюдений по полным данным. Развивается также соответствующая теория в случае наблюдений по неполным данным (частично наблюдаемые процессы).

Управляемый скачкообразный марковский процесс (у. <с. <м. <п.) - управляемый случайный процесс с непрерывным временем и кусочно постоянными траекториями, в к-ром выбор управления влияет на инфините-зимальные характеристики процесса. Обычно (см. [1], [2]), для построения у. <с. <м. <п. задают: 1) борелевское множество Есостояний; 2) борелевское множество Ауправлений и множества (х)управлений, допустимых в состоянии х, причем есть -алгебра борелевских подмножеств борелевского множества М), и возможен измеримый выбор 3) плотность q( а, t, х, Г) вероятности скачка из x в Г в момент tпри управлении являющуюся борелевской функцией (a, t,x )при любом Г и счетноаддитивнои функцией Г при любых а, t и х, причем функция qограничена, при

Пусть -пространство всех кусочно постоянных непрерывных справа функций со значениями в Е, и пусть Nt(Nt-)- минимальная -алгебра в относительно к-рой измеримы функции при (при s<f) и Любая функция на со значениями прогрессивно измеримая относительно семейства {Nt-}, наз. (естественной) стратегией. Из определения следует, что где Если где - борелевская функция на со свойством то стратегия наз. марковской, а если то стационарной. Классы естественных, марковских и стационарных стратегий обозначаются соответственно и Ввиду возможности измеримого выбора из (х)класс (следовательно, и не пуст. Если qограничена, то по любым и строится единственная вероятностная мера на такая, что и при любых

где -момент первого скачка после - минимальная s-алгебра в содержащая Nt,относительно к-рои измеримо, x*u=xt при и x*u=xt при и > t. Случайный процесс и есть у. <с. <м. <п. Марковское свойство у. <с. <м. <п. состоит в том, что при известном лнастоящем