Поделиться

Большая Советская энциклопедия

раздел математической статистики, объединяющий практические методы исследования регрессионной зависимости между величинами по статистическим данным (см. Регрессия). Цель Р. а. состоит в определении общего вида уравнения регрессии, построении оценок неизвестных параметров, входящих в уравнение регрессии, и проверке статистических гипотез о регрессии. При изучении связи между двумя величинами по результатам наблюдений (x1, y1), ..., (xn,yn) в соответствии с теорией регрессии предполагается, что одна из них Yимеет некоторое распределение вероятностей при фиксированном значении х другой, так что

Е(Y | х)=g(x, β) и D(Y |х) = σ2h2(x),

где β обозначает совокупность неизвестных параметров, определяющих функцию g(х), a h(x) есть известная функция х (в частности, тождественно равная 1). Выбор модели регрессии определяется предположениями о форме зависимости g(х, β) от х и β. Наиболее естественной с точки зрения единого метода оценки неизвестных параметров β является модель регрессии, линейная относительно β:

g(x, β) = β0g0(x) + ... + βkgk(x).

Относительно значений переменной хвозможны различные предположения в зависимости от характера наблюдений и целей анализа. Для установления связи между величинами в эксперименте используется модель, основанная на упрощённых, но правдоподобных допущениях: величина х является контролируемой величиной, значения которой заранее задаются при планировании эксперимента, а наблюдаемые значения у представимы в виде

yi = g(xi, β) + εi, i = 1, ..., k,

где величины εi характеризуют ошибки, независимые при различных измерениях и одинаково распределённые с нулевым средним и постоянной дисперсией σ2.Случай неконтролируемой переменной хотличается тем, что результаты наблюдений (xi,yi), ..., (xn,yn) представляют собой выборку из некоторой двумерной совокупности. И в том, и в другом случае Р. а. производится одним и тем же способом, однако интерпретация результатов существенно различается (если обе исследуемые величины случайны, то связь между ними изучается методами корреляционного анализа (См. Корреляционный анализ)).

Предварительное представление о форме графика зависимости g(x) от х можно получить по расположению на диаграмме рассеяния (называемой также корреляционным полем, если обе переменные случайные) точек (xi,(xi)), где (xi) —средние арифметические тех значений у,которые соответствуют фиксированному значению xi. Например, если расположение этих точек близко к прямолинейному, то допустимо использовать в качестве приближения линейную регрессию. Стандартный метод оценки линии регрессии основан на использовании полиномиальной модели (m ≥ 1)

y(x, β) = β0 + β1x + ... + βmxm

(этот выбор отчасти объясняется тем, что всякую непрерывную на некотором отрезке функцию можно приблизить полиномом с любой наперёд заданной степенью точности). Оценка неизвестных коэффициентов регрессии β0, ..., βm и неизвестной дисперсии σ2 осуществляется Наименьших квадратов методом. Оценки 0, ..., βm, полученные этим методом, называются выборочными коэффициентами регрессии, а уравнение

определяет т. н. эмпирическую линию регрессии. Этот метод в предположении нормальной распределённости результатов наблюдений приводит к оценкам для β0, ..., βm и σ2, совпадающим с оценками наибольшего правдоподобия (см. Максимального правдоподобия метод). Оценки, полученные этим методом, оказываются в некотором смысле наилучшими и в случае отклонения от нормальности. Так, если проверяется гипотеза о линейной регрессии, то

где xi и yi, и оценка g(х), а её дисперсия будет меньше, чем дисперсия любой другой линейной оценки. При допущении, что величины yi нормально распределены, наиболее эффективно осуществляется проверка точности построенной эмпирической регрессионной зависимости и проверка гипотез о параметрах регрессионной модели. В этом случае построение доверительных интервалов для истинных коэффициентов регрессии β0, ..., βm и проверка гипотезы об отсутствии регрессионной связи βi = 0, i= 1, ..., m) производится с помощью Стьюдента распределения (См. Стьюдента распределение).

В более общей ситуации результаты наблюдений y1,...,yn рассматриваются как независимые случайные величины с одинаковыми дисперсиями и математическими ожиданиями

Eyi, = β1 x1i+ ... + βkxki, i= 1, ..., n,

где значения xji,j= 1, ..., k предполагаются известными. Эта форма линейной модели регрессии является общей в том смысле, что к ней сводятся модели более высоких порядков по переменным x1,...,xk. Кроме того, некоторые нелинейные относительно параметров βi; модели подходящим преобразованием также сводятся к указанной линейной форме.

Р. а. является одним из наиболее распространённых методов обработки результатов наблюдений при изучении зависимостей в физике, биологии, экономике, технике и др. областях. На модели Р. а. основаны такие разделы математической статистики, как Дисперсионный анализи Планирование эксперимента; модели Р. а. широко используются в статистическом анализе многомерном (См. Статистический анализ многомерный).

Лит.: Юл Дж. Э., Кендэл М. Дж., Теория статистики, пер. с англ., 14 изд., М., 1960; Смирнов Н. В., Дунин-Барковский И. В., Курс теории вероятностей и математической статистики для технических приложений, 3 изд., М., 1969; Айвазян С. А., Статистическое исследование зависимостей, М., 1968; Рао С. Р., Линейные статистические методы и их применения, пер. с англ., М., 1968. См. также лит. при ст. Регрессия.

А. В. Прохоров.

Большой энциклопедический словарь

РЕГРЕССИОННЫЙ АНАЛИЗ - раздел математической статистики, объединяющий практические методы исследования регрессионной зависимости величин по статистическим данным. См. Регрессия.

Большой англо-русский и русско-английский словарь

regression analysis

Англо-русский словарь технических терминов

regression analysis

Физическая энциклопедия

РЕГРЕССИОННЫЙ АНАЛИЗ

- раздел матем. статистики, посвящённый методам анализа зависимости одной физ. величины Y от другой - х. Пусть в точках х п независимой переменной x получены измерения Yn. Нужно найти зависимость ср. значения величины 4033-7.jpg от величины х, т. е. 4033-8.jpg, где a - вектор неизвестных параметров а i (т. е. вектор, компонентами к-рого являются ai). Ф-цию 4033-9.jpgназ. ф-цией регрессии. Обычно предполагают, что 4033-10.jpg является линейной ф-цией параметров а, т. е. имеет вид

4033-11.jpg

где fi(x) - заданные ф-ции. В этом случае матрицу А ni=fi(xn) наз. регрессионной матрицей. Для определения параметров ai обычно используют наименьших квадратов метод, т. е. оценки ai определяют из условия минимума функционала

4033-12.jpg

где - дисперсии ошибок измерений Yn в предположении,4033-13.jpgчто они не коррелированы, и из минимума функционала

4033-14.jpg

для коррелиров. измерений с корреляц. матрицей R. В качестве ф-ций fi(x) при небольших I (I4033-15.jpg5) обычно служат степенные ф-ции fi(x)= xi. Часто используют ортогональные и нормированные полиномы на множестве х п:

4033-16.jpg

В этом случае легко найти оценку 4033-17.jpg

4033-18.jpg

Отсюда следует, что вычисление 4033-19.jpgне зависит от вычисления других 4033-20.jpg.

Популярно использование в качестве fi(x). сплайнов В i(x), к-рые обладают двумя осн. свойствами: а) В i(x)- полином заданной степени; б) В i(x )отличен от нуля в огранич. окрестности точки х i.

При поиске ф-ции регрессии в виде (1) естественно возникает вопрос о кол-ве членов I в сумме (1). При малом значении I нельзя достичь хорошего описания 4033-21.jpg, а при большом - велики статистич. ошибки ф-ции регрессии.

В предположении, что вектор ошибок измерений Yn распределён нормально, можно использовать статистические критерии, ивыбрать то I, к-рое является оптимальным при данном множестве измерений Yn. В случае, когда fi(x) - ортогональные полиномы, это особенно просто. Как видно из (4), дисперсия 0i равна 1 и по значению <Лит.: Клепиков Н. П., Соколов С. Н., Анализ и планирование экспериментов методом максимума правдоподобия, М., 1964; Кендалл М. Дж., Стьюарт А., Статистические выводы и связи, пер. с англ., М., 1973; Се-бер Дж., Линейный регрессионный анализ, пер. с англ., М., 1980. В. П. Жигунов.

Энциклопедический словарь

регрессио́нный ана́лиз

раздел математической статистики, объединяющий практические методы исследования регрессионной зависимости величин по статистическим данным. См. Регрессия.

* * *

РЕГРЕССИОННЫЙ АНАЛИЗ

РЕГРЕССИО́ННЫЙ АНА́ЛИЗ, раздел математической статистики, объединяющий практические методы исследования регрессионной зависимости величин по статистическим данным. См. Регрессия(см. РЕГРЕССИЯ (в математике)).

Математическая энциклопедия

- раздел математич. статистики, объединяющий практич. методы исследования регрессионной зависимости между величинами по статистич. данным (см. Регрессия). Проблема регрессии в математич. статистике характерна тем, что о распределениях изучаемых величин нет достаточной информации. Пусть, напр., имеются основания предполагать, что случайная величина Yимеет нек-рое распределение вероятностей при фиксированном значении хдругой величины, так что

где b - совокупность неизвестных параметров, определяющих функцию g(x), и нужно по результатам наблюдений определить значения параметров. В зависимости от природы задачи и целей анализа результаты эксперимента по-разному интерпретируются в отношении переменной х. Для установления связи между величинами в эксперименте используется модель, основанная на упрощенных допущениях: величина хявляется контролируемой величиной, значения к-рой заранее задаются при планировании эксперимента, а наблюдаемые значения представимы в виде где величины ei характеризуют ошибки, независимые при различных измерениях и одинаково распределенные с нулевым средним и постоянной дисперсией. В случае неконтролируемой переменной результаты наблюдений (x1 у1,),..., ( х п, у п )представляют собой выборку из нек-рой двумерной совокупности. Методы Р. а. одинаковы и в том, и в другом случае, однако интерпретация результатов различается (в последнем случае анализ существенно дополняется методами теории корреляции).

Исследование регрессии по экспериментальным данным производится методами, основанными на принципах средней квадратич. регрессии. Р. а. решает следующие основные задачи: 1) выбор модели регрессии, что заключает в себе предположения о зависимости функций регрессии от x и b, 2) оценка параметров b в выбранной модели методом наименьших квадратов, 3) проверка статистич. гипотез о регрессии.

Наиболее естественной с точки зрения единого метода оценки неизвестных параметров является модель регрессии, линейная относительно этих параметров:

Выбор функций gi(x)иногда определяется по расположению экспериментальных значений ( х, у )на диаграмме рассеяния, чаще - теоретич. соображениями. Предполагается также, что дисперсия s2 результатов наблюдений постоянна (или пропорциональна известной функции от x). Стандартный метод оценки регрессии основан на использовании многочлена нек-рой степени

или в простейшем случае - линейной функции (линейная регрессия)

Существуют критерии линейности и рекомендации по выбору степени аппроксимирующего многочлена.

В соответствии с принципами средней квадратич. регрессии оценка неизвестных регрессии коэффициентовb0,..., bm и дисперсии s2 осуществляется методом наименьших квадратов. Согласно этому методу в качестве статистич. оценок параметров b0,..., bm выбираются такие значения , к-рые обращают в минимум выражение

Многочлен , построенный методом наименьших квадратов, наз. э м п и р и ч е с к о й л и н и е й р е г р е с с и и и является статистич. оценкой неизвестной истинной линии регрессии. При гипотезе линейности регрессии уравнение эмпирич. прямой регрессии имеет вид

где

Случайные величины наз. в ы б о р о ч н ы м и к о э ф ф и ц и е н т а м и р е г р е с с и и. Несмещенная оценка параметра s2 дается формулой

Если дисперсия зависит от х, то метод наименьших квадратов применим с нек-рыми видоизменениями.

Если изучается зависимость случайной величины Yот нескольких переменных , то общую линейную модель регрессии удобнее записывать в матричной форме: вектор наблюдений ус независимыми компонентами имеет среднее значение и ковариационную матрицу

(*)

где - вектор коэффициентов регрессии, , i=1,..., п, j=1,..., k, - матрица известных величин, связанных друг с другом, вообще говоря, произвольным образом, I - единичная матрица n-го порядка; при этом . В более общем случае допускается корреляция между наблюдениями :

где матрица Аизвестна, но эта схема сводится к модели (*). Несмещенной оценкой b по методу наименьших квадратов является величина

а смещенной оценкой для s2 служит

Модель (*) является наиболее общей линейной моделью, поскольку она применима к различным регрессионным ситуациям и включает в себя все виды параболической регрессии Y по (в частности, рассмотренная выше параболич. регрессия Y по хпорядка тможет быть сведена к модели (*), в к-рой трегрессионных переменных функционально связаны). При таком линейном понимании Р. а. задача оценки р и вычисления ковариационной матрицы оценок сводится к задаче обращения матрицы .

Указанный метод построения эмпирич. регрессии в предположении нормального распределения результатов наблюдений приводит к оценкам для b и s2, совпадающим с оценками наибольшего правдоподобия. Однако оценки, полученные этим методом, являются в нек-ром смысле наилучшими и в случае отклонения от нормальности, если только объем выборки достаточно велик.

В данной матричной форме общая линейная модель регрессии (*) допускает простое обобщение на тот случай, когда наблюдаемые величины являются векторными случайными величинами. При атом никакой новой статистич. задачи не возникает (см. Регрессии матрица).

Задачи Р. а. не ограничиваются построением точечных оценок параметров b и s2 общей линейной модели (*). Проблема точности построенной эмпирич. зависимости наиболее эффективно разрешается при допущении, что вектор наблюдений распределен нормально. Если вектор распределен нормально и любая оценка является линейной функцией от , можно заключить, что величина распределена нормально со средним bi и дисперсией , где bii- диагональный элемент матрицы . Кроме того, оценка s2 для s2 распределена независимо от любой компоненты вектора а величина имеет ". хи- квадрат" распределение с( п-k )степенями свободы. Отсюда следует, что статистика

подчиняется Стьюдента распределению с n-kстепенями свободы.

Этот факт используется для построения доверительных интервалов для параметров bi- и для проверки гипотез о значениях, к-рые принимает величина bi. Кроме того, появляется возможность найти доверительные интервалы для при фиксированных значениях всех регрессионных переменных и доверительные интервалы, содержащие следующее (n+1)-е значение величины (т. н. интервалы предсказания). Наконец, можно на основе вектора выборочных коэффициентов регрессии построить доверительный эллипсоид для вектора b или для любой совокупности неизвестных коэффициентов регрессии, а также доверительную область для всей линии или прямой регрессии.

Р. а. является одним из наиболее распространенных методов обработки экспериментальных данных при изучении зависимостей в физике, биологии, экономике, технике и др. областях. На моделях Р. а. основаны такие разделы математич. статистики, как дисперсионный анализ и планирование эксперимента, эти модели широко используются в многомерном статистическом анализе.

Лит.:[1] К е н д а л л М. Д ж., С т ь ю а р т А., Статистические выводы и связи, пер. с англ., М., 1973; [2] С м и рн о в Н. В., Д у н и н - Б а р к о в с к и й Н. В., Курс теории вероятностей и математической статистики для технических приложений, 3 изд., М., 1969; [3] А й в а з я н С. А., Статистическое исследование зависимостей, М., 1968; [4] Р а о С. Р., Линейные статистические методы и их применения, пер. с англ., М., 1968; [5] Д р е й п е р Н., С м и т Г., Прикладной регрессионный анализ, пер. с англ., М., 1973. А. В. Прохоров.

Русско-английский политехнический словарь

regression analysis

Dictionnaire technique russo-italien

analisi di regressione

Русско-украинский политехнический словарь

реґресі́йний ана́ліз

Русско-украинский политехнический словарь

реґресі́йний ана́ліз

Естествознание. Энциклопедический словарь

раздел матем. статистики, объединяющий практич. методы исследования регрессионной зависимости величин по статистич. данным. См. Регрессия.

Энциклопедия социологии

. см. АНАЛИЗ РЕГРЕССИОННЫЙ.