Особенности медицинских данных

Первым шагом, предваряющим собственно статистический анализ, является исследование типа данных, основными из которых являются количественные и качественные.

Качественные данные подразделяются на порядковые, или ранговые (например, тяжесть проявлений заболевания), и классификационные, или номинальные (например, перенесенные заболевания, классы ксенобиотиков). Процедура ранжирования данных, т.е. упорядочивания их в соответствии с числовыми градациями, проводится в возрастающем, либо в нисходящем ряду значений. Число градаций, характеризующих данные, не должно быть излишне большим, так как в этом случае увеличивается элемент субъективности.

При обработке данных часто приходится переводить качественные данные в количественные. В свою очередь количественные данные могут подвергаться квантованию в зависимости от поставленной задачи (для выделения интервалов, соответствующих различным состояниям, например температура нормальная, субфебрильная, высокая и др.), и тогда они становятся аналогичны качественным шкалированным.

В случае пропусков информации (отсутствующие данные) нельзя использовать так называемое «обнуление», т.е. приписывать кодовое число нуль, так как это в большинстве случаев совпадает с кодированием нормы по данному признаку. Также методически неверно использовать среднее по классу, особенно при малых выборках, так как классы далеко не всегда являются однородными (гомогенными). Предпочтительно исключать такие наблюдения или кодировать пропущенные данные специальным знаком (числом) при условии, что «обход» таких «значений» предусмотрен в программе, т.е. обработка проводится только по известным значениям данных.

В клинической и экспериментальной медицинской практике исследователь реже употребляет слово «данные», но чаще — «параметры» или «переменные», ставя между этими понятиями знак равенства.

Нужно отличать понятие «переменная» от понятия «признак»: температура тела — параметр (переменная), температура тела более 37° С — признак (человек нездоров). Переменные бывают непрерывными и дискретными, в том числе, дихотомическими (принимающими одно из двух значений, например «здоров — болен»).

В клинической практике переменные часто описываются шкалами. Как было отмечено ранее, шкалы бывают качественными (сознание ясное, спутанное и т.д.), классификационными (цвет кожных покровов — розовые, синюшные, желтушные, характер хрипов в легких — сухие, влажные мелкопузырчатые, крупнопузырчатые и т.д.) и количественные, в том числе интервальные, порядковые, балльные.

Интервальные переменные (например, ударный объем, мл: 50 — 80, менее 50, более 80) полезно использовать для решения конкретной клинической задачи. Их также можно переводить в порядковые (на основе построения шкал), но лучше (при наличии возможности и если это не противоречит смыслу решаемой задачи) использовать собственно количественные значения переменной.

Балльные шкалы получают по-разному: после предварительной математической обработки, на основе чисто клинической оценки параметра, комбинированным способом.

Как правило, затруднения в отнесении параметров к количественным или качественным не возникают. Гораздо сложнее при переводе качественных данных в количественные, когда реально нужно определить «вес» градаций качественного параметра. Не всегда правомерен вариант «в лоб»: 1, 2, 3, 4 и т.д. (но не более девяти значений, исходя из известного закона в области психологии, определяющего пределы способности человека к переработке информации). Часто для получения реальных «весов» параметров необходимо проводить дополнительное исследование.

Особым типом данных являются даты. Бывает, что по смыслу работы с ними приходится производить действия (например, определять, сколько времени прошло между соседними исследованиями), поэтому нужно следить, чтобы они записывались в определенном формате.

Важен вопрос о точности измерения и представления медицинских параметров. Понятно, что точность исходных данных определяется точностью метода и(или) прибора, с помощью которых осуществляется измерение.

В описательной статистике при работе с медицинскими данными необходимо поступать следующим образом: с одной стороны, не допускать потерь информации исходно — использовать данные с той точностью, которая имеет место при измерении; с другой — при представлении результатов статистической обработки данных не приводить избыточной информации — в большинстве случаев достаточно той точности представления информации, что и в исходных данных, либо использования одного Дополнительного разряда. Обычно при предъявлении числовых данных указываются два знака после запятой. Исключением являются случаи представления констант и весовых коэффициентов функций, полученных в результате многомерного анализа (например, дискриминантного); тогда в результирующих таблицах обязательно должны приводиться все цифры после запятой.

Следует остановиться на еще одной особенности медицинских данных.

В математической статистике выводы основаны на допущении: то, что верно на случайной выборке, верно и для генеральной совокупности, из которой она получена.

Генеральная совокупность — это набор данных, описывающих нечто всеобъемлющее, например все дети, живущие на планете Земля, вся совокупность пациентов, которые могли бы получать определенный препарат и т. п.

Выборка — часть генеральной совокупности, описывающая ее с той или иной долей погрешности.

Часто сформировать истинно случайную выборку из генеральной совокупности не представляется возможным в силу того, что для выполнения требований репрезентативности объекты исследования (пациенты) должны проживать на разных континентах земного шара. Проведение таких исследований в настоящее время возможно, однако в силу существенных физиологических различий между людьми, живущими в разных уголках планеты, может быть потерян клинический смысл исследования. Это утверждение справедливо для достаточно широко распространенных в настоящее время международных мультицентровых исследований, посвященных, например, метаболическому синдрому, в которых принимают участие крупные отечественные центры и институты. В таких случаях выборка должна быть репрезентативна к исследуемой популяции (населению РФ или определенных, этнически сходных, регионов России).

Современная технология статистического анализа данных включает:

1) постановку задачи и планирование исследования: составление детального плана сбора исходных данных, определение характера выборки;

2) подготовку данных;

3) выбор методов обработки данных;

4) проведение анализа данных;

5) интерпретацию и представление результатов анализа.

Суть современной технологии обработки медицинских данныхс помощью методов математической статистики и их последующей интерпретации кратко изложена в подразд. 3.3 — 3.5.

5 6 7 8 9 10 11

Подборка статей по вашей теме: