Присоединяйся к нам в телеграмВступить
Введение в анализ данных
Синергия/МОИ/МТИ/МОСАП ответы 100 баллов

Введение в анализ данных

Вопросов в тесте: 36

Вопросы теста

1. Вычисление среднего значения имеет смысл:

2. Этот коэффициент был предложен К. Пирсоном (1901) как мера отклонения наблюдаемого двумерного распределения в таблице сопряженности от условия статистической независимости признаков. Как называется этот коэффициент?

3. Цель анализа данных — уточнение или обогащение существующего знания об исследуемом явлении или процессе. Сопоставьте действия, соответствующие двум самым прямым способам такого обогащения.

4. На рисунке изображены первая (слева) и финальная (справа) итерации извлечения аномальной группы из структуры некоторого множества объектов. Малая звезда представляет центр аномальной группы.

5. Обычно при изучении связей в данных выделяют как минимум две группы признаков: , или входные, признаки и , или выходные, признаки.

6. В таблице приводятся данные о пяти признаках восьми компаний:

7. Расставьте в правильном порядке шаги алгоритма K-средних.

8. Ниже перечислены три типа методов кластер-анализа:

9. Если прогнозирование ведется по количественной переменной, а прогнозируемый признак категориальный, то можно использовать обучение для выработки правила, позволяющего прогнозировать значения целевого признака на тесте, при условии, что значения входных признаков известны. Пользователь оценивает качество правила, сличая прогнозы на тесте с известными ему значениями выходного признака — чем больше совпадений, тем выше качество прогноза. Как называется такое правило?

10. Как называется несколько устаревшее название для дисциплины, занимающейся построением классификационных решающих правил (распознавание с учителем, supervised learning) или кластеров (распознавание без учителя, unsupervised learning) по данным наблюдений?

11. Какие объяснения наиболее подходят этим названиям среднего значения количественного признака?

12. Самый понятный и исчерпывающий способ агрегирования — это распределение, представленное так называемой гистограммой. На оси признака х отмечают границы, в которых изменяется признак, т. е. его минимальное и максимальное значения на имеющихся объектах. Отмеченный интервал, называемый также размахом признака, делят на некоторое число непересекающихся интервалов одинаковой длины. Затем подсчитывают, сколько объектов попадает в каждый такой интервал, и рисуют столбики высотой, соответствующей числу объектов в нем. Как называются такие интервалы?

13. Поставьте в правильном порядке шаги алгоритма выделения аномальной группы

14. Рассмотрим признак x, изменяющийся в пределах между 1 и 10. Разделим размах x на 9 бинов. Частоты x в бинах в порядке нумерации равны: 10, 20, 10, 20, 30, 20, 40, 20, 30. Сколько всего наблюдений x?

15. На графике изображена функция плотности.

16. В таблице приводятся данные о пяти признаках восьми компаний:

17. Рассмотрим модель «мешок слов» в задаче выявления корреляции по данным следующей таблицы.

18. На одном и том же наборе объектов исследуется зависимость двух количественных признаков x и y. Коэффициенты уравнения y = ax + b, наклон a и сдвиг b подобраны таким образом, чтобы суммарная ошибка, измеряемая суммой квадратов невязок, была минимальной. Как называется такое уравнение?

19. Для анализа связи между двумя номинальными признаками составляют следующую таблицу. Строки таблицы соответствуют категориям одного признака, а столбцы — категориям другого признака. Элемент на пересечении строки и столбца — количество объектов, обладающих соответствующими категориями и того и другого признаков. Такая таблица называется таблицей

20. При этом подходе глобальный поиск решений сложных задач оптимизации выполняется с помощью имитации процесса наследования генов в популяции. Для этого организуется процесс эволюции некоторого множества возможных решений, каждое из которых представлено в виде линейной «хромосомы». При переходе от поколения к поколению используются вероятностные механизмы генерации «брачных пар», «кросс-овера», «мутаций», «сохранения элиты». Как называются такие методы поиска решений?

21. При нахождении параметров линейной регрессии y = ax + b используется невязки (ошибки регрессии) — коэффициенты ei для пар (xi, yi) такие, что верны уравнения yi = axi + b + ei (i = 1, 2, ... N). Минимизируется средняя квадратичная ошибка L(a, b) = Σi ei2 / N = Σi (yi – axi – b)2 / N­.Какого типа функция L(a, b)?

22. Какой из коэффициентов, позволяющих оценить, насколько распределение отличается от равномерного, также называют качественной дисперсией?

23. Как называется совокупность методов, разделяющих объекты таблицы наблюдений в множества (кластеры) таким образом, чтобы сходные объекты попадали в один и тот же кластер, а несходные — в разные кластеры?

24. Этот подход к моделированию связи между входными и выходными признаками, использует структуру взаимосвязанных искусственных нейронов (устройств, испускающих выходной сигнал при накоплении достаточного количества входных сигналов); параметры сети обычно подбираются в процессе машинного обучения. Что это за метод исследования?

25. Что означает совсем низкое или нулевое значение коэффициента корреляции двух количественных признаков?

26. Как называются современные методы оптимизации сложных функций, основанные не на изучении свойств задачи, как в классической математике, а с помощью процессов последовательного изменения популяции решений таким образом, чтобы имитировать какой-либо биологический или социальный процесс (движение роя пчел или колонии муравьев, репетиция оркестра и пр.)?

27. В теории линейных регрессионных уравнений Гальтона — Пирсона широко применяется понятие коэффициента корреляции, отражающего уровень «линейной связи» между двумя признаками. На каком промежутке расположены значения коэффициента корреляции?

28. Поставьте в правильном порядке шаги алгоритма uK-средних (t), где t — порог разрешения, т. е. задаваемое пользователем минимальное количество объектов в аномальной группе, необходимое, чтобы она могла восприниматься как генератор отдельного кластера.

29. Как называется совокупность подходов и методов для автоматизации анализа текстовых документов, включая задачи установления степени сходства текстов, категоризации документов, формирования аннотаций и пр.?

30. В системе МатЛаб есть функции mean(X) и median(X). Они возвращают строку, содержащую средние значения или медианы, соответственно, столбцов матрицы. Какую величину возвращает следующая комбинация этих двух функций: mr = (max(X) + min(X)) / 2?

31. Может ли наличие выбросов — сильно выделяющихся наблюдений — повлиять на картину корреляции между признаками?

32. Установленное в больнице устройство сканировало 200 пациентов; результаты представлены в следующей таблице.

33. Как называется совокупность методов для отыскания интересных закономерностей по данным, организованным в виде компьютерной базы или хранилища данных? Эти «интересные закономерности» образуют как бы вновь обнаруженное знание.

34. Какие объяснения наиболее подходят этим названиям мер разброса количественного признака?

35. P — число между 0 и 1. Как называется значение, разделяющее исходное множество объектов в пропорции P / (1 – P) в соответствии со значениями признака таким образом, что число объектов с большими значениями признака пропорционально P или 1 – P?

36. На диаграмме прямоугольники представляют наблюдаемые данные, овалы — вычислительные структуры, шестиугольники — сравнение наблюдений с предсказаниями.

Нужна помощь именно с твоим тестом?

Написать нам

Ещё материалы, которые могут пригодиться по этой теме.

Все тесты