group-telegram.com/stats_for_science/141
Last Update:
Правильный ответ на вопрос про боксплот:
Мнения в опросе разделились, побеждает ответ про максимальные и минимальные значения в пределах 1.5 IQR, а также довольно популярным оказался ответ про верхний и нижний квартили (на момент написания поста 31% и 19%, соответственно).
Однако я сама проголосовала за отсутствие однозначного ответа, так как в боксплоте могут быть разные настройки усов, поэтому нужно всегда подписывать, что означает ваш боксплот и читать обозначения. В большинстве случаев дефолтный боксплот будет действительно с наблюдаемым максимальным и минимальным значением от соответствующего квартиля в пределах 1.5 IQR, но могут быть и другие варианты.
В комментариях к опросу их обсудили, выношу их сюда в пост.
- Минимум и максимум: довольно часто встречаются боксплоты, где усы обозначают максимум и минимум, даже в статье Variations of Box Plots он именно такой (спасибо Максиму Кузнецову @bqmaks за ссылку на статью).
- 10% и 90% данных: в FastQC, биоинформатическом туле для контроля качества секвенирования, усы боксплотов обозначают 10% и 90% данных, цитата из документации:
The upper and lower whiskers represent the 10% and 90% points
Пример боксплотов оттуда на прикрепленной картинке
- Верхний и нижний квартили обычно обозначают сам ящик, а не усы, возможно популярность этого варианта объясняется тем, что люди невнимательно прочитали вопрос
- Все остальные варианты. Как было подмечено в комментариях, при желании в боксплоте можно настроить все что угодно, даже стандартное отклонение и доверительные интервалы, что конечно не рекомендуется делать.
На картинке к опросу боксплот соответствовал самому дефолтному варианту с 1.5 IQR, код для построения был такой:
library(tidyverse)
library(palmerpenguins)
penguins %>%
filter(species == 'Gentoo') %>%
ggplot(aes(species, bill_length_mm))+
geom_boxplot()+
theme_minimal()
Таким образом, наиболее близким к правильному ответу будет вариант, что усы боксплота соответствуют наблюдаемым максимальным и минимальным значениям от соответствующего квартиля в пределах 1.5 IQR, но могут быть и другие варианты, поэтому всегда нужно подписывать и проверять подписи ✍️
P.S. приходите 20 мая на лекцию по визуализации данных: https://bioinf.me/stat_myths
#base_stat
BY Статистика и R в науке и аналитике

Share with your friend now:
group-telegram.com/stats_for_science/141