Re: 真是傻眼的民調...
看板media-chaos (媒亂(媒體亂象))作者nightcatman (夜貓)時間19年前 (2007/08/16 09:16)推噓0(0推 0噓 0→)留言0則, 0人參與討論串8/27 (看更多)
※ 引述《waynedd (加西莫多)》之銘言:
在此我再次強調
我在這討論串中對這主題唯一的主張就是
"無法用30%左右的拒訪率就完全否定某個統計結果"
請參閱我在11913的推文內容
我並沒有否認追求降低拒訪率的種種方法
也沒有直接斷定這個統計結果是對是錯
所以如之前推文所述
請先確定我們在講的是同一件事
: 不知道找到被我暱稱為「雷根事件」的內容了沒,乾脆我來直接揭曉好。
: http://0rz.tw/132W2
: 這個案例是我的統計老師課堂上所說,他也曾經在投書中提過該案例,因為
: 沒有錄音也沒有把該投書剪報留存,所以我就引用吳統雄教授所寫的東西。
: 這個案例我之前寫的內容也說過,這次我就把它寫清楚,畢竟這個事件讓人
: 知道追樣本的重要性。
: 1984年雷根對上孟岱爾,當初民調結果被認為這是一場勢均力敵的選戰,不
: 過雷根可能會是慘勝;最終結果出來了,雷根也確實獲得勝利,但是知道那
: 次選舉的人都知道,雷根是獲得壓倒性的勝利。就結果來說,民調看似是準
: 的,預測雷根獲勝結果也是如此,但是有人不滿足,認為結果是大勝但是民
: 調卻呈現勢均力敵,因此就決定追到每一個原本抽出的樣本,詢問出原本的
: 該名受訪者的意向,重做後的結果也確實最接近選舉完之後的差距。
: 這個事件說明了幾件事情:第一,一開始抽出的樣本是具有代表性的,不能
: 隨意替換;第二,某一方的支持者具有一些特性,不易被調查到,例如「雷
: 根事件」中,雷根支持者行動力強,所以很願意去參加選舉人舉辦的晚會,
: 而對手的支持者因為年紀偏高而比較不願意出走動,所以接到電訪機會高;
: 第三,建立追樣本的規範。
: 我用的是「替代樣本」這個字眼,因為拒訪率只是會產生原樣本被替代的一
: 種可能性,像是沒有接起電話因此而被替代的,這是從拒訪率中所看不到的
: 。因此,看到拒訪率好像只有三成沒什麼影響,實際原樣本被替代的比率更
: 是高過可被計算出的拒訪率。
我想你並沒有正確理解這個事件的原理
這個事件之所以會發生替代樣本有誤差的情況
原因在於 "美國共和黨員較不容易在家" 這個事實
也就是說, 發生替代的原因(不在家)正好帶有能影響結果的bias(共和黨員)
所以你可以很確定的說
在這個例子裏替代樣本確實會造成誤差
但,很顯然的,這樣的bias並不一定會存在於所有的例子裏
以本例而言
如果不在家的人所支持政黨的分佈和母體並無差異
那麼你不管換幾次樣本,替代樣本都不可能會造成誤差
你也許會說,在實作上,這種隱性的bias經常都是存在的
那ok, 因為這是一個經驗性的敘述
你說的那些民調改善辦法,也是基於這種經驗性的原則來發展的
但我要說的是,理論上來說
替代樣本就是有不具bias的可能性,你無法否認
: 所以,「替代樣本『可能』會造成最後結果失真,但並非『一定』會失真」
: ?顯然這句話是不成立,因為「雷根事件」就很明白的顯示出有誤差,如果
: 認為「舉例無用」的話,那看看民意調查裡為何須提出追樣本、imputation
: 、post-stratification 這幾種「補救辦法」?有人提出多有「創見」的觀
: 點,甚至認為「替代樣本比較接近母體分佈」的可能性,哇嗚!那乾脆喊出
: 其實指指點兵也有「接近母體分佈」的可能性好了,一定是瘋子才會為了只
: 是決定該打哪些電話號碼,發展出了起碼六種抽樣方法。更別提imputation
: ,為了「補救」甚至需要建立模型,post-stratification 的研究起碼有八
: 本具有里程碑的文獻。替代原樣本會不會造成失真?我給的答案就是:一定
: 會,肯定會。
我前段已回覆
我的答案就是: 理論上就是不一定會
你所說的"一定"是基於經驗法則,並不是數學
數學並不是用舉例來證明的
另外這邊你提到imputation和post-stratification
其實有點離題
這些都是事後用經驗性的假設來補data的辦法
選取某些主要變數當做missing data的分佈
或是選用其他相同調查對象的結果當標準來加權原樣本以補上data
但,選取的過程極端仰賴經驗
如果所選的和母體分佈差太多,反而會做出更糟的結果
但不論如何
提這些補data的方法,都和我想要講的主題
"無法用30%左右的拒訪率就完全否定某個統計結果" 離題太多
再次強調
我並沒有要否定使用這些補data的技巧
我只是要說, 30%左右的拒訪率, 你不能說他一定是錯
甚至就算你要補data,也還有越補越差的風險在
並不是有補誤差就一定會降
: 「舉例無用」?看看誤解以為我理解錯的案例,為何文學文摘用的方法會認
: 為失真而被取代?從這個案例中學習到樣本多不見得是好,樣本有代表性才
: 重要,如果「案例無用」,那請問有人會相信電視台下要打電話進去投票的
: 「民調」嗎?有人會相信網路上滑鼠點一點作出來的「民調」嗎?這些都跟
: 文學文摘的作法一樣,甚至比寄信函還方便還更即時。而且,又都在認為母
: 體未知下,以「『可能』會造成最後結果失真,但並非『一定』會失真」、
: 「比較接近母體分佈」來辯解,這樣豈不是打電話去投票、用網路去投票的
: 結果都可信了?
首先, 我從來沒說過 "樣本多就是好", 我只認為"有比較大的可能性是好"
真要嚴謹的講統計,話都要講得很保守才行
我仍舊認為你有錯誤的理解
你把別人用來處理常見案例的經驗性原則
誤解為是理論上的必然
再重覆一次, 話要講得很保守
你得要分清楚"常見"和"一定"的差別所在
: 最後,如果只是講個「分布」就表示「數學理論」,那我所說的案例可包含
: 了前人運用了無數的「數學理論」與發想。
分佈當然是數學
前人運用數學理論來改善抽樣方法當然也是數學
但是你必須要了解這些改善抽樣方法背後的數學基礎
以及它們適用的狀況,條件,和限制為何
並不是一個方法做出來,就一定會在所有情況下都做出必然的結果
尤其是統計方法,這種情況更常發生
整個討論串下來,我覺得這是你最大的盲點所在
所以我才會說,你對於"演進史"這種事的認知,高於你對於理論本身的認知
以上
--
※ 編輯: nightcatman 來自: 163.1.159.233 (08/16 09:31)
討論串 (同標題文章)
media-chaos 近期熱門文章
PTT影音娛樂區 即時熱門文章