งานวิจัยที่เผยแพร่ใน IMC 2024 เปลี่ยนการตรวจจับให้เป็นการทดลองออนไลน์ที่ทำซ้ำได้ โดยไม่เชื่อเพียงว่าเบราว์เซอร์อ้างว่าเป็นเวอร์ชันใด แต่ให้นับคุณสมบัติของออบเจ็กต์ระดับล่างแล้วเทียบกับเวอร์ชันที่ประกาศ วิธีการจึงน่าอ่านกว่าข้อสรุปเสียอีก
มีคำกล่าวมากมายว่าเบราว์เซอร์ฟิงเกอร์พรินต์สามารถถูกตรวจจับได้หรือไม่ และส่วนใหญ่หยุดอยู่ที่ข้อสรุป แทนที่จะถกกันว่าใครชนะหรือแพ้ การดูว่านักวิจัยเปลี่ยนคำถามนี้ให้เป็นการทดลองที่ทำซ้ำได้อย่างไร และใช้ตัวชี้วัดใดในการตัดสิน ย่อมให้ข้อมูลมากกว่า
งานวิจัยชื่อ Browser Polygraph ซึ่งเผยแพร่ใน ACM Internet Measurement Conference (IMC) 2024 จัดทำโดยนักวิจัยจาก Arizona State University, Boston University และ Amazon โดยมี DOI 10.1145/3646547.3688455 แทนที่จะใช้ข้อมูลจำลองในห้องทดลอง ระบบถูกนำไปใช้ในสภาพแวดล้อมจริงของบริษัทการเงินขนาดใหญ่เป็นเวลา 4.5 เดือน ครอบคลุม 205,000 เซสชันของผู้ใช้จริง มีการทดสอบโซลูชันพรางสภาพแวดล้อมที่พบได้ทั่วไป 10 แบบ และใช้ทราฟฟิกของผู้ใช้ปกติเป็นกลุ่มควบคุม
การทดลองถูกวางอย่างไร
การออกแบบสามข้อทำให้สามารถใช้การตรวจจับกับทราฟฟิกทั้งหมดได้โดยไม่กระทบต่อธุรกิจ
คุณลักษณะที่ตรวจต้องมีต้นทุนต่ำ ระบบอ่านเพียงชุดคุณสมบัติที่กำหนดไว้ โดยมีค่าใช้จ่ายต่อครั้งในระดับมิลลิวินาทีและ KB จึงสามารถใช้กับทราฟฟิกทั้งหมดได้โดยไม่ต้องสุ่มตัวอย่างและผู้ใช้แทบไม่รู้สึกถึงผลกระทบ
คุณลักษณะต้องมีเสถียรภาพ งานวิจัยไม่ได้เลือกพารามิเตอร์ที่ผู้ใช้แก้ได้ แต่เลือกโครงสร้างระดับล่างที่เบราว์เซอร์กำหนดมาเอง แต่ละเวอร์ชันมี JavaScript engine ต่างกัน และมีความแตกต่างเล็กน้อยในจำนวน API รวมถึงจำนวนคุณสมบัติของแต่ละออบเจ็กต์ งานวิจัยใช้ช่วง Chrome 110 ถึง Chrome 114 เป็นตัวเปรียบเทียบ โดยระบบนับคุณสมบัติของออบเจ็กต์สำคัญ 28 รายการ แล้วเทียบกับเวอร์ชันที่เบราว์เซอร์ประกาศ หากไม่ตรงกัน แสดงว่าคำประกาศกับพฤติกรรมจริงไม่ได้มาจากฐานเทคนิคชุดเดียวกัน
ป้ายกำกับต้องเชื่อถือได้ แต่ละสภาพแวดล้อมที่ทดสอบถูกนำไปต่อกับทราฟฟิกจริงชุดเดียวกันและตัดสินด้วยกฎเดียวกัน ส่วนกลุ่มควบคุมคือพฤติกรรมปกติของผู้ใช้จริง ดังนั้นผลลัพธ์ไม่ได้บอกแบบอัตวิสัยว่า “ดูเหมือนจริงหรือไม่” แต่บอกว่าทราฟฟิกชุดนี้สามารถถูกแยกออกภายใต้กฎเดียวกันได้หรือไม่
ตัวชี้วัดว่าการจำลองใกล้เคียงของจริงเพียงใด
ตัวชี้วัดในงานวิจัยแบ่งได้เป็นสี่กลุ่ม
- ความสอดคล้อง: เวอร์ชันที่เบราว์เซอร์ประกาศตรงกับโครงสร้างออบเจ็กต์ระดับล่างหรือไม่ นี่คือตัวชี้วัดหลักและปลอมได้ยากที่สุด เพราะการแก้สตริงหนึ่งค่าไม่ได้เปลี่ยนจำนวนออบเจ็กต์และคุณสมบัติภายใน engine ไปพร้อมกัน
- อัตราการตรวจจับ: งานวิจัยทดลองอย่างละเอียดกับสี่โซลูชัน และได้อัตราการตรวจจับระหว่าง 67% ถึง 84%
- ความเบี่ยงเบนจากอุปกรณ์จริง: ภายใต้กฎตัดสินเดียวกัน เบราว์เซอร์ปกติมีคะแนนความเสี่ยง 0 ขณะที่โซลูชันที่ทดสอบมีค่าเฉลี่ย 8.85 ถึง 11.66 คะแนนนี้สะท้อนระยะห่างจากการกระจายจริง ไม่ใช่ความรู้สึกเชิงอัตวิสัยว่าเหมือนแค่ไหน
- ความสามารถในการแยกแยะ: สามารถแยกทราฟฟิกที่ทดสอบออกจากทราฟฟิกปกติได้หรือไม่ หากกลุ่มใดแยกไม่ได้ ก็หมายความว่าภายใต้วิธีนี้ยังไม่เห็นช่องว่างด้านพฤติกรรมจากเบราว์เซอร์จริง
ในสี่ตัวชี้วัด ข้อแรกคือสาเหตุ ส่วนอีกสามข้อเป็นผลตามมา
ผลลัพธ์สี่กลุ่มต่างกันตรงไหน
งานวิจัยแบ่งโซลูชันที่ทดสอบเป็นสี่กลุ่มตามวิธีทำงานในระดับล่าง
กลุ่มแรก คุณลักษณะระดับล่างไม่ตรงกับเบราว์เซอร์จริงเวอร์ชันใดที่รู้จัก จึงไม่มี engine จริงที่สอดคล้องกัน การสแกนง่าย ๆ ก็เผยความไม่ตรงกันได้
กลุ่มที่สอง สภาพแวดล้อมมีคุณลักษณะลายนิ้วมือจริง แต่เมื่อเปลี่ยนตัวตน จะเปลี่ยนเพียงคำประกาศระดับผิว ส่วน engine ด้านล่างยังเหมือนเดิม นี่เป็นรูปแบบที่พบบ่อยที่สุดในงานวิจัย เปรียบได้กับนามบัตรที่เขียนว่าเป็นเวอร์ชันใหม่ แต่สำเนียงยังเป็นแบบเก่า ปัญหาไม่ได้อยู่ที่การปรับแต่ละพารามิเตอร์ดีเพียงใด แต่อยู่ที่ช่องว่างระหว่างคำประกาศกับพฤติกรรม ซึ่งเป็นที่มาของการตรวจจับส่วนใหญ่
กลุ่มที่สาม engine ระดับล่างเปลี่ยนตามตัวตนที่เลือก หากสภาพแวดล้อมประกาศว่าเป็นเวอร์ชันใด ก็ใช้ engine ที่ตรงกับเวอร์ชันนั้น จึงรักษาความสอดคล้องไว้ได้ และตัวตรวจจับนี้ไม่สามารถแยกทราฟฟิกออกได้ งานวิจัยยังระบุว่าการตรวจจับกลุ่มนี้ต้องใช้วิธีที่ซับซ้อนกว่า
กลุ่มที่สี่ไม่แก้ตัวเบราว์เซอร์ แต่เรียกใช้เบราว์เซอร์จริงในเครื่องเสมือนแล้วโหลดการกำหนดค่าเป้าหมาย เนื่องจากตัวเบราว์เซอร์เป็นของจริง ระบบจึงแยกไม่ได้ แต่ต้นทุนการดำเนินงานสูงและขยายขนาดได้ยาก
ความต่างของทั้งสี่กลุ่มไม่ได้อยู่ที่จำนวนพารามิเตอร์ แต่อยู่ที่ว่า คำประกาศกับพฤติกรรมมาจากฐานเดียวกันหรือไม่
ข้อพิจารณาเชิงปฏิบัติในการเลือกโซลูชันสภาพแวดล้อม
จุดเน้นของการตรวจจับเปลี่ยนจากการอ่านคำประกาศไปสู่การตรวจสอบพฤติกรรม ทำให้พารามิเตอร์ระดับผิวที่แก้ไขได้ให้ความได้เปรียบน้อยลงเรื่อย ๆ ในการประเมินจริง:
- ถามเรื่องชั้นระดับล่าง ไม่ใช่แค่รายการพารามิเตอร์ เมื่อเปลี่ยนเวอร์ชันที่ประกาศ ชั้นด้านล่างเปลี่ยนตามหรือไม่ ลายนิ้วมือถูกสร้างอัตโนมัติเป็นชุดค่าที่เกิดขึ้นจริง หรือประกอบค่าด้วยมือ
- เปรียบเทียบสภาพแวดล้อมระหว่างกัน หากหลายสภาพแวดล้อมคืนค่าคุณลักษณะระดับล่างคล้ายกันมาก แสดงว่าการแยกสภาพแวดล้อมยังไม่สมบูรณ์
- ให้ความสอดคล้องมาก่อนความแตกต่าง ยิ่งปรับคุณลักษณะที่ขัดแย้งกันภายในมาก พื้นที่ที่อาจถูกตรวจจับก็ยิ่งใหญ่ขึ้น
- การผ่านหน้าตรวจสอบทั่วไปไม่ได้หมายความว่าแพลตฟอร์มจะยอมรับสภาพแวดล้อมนั้น การตรวจสอบสุดท้ายยังควรใช้ทราฟฟิกจริงปริมาณเล็กน้อยเพื่อทดสอบด้วยตนเอง
หัวใจของการแยกสภาพแวดล้อมคือทำให้แต่ละสภาพแวดล้อมเป็นระบบของตัวเองและสอดคล้องกันภายใน นี่คือสิ่งที่ PurpleMark มุ่งจัดการ ทั้งการตรวจจับและการป้องกันการตรวจจับควรใช้ภายในขอบเขตการปฏิบัติตามข้อกำหนดที่เหมาะสม คุณค่าที่แท้จริงของงานวิจัยนี้คือการทำให้การประเมินมีหลักฐานรองรับ ไม่ใช่การจัดอันดับว่าผลิตภัณฑ์ใดดีหรือแย่


