Oct, 2023

深度实时假设测试

TL;DR我们提出了一个通用的框架,用于构建针对大类非参数测试问题的强大的连续假设检验。该框架可以统一处理多个经典任务,如双样本测试、独立性测试和条件独立性测试,以及现代问题,如对机器学习模型的对抗鲁棒性测试。我们的方法对传统批量测试具有以下优势:1) 它持续监控在线数据流并有效地聚合针对零假设的证据,2) 它在不需要多重测试校正的情况下对类型 I 错误进行严格控制,3) 它根据问题的未知难度调整样本大小要求。我们在测试通过投票框架(testing-by-betting framework)中利用机器学习模型的表示能力方面开发了一种基于原则的方法,这是一种用于设计连续测试的博弈论方法。在合成和真实数据集上的实证结果表明,使用我们的通用框架实例化的测试在多个任务上与专门的基准测试相竞争。