Problema
Filtrar miles de palabras de titulares frente a resultados de mercado garantiza ganadores aparentes por pura suerte, así que el análisis tiene que separar la señal que sobrevive a la disciplina del ruido que se cuela por la puerta.
Contexto
El notebook empareja 1.989 días de negociación de precios del DJIA, el más reciente fechado el 1 de julio de 2016, con titulares diarios de noticias mundiales de Reddit, construye una matriz dispersa de conteo día por palabra, y filtra 5.271 palabras candidatas hasta 3.183.
Método
Las regresiones OLS marginales puntúan cada palabra dos veces, frente a los retornos diarios y frente a la volatilidad logarítmica máximo-mínimo; Benjamini-Hochberg en q = 0,1 fija la puerta de descubrimiento; LassoCV con partición de serie temporal maneja la selección conjunta; un doble lasso reestima la persistencia de la volatilidad frente a 1.429 controles de palabras seleccionadas; un bootstrap de 30 remuestreos examina la estabilidad de la penalización.
Resultado
Los retornos se comportaron como ruido: 121 de 3.183 palabras cayeron por debajo de p = 0,05, el histograma de valores p se mantuvo plano, y la puerta FDR conservó exactamente una palabra, damn, en p = 1,0262e-05. La volatilidad conservó 12 palabras, encabezadas por tunisia, georgia y terror, aunque la volatilidad del día anterior las superó a todas: el lasso de solo palabras anuló todos los coeficientes, mientras que añadir el único término autorregresivo produjo seis coeficientes seleccionados, un R² dentro de muestra de 0,262, y un coeficiente de persistencia de 0,442 que el doble lasso redujo a 0,313.
Alcance de verificación
Todo permanece dentro de muestra sobre un único conjunto de datos, la pasada archivada ejecutó algunas celdas fuera de orden según los conteos de ejecución guardados, y el notebook trata el ejercicio como trabajo de curso de selección de variables y no como un hallazgo operable en mercado.
Evidencia
El repositorio público incluye el notebook ejecutado, cuyas salidas guardadas y código fuente de celda contienen cada número citado, más un README que remite a los datos fuente de Kaggle, que permanecen externos por razones de licencia.