Introducción y explicación detallada de modelos predictivos, regresión lineal simple y múltiple, y su aplicación en análisis estadístico.
Ask about this video. Answers come from its transcript only — with the timestamp, so you can check them.
Generated from the transcript and can be wrong — check the timestamp.
Key Takeaways
- La regresión lineal modela matemáticamente la relación entre variables numéricas, a diferencia de la correlación que solo la cuantifica.
- La regresión lineal simple involucra una variable dependiente y una independiente, mientras que la múltiple usa varias variables independientes.
- El término de error aleatorio es fundamental porque representa factores no observados que afectan la variable dependiente.
- No es posible explicar el 100% de la variabilidad con las variables independientes; siempre existirá un componente de error.
- Los modelos predictivos, incluyendo regresión logística, son herramientas clave para clasificar y predecir eventos en diferentes contextos.
What the video covers
- Se inicia con la diferencia entre correlación lineal y regresión lineal, explicando que la correlación cuantifica la relación y la regresión modela los datos.
- Se define la regresión lineal simple como el modelado de una variable dependiente a partir de una independiente con una ecuación matemática.
- Se introduce la regresión lineal múltiple, que utiliza más de una variable independiente para explicar la variable dependiente.
- Se explica la importancia del término de error aleatorio en los modelos de regresión, que representa factores no observados que influyen en la variable dependiente.
- Se discuten los supuestos básicos para aplicar regresión lineal y la interpretación de coeficientes en los modelos.
- Se ejemplifica con casos prácticos como gastos e ingresos, y variables demográficas para ilustrar el uso de regresión.
- Se menciona la limitación de los modelos lineales y la introducción a modelos lineales generalizados como la regresión logística binaria.
- Se explica cómo interpretar los coeficientes en regresión logística mediante el uso del exponencial para obtener odds ratio.
- Se destaca la utilidad de los modelos predictivos para clasificar y predecir eventos binarios o dicotómicos.
- Se ejemplifica con variables médicas y su impacto en la predicción de enfermedades como la angina.
Chapters
- 00:00Introducción y diferencia entre correlación y regresión lineal
- 05:39Selección de la mejor recta en regresión lineal
- 10:41Regresión lineal simple: definición y componentes
- 15:15Supuestos y utilidad de la regresión lineal
- 20:17Interpretación de coeficientes y utilidad de variables en el modelo
- 29:14Ejemplos prácticos con variables económicas y demográficas
- 50:07Introducción a modelos lineales generalizados y regresión logística
- 63:31Interpretación de coeficientes en regresión logística y aplicación en predicción
Full Transcript — Download SRT & Markdown
Speaker A
¿Qué tal, muchachos? Buenas noches. Vamos a iniciar con nuestra última sesión del curso. Ya hoy día vamos a ver dos temas, así que claro que están muy relacionados, obviamente, ¿no?
Speaker A
Bien. El tema que vamos a ver el día de hoy, muchachos, es análisis de regresión.
Speaker A
Eh, en la sesión anterior hemos hablado sobre eh correlación, si se acuerdan, ¿no? Correlación y también vimos, bueno, la tras anterior sesión, ¿no?
Speaker A
Y pues vimos que era una herramienta muy importante, ¿no? Por ejemplo, si yo tuviera algo así, una variable Y y una variable X, recuerda que para correlación deberíamos tener variables numéricas, en caso extremo, una variable ordinal, ¿no?
Speaker A
Bien, si tuviera este nube de puntos, muchachos, este gráfico dispersión y yo le preguntara a ustedes, ustedes me van a decir que efectivamente esos puntos pues tienen un comportamiento más o menos así, ¿no? Lineal, ¿no?
Speaker A
Entonces, al tener un comportamiento lineal o una relación lineal, se puede cuantificar esa relación, ¿no?
Speaker A
Esta cuantificación de la relación era una correlación lineal, por ejemplo, 0.85. Entonces, si gráficamente yo observaba que la relación entre las dos variables numéricas era lineal y si yo quería cuantificar esa relación, esa cuantificación viene a ser la
Speaker A
correlación lineal, ¿no? Entonces, cuando nos preguntan qué es una correlación lineal, no es más que la cuantificación de la relación lineal entre dos variables numéricas, ¿no? Eso es la correlación lineal, ¿no?
Speaker A
Bien, pero ¿qué viene a hacer entonces la regresión lineal? Si la correlación, muchachos, cuantifica la relación, la regresión lo que hace es modelar, muchachos, el comportamiento de tus datos, ¿no? Ese conjunto de puntos o esa relación de puntos
Speaker A
lo expresa en función a una ecuación matemática. En otras palabras, una correlación cuantifica la relación lineal entre dos variables numéricas, mientras que una regresión modela tus datos, es decir, matemáticamente lo representa con un modelo matemático, ¿no?
Speaker A
Eso es la diferencia, muchachos, entre regresión y correlación. Son conceptos que se usan mutuamente, ¿sí? Se necesitan mutuamente, sí, porque si hay correlación lineal entonces puede haber una regresión lineal, ¿no?
Speaker A
Si no existe linealidad no va a haber regresal, no tiene sentido, ¿no? Eso quiere decir que si mis datos tienen este comportamiento, por ejemplo, ¿no?
Speaker A
y mis datos tienen este comportamiento, obviamente nadie en su sano juicio diría, "Profesor, acá se puede usar una relación lineal." No, nadie diría eso, ¿no?
Speaker A
¿Por qué? Porque acá no existe una relación lineal, muchachos. No existe una relación lineal, no para nada. No, no existe relación lineal ahí, muchachos.
Speaker A
¿Qué es lo que existe ahí? Lo que existe ahí es una relación no lineal.
Speaker A
Por ende, tampoco va a haber regresión lineal. ¿Qué va a haber? Una regresión no lineal, ¿no? Que es otro tema que se ve muy aparte.
Speaker A
Entonces, hay que tener mucho cuidado: si hay correlación lineal, por ende, hay regresión lineal, ¿no? Sí o sí, muchachos.
Speaker A
Eso es la introducción. Bien, empecemos entonces, muchachos. Yo ya tengo mis puntos, ¿no? Acá está mi variable Y, acá tengo mi variable X, ¿no?
Speaker A
Esos puntitos son mis gráficos, es mi gráfico dispersión. Y esos puntitos pues me indican que existe una relación lineal entre esas dos variables numéricas, ¿no? X y muy bien. Si yo quiero encontrar una ecuación que explique el comportamiento
Speaker A
de mis datos, a eso se conoce como regresión lineal, muchachos. Esa ecuación que modela el comportamiento de tus datos se conoce como regresión lineal.
Speaker A
Y obviamente ustedes me dirán, "Profesor, pero por ese conjunto de puntos pueden pasar millones de rectas." Efectivamente, millones de rectas, pero solo uno de ellos va a ser el mejor.
Speaker A
¿Y quién va a ser el mejor? Aquel que minimiza los errores, ¿no? A eso se refiere, ¿no? Pero eso lo vamos a ver después, no se preocupen.
Speaker A
Bien, entonces, muchachos, ¿qué decimos ahora? Se dice que el análisis de regresión es una herramienta de frecuente uso en la estadística, ¿no?
Speaker A
La cual permite investigar relaciones entre diferentes variables cuantitativas mediante la formulación de una ecuación matemática, que esa ecuación matemática se llama el modelo de regresión, muchachos. No, así de simple, muchachos: el modelo de regresión.
Speaker A
¿Qué más se dice? ¿Qué más se dice de la regresión, muchachos? Es una técnica de análisis estadístico utilizada para predecir una variable dependiente a partir de una independiente. ¿Correcto?
Speaker A
Como mi ecuación de regresión es de esta forma, muchachos, ojo, la regresión lineal. Mi variable Y es mi variable dependiente y mi variable X es mi variable independiente.
Speaker A
En otras palabras, muchachos, mi Y obviamente depende de X, ¿no? Mi variable dependiente depende de mi variable independiente, ¿no?
Speaker A
Entonces, si yo conozco X, puedo conocer Y, a eso se refiere, ¿no? Bien. ¿Por qué se le dice regresión lineal simple? Es una muy buena pregunta, ¿no?
Speaker A
Y también hay la regresión lineal múltiple, ¿no? Se dice, muchachos, la regresión lineal simple. Voy a tener una variable dependiente y una variable independiente.
Speaker A
Así de simple. Si tengo un Y y un X, se trata de una regresión lineal simple, ¿no? Donde Y, la variable Y, muchachos, se conoce como la variable dependiente.
Speaker A
Mi X, mi variable independiente. Alfa es el intercepto, ¿no? Como quién dice, una constante, ¿no?
Speaker A
Y acá viene un concepto que muchos no lo entienden, el error. Son variables que no se observan, pero que sí influyen a la variable Y, ¿no?
Speaker A
¿Cómo se entiende eso? Supongamos que tengo dos variables que quiero analizar, muchachos. Miren.
Speaker A
Ah, y que sea gastos, gastos de una persona anualmente, y X va a ser mis ingresos.
Speaker A
Ingresos anuales, ¿no? Entonces, yo sé que mis gastos dependen de mis ingresos, ¿no? Eso yo lo sé, ¿no?
Speaker A
Dependen de mis ingresos, no está en función de los ingresos. Pero la pregunta del millón: ¿solo dependerán de los ingresos mis gastos o también dependerán de otros factores?
Speaker A
Obviamente no. Dependen también de otros factores, muchachos. Dependen de otros factores, ¿no? Entonces, al depender de otros factores, como esos factores yo no los conozco, los puedo incorporar como una variable
Speaker A
aleatoria, ¿no? Lo que conozco y lo que no conozco en conjunto deberían explicar a mi variable dependiente, en este caso los gastos.
Speaker A
Por eso siempre se incorpora, muchachos, una componente aleatoria, ¿no? Esta de acá siempre. ¿Por qué? Porque no siempre vas a conocerlo todo respecto a algo, ¿no? Eso es imposible.
Speaker A
Entonces, todo aquello que no puedes conocer o no lo puedes controlar, en otras palabras, se conoce como variable error aleatorio o variable aleatoria, ¿no?
Speaker A
Eso es la regresión lineal simple, muchachos. Un Y y un X y listo. No hay más, ¿no?
Speaker A
Esa es la constante, ¿no? El famoso alfa, ¿no? Y la regresión lineal múltiple. Bueno, muchachos, la regresión lineal múltiple es cuando tengo más de un solo X, más de una sola variable independiente.
Speaker A
Es decir, tengo un Y que lo voy a modelar usando la variable X1, usando la variable X2, de 2 a más, muchachos. Ya, de 2 a más.
Speaker A
Basta que tenga de dos a más, ya es una regresión lineal. Una regresión lineal múltiple es lo mismo que la simple.
Speaker A
Bueno, la única diferencia es que obviamente ya hay más variables X, ¿no? Y ustedes se preguntarán, "Profesor, pero ¿cómo es posible que si yo incorporo más variables siga habiendo error?
Speaker A
¿Cómo se explica eso?" No, la respuesta es simple, muchachos. Jamás vas a conocer todo acerca de algo.
Speaker A
Es imposible. Siempre va a haber algo que no puedas controlar o no puedas explicar. Eso va en el error, ¿no? Son las variables no observadas, pero que sí influyen en Y, ¿no?
Speaker A
Esa es la diferencia. Entonces, por más que yo incorpore 100 variables, 50 variables, nunca va a poder explicar el 100%. Eso es imposible, no existe.
Speaker A
Entonces, todo aquello que no se puede controlar va, muchachos, en el error. Ya. Error, componente aleatorio, perturbación aleatoria y varios nombres que lo han designado muchos autores.
Speaker A
Error aleatorio es lo más común. Bien. Muchachos, pero acá viene lo triste. El...
Speaker A
Hablemos de la revesión lineal simple, que es lo más sencillo, ¿no? Recuerden que una revisión lineal simple es así, ¿no? Tengo mi intercepto, tengo mi pendiente y la variable asociada, ¿no? Y más un error.
Speaker A
Bien. Para que exista este modelo, muchachos, el error debe tener distribución normal. Es una distribución de probabilidad, muchachos, con media cero y varianza constante.
Speaker A
Esto es un supuesto que sí o sí se debe cumplir muchachos para que el modelo de regresión exista. No es un supuesto.
Speaker A
Si ustedes revisan libros o biografías de regresión, se dice que este supuesto es el supuesto de Gaus Marcó, que propuso eh bueno, que dio como propuesta esta condición para que exista el modelo de regresión, ¿no?
Speaker A
Como quien dice, ¿no? Los errores deben tener distribución normal, un supuesto importante. Sí. ¿Sí o sí?
Speaker A
Homoseasticidad los errores quiere decir que la varianza de los errores es constante. Sí, siempre va a ser constante.
Speaker A
Errores independientes. Quiere decir que la esperanza del error es cero. Sí, el valor esperado es cero.
Speaker A
Estos tres son supuestos fuertes, muchachos. Y esto de acá es un supuesto que cae sobre por su propio peso, ¿no? Si se trata de una regresión lineal, obviamente que las relaciones van a ser lineales ¿no?
Speaker A
Obvio. Pero estos supuestos de acá, muchachos, son los supuestos teóricos que sí o sí se debería cumplir para que yo use el modelo de regresión. Muchachos.
Speaker A
¿Cuál es la mala noticia? que en la vida real, muchachos, es muy complicado pues garantizar con los supuestos teóricos.
Speaker A
¿Qué es lo que se espera? pues que al menos pues se cumpla uno de estos supuestos, eso se esperaría, lo cual al menos te permitiría usar los resultados de manera referencial, ¿no?
Speaker A
De manera inferencial, no tanto porque no garantiza con los supuestos, pero referencial sí es una muy buena prof.
Speaker A
Entonces, por eso hay muchos eh docentes investigadores estudiantes que forzan los análisis de regresión para obtener pues algunos resultados interesantes, ¿no?
Speaker A
Eso es, pero es el punto de partida, muchachos. A partir de la reacción lineal surgen modelos mucho más especializados y mucho más complejos.
Speaker A
Esto fue el punto de partida para los modelos predictivos. Bien, muy bien, muchachos. Ahora hablemos de un tema eh muy interesante llamado evaluación del modelo, muchachos.
Speaker A
Ya yo voy a tener mi modelo de regresión. Correcto. ¿Cómo saber si es bueno o malo el modelo? No, para ello yo voy a proponer un modelo relación lineal múltiple.
Speaker A
Beta sub0 constante beta sub 1 x1 más beta sub2 x2 y así sucesivamente, ¿no? Hasta beta sub k x sub k. Ya, más una parte aleatoria, ¿no?
Speaker A
Bien, acá viene lo interesante, muchachos. Miren, yo estoy viendo que hay coeficientes que acompañan a las variables independientes, ¿no? Beta 1, beta2 y beta su k.
Speaker A
Si mi modelo regresión fuera bueno, cada uno de esos coeficientes, beta1, bet2 y beta can serían diferentes a cero, ¿no?
Speaker A
Solo así podría decir que esas variables si son importantes para el modelo. Pero si yo demuestro que esos coeficientes son iguales a cero, quiere decir que esas variables no aportan nada al modelo.
Speaker A
Son variables que no aportan en nada. Entonces, por ende, yo lo puedo excluir, no, no hay ningún problema.
Speaker A
puedo excluirlo y no habría ningún problema ¿no? De eso se trata la evaluación del modelo. Por ejemplo, tenemos la significancia global.
Speaker A
La significancia global quiere decir, "Oye, quiero saber si en conjunto mi regresión es bueno o malo, que es significativo o no es significativo. Eso es la significancia global.
Speaker A
Para eso hago una prueba de hipótesis. La hipótesis nula, digo que todos los coeficientes son iguales a cero versus la alternativa que al menos un coeficiente es diferente a cer.
Speaker A
Así de simple. Sio, ¿qué es lo que debo buscar? Obviamente rechazar la hipótesis nula y decir que efectivamente al menos un coeficiente es diferente cero.
Speaker A
Si digo que los coeficientes son iguales a cero, quiere decir que la reacción no es útil, es una regresión eh espúrica, le dice. O espúria, ¿no?
Speaker A
Yo debo rechazar la nula para decir que efectivamente los coeficientes son diferentes de cero. Por ende, la reacción sí es significativa.
Speaker A
¿Y cómo se toma una decisión para una prueba de hipótesis? con el P valor y el alfa.
Speaker A
Recuerden, muchachos, que si el p valor, si el p valor es menor a 0.05 general a alfa, se rechaza la hipótesis nula, ¿no? Eso ya lo hemos visto en temas anteriores de prueba hipótesis, ¿no?
Speaker A
Entonces, esa es la manera de ver la significancia global de la regresión. Pero muchos preguntan, "Profesor, ¿y cómo pruebo la significancia individual?" Fácil. La significancia individual es ver si esta variable es útil o no es útil.
Speaker A
Es útil o no es útil en el modelo. Porque si yo demuestro que este coeficiente de beta sub es igual a 0, quiere decir que esta variable no es útil. ¿Por qué? porque no aporta nada al modelo. Si no aporta, ¿por qué lo tengo
Speaker A
que mantener? ¿Se dan cuenta? Bien. Entonces, la significancia individual, muchachos, es corroborar si una variable es significativa o no.
Speaker A
Variable por variable. Es lo mismo, ¿no? Decir que el coeficiente es igual a cer o decir que es diferente de cer.
Speaker A
Yo busco rechazar la nula y caerme con la alternativa. Solo así podré decir que esa variable asociada a su coeficiente sí es importante para el modelo.
Speaker A
Solo si es que demuestro que es diferente cero. Caso contrario, no es nada importante.
Speaker A
Bien, eso es, muchachos, la significancia global y la significancia individual. ¿Cómo se toma una decisión para una prueba de hipótesis? Ya lo vimos también.
Speaker A
Si el p valor es menor a en general al alfa, se rechaza la hipótesis nula. Eso es lo único que se tiene que hacer.
Speaker A
Es lo único que se tiene que hacer. Bien. Entonces, muchachos, ya saben cómo eh qué es supuestos primero, ¿qué es qué es regresión lineal? simple, múltiple, los supuestos necesarios para que exista el modelo de regresión, cómo se evalúa un modelo, ¿no?
Speaker A
Significancia global y significancia individual. Este paso ya es sencillo porque ya vimos prueba de hipótesis.
Speaker A
Bien muchachos. Ahora veamos otra herramienta muy importante llamado el R cuadrado. Mucha seguramente en algún momento lo van a escuchar ¿no?
Speaker A
R cuadrado, también conocido como el coeficiente de determinación. Muchachos, este r² surge de la descomposición de la suma de los cuadrados totales.
Speaker A
Muchachos, existe un concepto llamado suma los cuadrados totales que se descompone como la suma al cuadrados explicado por la regresión y la suma cuadrados residuales, ¿no?
Speaker A
todo lo que el modelo no puede explicar y eso matemáticamente se descompone y es un muy importante para el análisis varianza, ¿no? Que también vimos en la NOVA en sesiones anteriores, ¿no?
Speaker A
Pero gracias a esta descomposición, muchachos, que le asumen los cuadrados totales en estos dos suma de cuadrados, se logra obtener una métrica muy interesante llamado el r².
Speaker A
El r²ado que algunos lo multiplican por un 100% para tener en cifras porcentuales, ¿no?
Speaker A
No hay ningún problema. ¿Cómo se interpreta este esto de acá? Se dice que el modelo explica el R cuadrado por C la varianza de la variable deente.
Speaker A
En otras palabras, ¿no? ¿Qué tanto de y explica mi modelo usando la variable x?
Speaker A
¿Qué tanto? No, obviamente un mayor r²ado es un mejor modelo, ¿no? Ah, por cierto, el r²ado varía de de 0 a uno, ¿no?
Speaker A
De er a uno. Cuanto más próximo a uno, quiere decir que el modelo es bueno, pero si te sale 0.9999 9999.
Speaker A
Ahí es algo sospechoso, ¿no? Puede haber que haya problemas de colinearidad, ¿no? Entre las variables, ¿no? Y eso tampoco es bueno, ¿no? No existe un modelo perfecto, muchacho. Eso no existe. Si te sale 0.99, preocúpate de tu modelo. Algo
Speaker A
está mal, ¿no? Pero si te sale 0.60 70, entonces va bien las cosas, ¿no?
Speaker A
Bien. Esta interpretación de acá no me gusta particularmente y para ello voy a hacer un ejemplo interesante, muchachos.
Speaker A
Miren cómo se va a interpretar de la mejor manera. Ya, miren, supongamos que yo tengo nuevamente gastos y variable gastos, gastos mensuales, ya para no hacer tantos problemas y x mi variable ingreso ¿no?
Speaker A
Supongamos que yo hice mi modelo de regresión lineal simple y me sale lo siguiente, mi regresión lineal, ¿no? Mi ecuación de regresión lineal.
Speaker A
Eso es mi ecuación de relación lineal. Y me sale de acá mi R cuadrado. Y mi R cuadrado, supongamos, me sale 0.85.
Speaker A
que es 85%, no, eso no hay duda. Pregunta del millón, muchachos, ¿cómo se interpreta el cuadrado?
Speaker A
Quiere decir lo siguiente, muchach, el 85% de la variabilidad de mis gastos está siendo explicado por mi variable ingresos.
Speaker A
El 15% restante que no ha sido explicado se se debe a otros factores no incorporados en el modelo.
Speaker A
Eso quiere decir así de sencillo, much complicado. Nuevamente esto tiene que quedar claro, muchachos, porque es muy importante.
Speaker A
Tengo dos variables numéricas, Y gastos y X ingresos. Hago mi regresión, me sale esta cosita. Es un ejemplo didáctico y su r cuadrado me sale 0.85.
Speaker A
¿Qué quiere decir? Que el 85% de la variabilidad de mis gastos está siendo explicado por la variable ingresos.
Speaker A
El 15% restante, que le falta para 100, obviamente se debe a otros factores no incorporados en el modelo.
Speaker A
Eso quiere decir, no se debe a los factores no incorporados en el modelo. Así de simple.
Speaker A
Bien, bien, muchachos. Eso es. Entonces, ya tiene una herramienta más, ¿no? Ahora hablemos de la interpretación de los parámetros, ¿no? Esta es una tarea muy interesante, ¿no?
Speaker A
Los modelos lineales, muchachos, como la reacción lineal simple y la múltiple, su interpretación de los coeficientes es directo, es sencillo, no es nada complicado.
Speaker A
Muy bien. Supongamos que quiero interpretar este coeficiente acá. Supongamos, ¿no?, que quiero interpretar ese coeficiente.
Speaker A
Quiere decir que, ¿cómo interpreto este valor? Este coeficiente al aumentar en una unidad X sub k manteniendo las demás variables constantes, y la variable dependiente aumenta en beta su k unidades ¿no?
Speaker A
Eso se refiere mucho. El incremento es directo por cada unidad que incrementa la variable x k.
Speaker A
Y en incrementa en beta su k unidades es y el efecto es lineal, no es directo.
Speaker A
Si no quedó claro, muchachos, esto vamos a explicarlo con un ejemplo superinesante. Miren, miren muchachos nuevamente mi ejemplito.
Speaker A
E gastos para que se entienda ya, muchachos. Gastos y x es ingresos, ¿no? Bien, supongamos que la regresión me sale, ¿no? Y = 5 + 3x. Esto es mi regresión lineal siempre, ¿no?
Speaker A
Si me piden interpretar este tres, ¿cómo interpreto? La respuesta es simple, ¿no? ¿Qué quiere decir?
Speaker A
quiere decir lo siguiente. Mire, ah, voy a tener un y nuevo, ¿no? Que va a ser el producto del mismo, todo solo que x se va a incrementar en una unidad ¿no?
Speaker A
Claro. X se incrementa en ¿Qué pasa? ¿Cómo interpreto el tres? Quiere decir que por cada unidad que incrementa x, y se incrementa en tres unidades, ¿no? Pero, ¿cómo demostramos eso? Fácil, a X le incrementa en una unidad y acá opero, ¿no?
Speaker A
Sería CCO. Distribuyo ahí. Distribuyen, muchachos el por él y el por él, ¿no? Acá sería 3x + 3, ¿no?
Speaker A
La pregunta, el millón, muchachos. ¿Quién es esto de acá? Es y no. Correcto. Quiere decir que por cada x que se incrementa mi variable original crece en tres unidades ¿no?
Speaker A
Claro, es un poco más engorroso, ¿no? Pero al menos para que se entienda, ¿no?
Speaker A
Si x, muchachos, si x se incrementa en una unidad, y se incrementa en tres unidades. A eso se refiere.
Speaker A
Solo que hice toda esa explicación, pues para que se entiendan que el impacto es lineal, ¿no? Crece en una unidad, tu y aumenta en este caso, en tres unidades también, que es el coeficiente asociado a tu variable de análisis, ¿no?
Speaker A
Bien, eso es, muchachos, a eso se refiere ¿no? Muy bien. Muy bien, muchachos. Entonces, la interpretación de los parámetros, muchachos, en un modelo de revisión lineal y múltiple es muy muy sencilla.
Speaker A
Ojo, esto es cuando tu variable es numérica ¿no? ¿Qué pasa? ¿Qué pasaría si tu x es binaria? Un unos y ceros.
Speaker A
Su interpretación simplemente cambia de categoría, no es nada complicado. Como solamente tiene dos posibles valores, entonces es más sencillo.
Speaker A
Lo vamos a ver en la aplicación, ¿no? Bien, ahora veamos una aplicación, muchachos, de la regresión lineal simple y múltiple.
Speaker A
pero a una un caso de estudio muy interesante de una base de Estados Unidos, una población americana, muchachos, en el cual pues están interesados en eh predecir el costo de salud, muchachos, el costo de salud de una persona
Speaker A
en función a variables, como, por ejemplo, la edad, el sexo de la persona, y consume bebidas alcohólicas, tabaco y si hace ejercicio, ¿no?
Speaker A
Entonces, como quién dice, esto es mi y estos son mis x, ¿no? Entonces, se podrá predecir el costo en salud de una persona en función a sus variables, edad, sexo, alcohol, consumo alcohol, tabaquismo y horas de ejercicio. Se
Speaker A
podrá. Sí, suena interesante, ¿no? Obviamente yo gasto más menos en salud si hago más ejercicio ¿no?
Speaker A
Obvio, no hay una lógica que se sobreentiende fácilmente, ¿no? Pero eso hay que comprobarlo, ¿no? Si efectivamente eso es así, ¿no?
Speaker A
Entonces, es una una aplicación interesante, es una data real de Estados Unidos, muchachos, en el cual se quiere pues eh construir su modelo de regresión para hacer predicciones y muy aparte para hacer predicciones para entender, por ejemplo, qué variables influyen más
Speaker A
en el costo en salud de una persona, ¿no? Quizás el hombre gasta más en salud que las mujeres, no lo sé, pero ya el modelo de regresión nos va a indicar todo ello, ¿no?
Speaker A
Bien, estas son las variables que vamos a usar muchachos ¿no? Obviamente la que está en roja, la variable en color rojo, en este caso, estos son mis y estos son mis x, ¿no? El objetivo es pues formar una revisión lineal
Speaker A
múltiple ¿no? Eso es el objetivo, muchachos. Una un modelo de reacción lineal, ¿no? En este caso múltiple.
Speaker A
Bien, luego de insertar todos los datos, muchachos, en el SPCSCSCS nos sale esto, ¿no? Pero esto lo vamos a ver en el SPCS, no se preocupen.
Speaker A
Abran, por favor, su SPC. Abran su SPCs en la base de datos que dice Helcos.
Speaker A
Ahora abran. Esperemos ahí unos segundos a que cargue. Ya vayan abriendo ustedes también. A ver, vayan cargando, muchachos.
Speaker A
Bien. A ver, vamos a ver. A ver, vamos a ver si cargó. Bien, muchachos. Ahí está, ¿no? Ahí está la base de datos, ¿no?
Speaker A
¿Qué observamos? Primero, en vista de datos tenemos toda la base de datos que son, a ver, ¿cuántos son? Eh, 525 registros.
Speaker A
Entonces, 525 registro, muchachos, ¿no? Toda la muestra como se dice bien. Y tenemos variables por como región, ahí está el ID de la persona, ¿no? fecha en la región, sexo, edad, estado marital, consumo de alcohol, consumo cigarro, horas de ejercicio en promedio y costo
Speaker A
en salud. El objetivo es, bueno, el costo en salud es tu variable y no y vas a usar como variables x todos estos de acá.
Speaker A
Quizás no todos son importantes, elige pues las más importantes, ¿no? Bien. Muy bien, muchachos. Entonces, lo que se tiene que hacer acá es lo siguiente, ¿no?
Speaker A
También puedo ver la vista de variables, ¿no? En la vista de variables están las etiquetas, ¿no? Miren, eh, sexo, sexo de la persona, ¿no?
Speaker A
Miren, el sexo es cero mujer, uno hombre, ¿no? Eh, alcohol, por ejemplo, es el consumo promedio de bebidas alcohólicas por semana ¿no?
Speaker A
Sig es el consumo promedio de cigarros por día. Excel es horas en promedio de ejercicio por semana, ¿no? Y COS es el costo en salud declarado por la persona en el 2020.
Speaker A
Bien, tengo entonces esto es mi variable Y esta van a ser mis variables X. En otras palabras algas.
Speaker A
Uy, ¿qué pasó? Algo así, muchachos, ¿no? Toda esta cosa acá es mi variable, es mi variable y no y todo lo demás van a ser mis variables x ¿no?
Speaker A
Y mi objetivo es pues armar una regresión de este tipo, x1 y así. Obviamente ya lo vamos a hacer con el SPCS, ¿no? No tiene sentido de hacerlo todo de golpe, como se dice, ¿no? Bien. ¿Cómo se hace una regresión en el SPCS,
Speaker A
muchachos? Una regresión lineal multitud. Bueno, déjenme decirle, muchachos, que es una tarea muy sencilla. Creo que lo más complicado es pues toda la teoría que uno ve.
Speaker A
Miren, nos vamos a analizar analizar muchachos regresión lineales ¿no? Ahí, analizar regresión y nos vamos a lineales, ¿no? En lineales, muchachos, lo que tenemos que hacer es simplemente le damos click donde dice, miren, miren muy bien ahí donde dice dependientes,
Speaker A
acá dependientes, que es tu variable costo en salud, donde dice independientes, voy a poner el sexo, voy a poner la edad, consumo de alcohol, cigarros, y horas de ejercicio por semana.
Speaker A
Bien, cuatro variables. Puedo poner otras variables como estado civil, humanital, pero lo voy a dejar por el momento así para que se entienda los análisis ya y para que pueda comparar los resultados con los que están en el
Speaker A
PPT ¿no? Y simplemente le doy, miren, acá está mi Y acá está mi X.
Speaker A
Regresión lineal múltiple, ¿no? Simplemente le doy aceptar. Acá hace algunos cálculos. Acá saca la nova que no lo necesito. Y acá sale pues mi variable eh mi reporte de la regresión, muchachos.
Speaker A
Acá está, ¿no? Miren este reporte de coeficientes. Lo voy a copiar a un Excel y lo vamos a discutir los resultados.
Speaker A
Ya, miren, miren, muchachos, vamos a agrandar esto. Acá está mi constante. Esto sería mi beta 1, beta, beta0, beta 1, beta 2, beta 3, beta 4 y beta 5. mi y sería costo de salud. Acá está, ¿no?
Speaker A
Bien, estos serían mis mis coeficientes de la regresión, es decir, beta sub0, beta 1, beta 2, beta 3, beta 4 y beta 5. Estos serían mis X, ¿no? X, X1, X2, X3, X4 y X.
Speaker A
Muy bien, muchachos. ¿Qué es lo que tenemos que hacer ahora con este modelo de regresión?
Speaker A
Primero, analizar variable por variable si las variables son significativas. Miren, sexo su p valor 0. Es decir, se rechaza la hipótesis nula de que el coeficiente es igual a cer, ¿no? Es decir, se está demostrando que el coeficiente es diferente de cero de
Speaker A
todas las variables. Por ende, en conjunto también la regresión es significativa. Al ser significativa, muchachos, ¿qué es lo que se hace, mejor dicho, ¿qué es lo que se corrobora? Se corrobora que las variables sí son útiles en el modelo,
Speaker A
¿no? Acá está clarito, son significativas ¿no? Muy bien. Entonces, la reción sí es sí es buena como se dice, ¿no?
Speaker A
Pero la pregunta del millón es, a mí me interesa como investigador qué variables son los que aportan más al modelo.
Speaker A
Para eso se fijan en la magnitud. ¿Qué observo? Observo algo muy grande, muchachos. El sexo tiene el coeficiente más grande.
Speaker A
Recuerden que el sexo era, muchachos, uno era hombre y cero era mujer, ¿no? Bien.
Speaker A
Siempre los programas estadísticos van a estimar la categoría máxima, es decir, uno, hombre. Este coeficiente es para hombre siempre, siempre es así. Ya.
Speaker A
Y aparte está recodificado en la base de datos también como uno, hombre y cero, ¿no?
Speaker A
Entonces, ese coeficiente es para el hombre, mejor dicho. ¿Qué quiere decir o cómo se interpreta sabiendo si sexo es una variable dicotómica? Unos y ceros.
Speaker A
Quiere decir que el solo ser hombre, obviamente en vez que una mujer, estarías gastando 509.271 71 en promedio en salud anualmente.
Speaker A
Es decir, si en un año una mujer gasta en salud, el hombre va a gastar en promedio $509 anualmente.
Speaker A
Esa es la magnitud de la brecha de los gastos salariales, en este caso, gastos en salud por sexo, ¿no?
Speaker A
¿Se dan cuenta, muchachos? Es decir, el hombre gasta más en salud, al menos para esa cultura americana.
Speaker A
Y bueno, tiene sentido, ¿no? Porque bueno, los hombres pues tenemos malos hábitos, ¿no? Fumamos, tomamos, somos sedentarios y bueno, a la larga se refleja ¿no?
Speaker A
Entonces el hombre, mejor dicho, el sexo, el solo ser hombre tienes más riesgo que si fueras o si hubieras sido mujer, ¿no? Mira, el impacto es 509, muchachos. Es tremendo.
Speaker A
Bien, la otra variable, mira, todas estas son positivas, muchachos. ¿Qué quiere decir ello? Quiere decir que todas estas variables influyen positivamente en el costo en salud. ¿Qué quiere decir que influye positivamente en el costo en salud?
Speaker A
que a mayor edad, a mayor consumo de alcohol, a mayor consumo de cigarros, a la larga voy a gastar más en salud.
Speaker A
Gasto positivo es al final no no tan bueno, no todo lo positivo es bueno muchachos.
Speaker A
Entonces, voy a gastar más. La edad es imposible controlarla, pero el alcohol y el cigarro puedes mejorar tus gastos en salud, ¿no?
Speaker A
Si controlas esas cuatro variables, sexualidad es inevitable, no se puede, pero tener buenos hábitos sí se puede, no se puede lograr, ¿no?
Speaker A
Y acá hay un valor -271, muchachos. ¿Qué quiere decir ese valor? Quiere decir que el las obras de ejercicio promedio de la semana tienen un impacto negativo sobre el costo en salud.
Speaker A
Si el costo negativo y tiene un impacto negativo, quiere decir que a la larga si tú haces más ejercicio en promedio a la semana, anualmente estarías ahorrando en promedio $271.
Speaker A
estarías ahorrando. En otras palabras, si quieren tener menos costo en salud, tienen que hacer ejercicio.
Speaker A
Así de simple. y el impacto es alto, ¿no? Después del sexo, el las horas de ejercicio por semana es muy importante.
Speaker A
A la larga vas a ahorrar bastante en salud ¿no? A eso se refiere, mucho.
Speaker A
Se refiere. Muy bien. Entonces, muchachos, eso es hacer una regresión ¿no? Entonces, para que vean todo lo útil que puede ser, ¿no?
Speaker A
Bien, bien muchachos. A ver, vamos a ver. Entonces, así es como se interpreta, muchachos. Bueno, hasta ahorita hemos dado una interpretación de la magnitud y del signo, ¿no? Pero vamos a ver cómo se interpretaría pues en cuanto al incremento en una unidad,
Speaker A
¿no? Muy bien. A ver. Vamos a ver un par de ejemplos, ¿eh? A ver, vamos a ver.
Speaker A
Bien. Por ejemplo, el sexo es sencillo, ¿no? Sexo uno es hombre, ser mujer. Quiere decir que es el solo ser hombre respecto a la mujer gastarías 50927 en promedio. Eso es la diferencia o la interpretación. El impacto es eso.
Speaker A
Pero, ¿cómo se interpreta esto de acá? Quiere decir que por cada edad adicional que cumpla la persona, el costo en salud se va a incrementar en promedio en 114.65.
Speaker A
Es inevitable, la edad es inevitable, pero si consumes a bebidas alcohólicas, el el costo en salud se va a incrementar en promedio en 50, ¿no? Pero si consumes cigarros, el incremento en costo de salud en promedio va a ser 9.
Speaker A
Pero por cada hora de ejercicio adicional a la semana, te estarías ahorrando $271 en promedio, ¿no?
Speaker A
Se dan cuenta y la pregunta del millón es, ¿por qué si sabemos que algo que hacer ejercicio nos trae beneficios a corto y mediano plazo y además es gratis? No lo hacemos.
Speaker A
¿Por qué no? Sin embargo, sabiendo que las bebidas alcohólicas nos hacen daño, sabiendo que los cigarros nos hacen daño y además son costosos, pagamos por consumirlo.
Speaker A
Así de contradictorias la habíamos y las estadísticas, en este caso la regresión lineal nos lo está demostrando con datos reales.
Speaker A
Y muchos se preguntarán, "Profesor, ¿y esto para qué se puede usar? para predecir el costo de salud de una persona en función a ciertas variables.
Speaker A
Supongamos que viene una nueva persona, ¿no? Mujer, 40 años, tal, tal, y automáticamente tú ya puedes saber cuánto gasta en salud.
Speaker A
Así de simple, muchachos. Por eso también se lo conoce que es un modelo predictivo, un modelo predictivo, muchachos.
Speaker A
Bien, eso muchachos es lo que les quería comentar ¿no? Muy bien. Muy bien, muchachos.
Speaker A
A ver, vamos a ver. Todo eso lo he interpretado acá en el PPT, ¿no? Así que no se preocupen si algo queda vacío, ¿no?
Speaker A
Acá está, ¿no? Esa misma ecuación ahora está plasmada acá en una ecuación mucho más más sencilla de entender.
Speaker A
Por ejemplo, acá está el impacto de de la variable de sexo, de la edad, consume alcohol, consumo cigarros y horas de ejercicio a la semana, ¿no? En promedio, ¿no?
Speaker A
Y bueno, ¿cómo se interpreta, por ejemplo, el incremento de la edad en un año? ¿No? Un aumento de un año en la edad da como resultado un aumento promedio de 114.7 en costos, ¿no?
Speaker A
Es decir, tu costo se va a incrementar en $114.7 en promedio. Y si queremos interpretar la variable sexo, fácil, ¿no? Recuerden, el sexo es mujer cer y hombre uno. Este coeficiente de 509.3 significa que los costos anuales promedios para
Speaker A
los hombres son 509. dólares más altos que las mujeres. Si las mujeres gastan d anualmente, supongamos en salud, el hombre va a gastar 509 en promedio anualmente.
Speaker A
Eso es el impacto, muchachos, que existe ¿no? Entonces, ¿se han dado cuenta, muchachos, que un modelo de regresión es muy útil? Porque puedes explicar el fenómeno, pero también puedes predecir el costo de salud si conoces esas características de
Speaker A
esa persona, ¿no? ¿Por qué? Porque el modelo ya lo tienes. Ese es el modelo.
Speaker A
Esta es la ecuación de regresión. Como ya lo tienes, lo único que tendrías que hacer es buscar personas, medir sus características, reemplazar y te va a salir el costo en y ahí estarías haciendo ya una predicción del costo en salud de la
Speaker A
persona. ¿Se dan cuenta el la predicción del costo en salud? Entonces, ya se han dado cuenta que las aseguradoras usan pues estos modelos.
Speaker A
sino cómo fijan el la prima de un seguro o es que tiene una bola mágica que miran y y le da un valor, no, no es así.
Speaker A
Existe un modelo que hace que hace la estimación, en este caso la predicción del valor de el costo de la prima, ¿no?
Speaker A
Y así para los seguros de vida, los seguros vehiculares, eh un montón de seguros, ¿no? Entonces usan mucho estos modelos, ¿no?
Speaker A
Hag unas referencias biográficas y eso es todo respecto a la regresión, ¿no? Entonces, muchachos, es un tema de no tan complicado, pero sí es muy usado los que van a hacer alguna investigación o ya sea de un carácter explicativo
Speaker A
predictivo, entonces eh este modelo es muy muy bueno ¿no? Bien muchachos eso es la regresión línea.
Speaker A
A ver, vamos a ver. Otro tema no estaba complicado, si se han dado cuenta. No, no es no es nada del otro mundo, como se dice.
Speaker A
A ver, hay una pregunta, si no me equivoco. Ah, muy buena pregunta, Dalia María. Muy buena pregunta.
Speaker A
Muy buena pregunta, ¿no? La lección de un modelo proectivo va a depender de los objetivos de investigación, supongamos.
Speaker A
Miren, vamos a retomar este ejemplo, ya. A ver, vamos a ver esto. A ver, vamos a ver. Ya, vamos a retomar este ejemplo.
Speaker A
Si tu objetivo es, por ejemplo, usando este ejemplo, ¿ya? Si tu objetivo es determinar los factores que influyen en el costo en salud de una persona, eso sería un modelo explicativo.
Speaker A
¿Por qué? Porque quiero saber cuál de estas variables influye más en el costo de salud de una persona. Es un modelo o un enfoque explicativo. No quiero explicar.
Speaker A
En un enfoque explicativo no te interesa predecir, pero sí saber cuáles son las variables que más influyen en el costo en en salud de una persona, ¿no?
Speaker A
Entonces, eso es un enfoque explicativo, ¿no? Hasta ahí llegaría. Pero, ¿qué pasaría si mi objetivo es no predecir el costo de salud de una persona con cierta característica?
Speaker A
Entonces, yo quiero predecir el costo de salud de una persona. No me interesa tanto explicarlo o qué qué variables influyen más. Lo que yo quiero es predecir el costo de salud de una persona.
Speaker A
¿Cómo hago ello? Entonces, básicamente es esto. No puedo ponerlo así. Y mi costo en salud, miren, costo en salud, lo voy a llamar algo así, ¿no?
Speaker A
Va a ser igual, por ejemplo, a acá me falta el intercepto. Siempre hay que copiar todo, ¿no? Porque recuerden que el intercepto también es parte de la ecuación, ¿no? El más ya supongamos que viene una persona llamado, no sé, Miguel.
Speaker A
Sexo es masculino, supongamos que tiene 45 años. Eh, consume eh ocho de alcohol por medio de la semana, nueve de cigarro y hace 10 horas de ejercicio a la semana en promedio.
Speaker A
¿Cuál sería el costo de salud de esta persona? ¿Cuál sería? Fácil. Mi intercepto más el por él más el por él más el por él más el por él más el por él.
Speaker A
Quiere decir que la persona, el alumno Miguel anualmente estaría gastando en salud 50 en comedia.
Speaker A
Esto es una un modelo predictivo. Tú lo has construido con un fin o con el fin de predecir el costo de salud de ciertas personas.
Speaker A
Entonces, ¿de qué va a depender en quedarme en lo explicativo o en lo predictivo?
Speaker A
Básicamente los objetivos de la investigación. Casi siempre para los que están en el mundo de las ciencias sociales, casi todo es explicativo. ¿Por qué?
Speaker A
Porque les interesa explicar un fenómeno. Pero los que están en ingeniería o en ciencias básicas, ahí les interesa predecir, ¿no? Entonces, en ese caso, podemos optar por hacer estas cosas, ¿no?
Speaker A
Miren, un hombre gasta 1350 anual. ¿Qué pasaría si es mujer? Gasta menos la mitad prácticamente casi ¿no?
Speaker A
El solo ser hombre, muchachos, hace que gaste más. ¿Se dan cuenta? Si le pongo mujer, miren cuánto baja. Y peor, si le pongo 20 años, baja prácticamente, no gasta nada.
Speaker A
¿Se dan cuenta? ¿Se dan cuenta, muchachos, no? Si es mujer y es joven, gasta poco en salud, pero si es hombre y además tiene 60 años, mira cuánto gasta. $070 en promedio anual.
Speaker A
¿Se dan cuenta? Eso es predecir. ¿Qué estás predeciendo? el costo en salud de una persona en función a sus características.
Speaker A
Como tú ya conoces la regresión, entonces ya conoces el modelo, la ecuación de regresión, entonces puedes usarlo para predecir.
Speaker A
Acá viene Miguel, esto es su gasto en salud, acá viene, no sé, eh, Karina, acá viene Dalia y acá puedes conocer cuánto va a gastar anualmente en salud en función a sus características.
Speaker A
Así es siempre, ¿no? Bien, eso, muchachos, no es nada complicado, pero les va a servir bastante para predecir ¿no?
Speaker A
Bien, ahora, muchachos, empecemos con nuestro segundo tema que es la revisión logística binaria. Es otro es otro modelo también que es explicativo y predictivo a la vez, muchachos. Es decir, sirve para hacer explicación y también sirve para hacer
Speaker A
predicción. La pregunta del mío, muchachos, ¿cuál o cuándo uso esto? No, ¿cuándo uso en este caso?
Speaker A
Muy bien. ¿Cuándo se usa esto? El problema es lo siguiente. ¿Por qué se le dice logística binaria? ¿Por qué se le dice logística binaria? Vamos a ver.
Speaker A
El problema, muchachos, es lo siguiente, ¿no? Logística binaria. ¿Por qué binario? Porque ahora vas a estudiar variables binarias, por ejemplo, unos y ceros, ¿no?
Speaker A
La reacción lineal simple y múltiple, tu y era un número real. Era un número real, muchachos. No era un número real.
Speaker A
Pero, ¿qué pasa si tengo unos y ceros? Si yo grafico unos y ceros, voy a tener pues valores acá, ¿no?
Speaker A
En cero y también voy a tener valores en uno. Por acá estía uno, por acá estaría cero.
Speaker A
Y el problema es que si yo opto por una regresión lineal, muchachos, cortaría pues en pocos puntos, ¿no?
Speaker A
y una relación lineal, pues sería obsoleto para las variables binarias, ¿no? O dicotómicas, como lo conocen muchos.
Speaker A
En ese sentido, muchachos, se tiene que o existe la necesidad, muchachos, de encontrar un nuevo modelo, que por ejemplo podría ser algo así.
Speaker A
que pueda tener ese comportamiento, pues de tal manera que capture pues una mayor cantidad de casos, ¿no?
Speaker A
Y bueno, así es como surge, muchachos, la reacción logística binaria. ¿Por qué ya no le dicen lineal, no? Y logística binaria.
Speaker A
Bueno, esta función es una función logística, por ejemplo, no puede que por ahí venga el nombre, pero principal utilidad es que también existe la necesidad pues de explicar variables numéricas, en este caso dicotómicas, binarias ¿no?
Speaker A
Por ende, también se necesita un modelo especializado. Pero, ¿por qué es importante modelar variables dicotómicas? Porque casi todo en el mundo actual, muchachos, es dicotómico.
Speaker A
Por ejemplo, una persona puede ser moroso, no moroso, enfermo, sano. Eh, un correo puede ser spam o no spam.
Speaker A
Una persona puede tener anemia o no tener anemia, casado, soltero, tiene COVID, no tiene COVID. Casi todos, muchachos, son eventos dicotómicos o eventos binarios, ¿no?
Speaker A
Entonces, ¿qué es lo que se tiene que hacer? Bueno, se tiene que hacer pues tener un modelo que pueda ser útil para poder explicar o predecir ese tipo de casos, ¿no? Y por eso surge pues la revisión logística binaria.
Speaker A
Entonces, si estamos interesados en relacionar una variable dependiente o dicotómica, en este caso binaria, con un grupo de variables categóricos cuantitativos, entonces la reacción logística binaria es muy importante.
Speaker A
Por ejemplo, el y tu variable dicotómico, muchachos, siempre lo recodifican así, ¿no? uno y cer donde el uno siempre va a ser el éxito y esto va a ser el fracaso. Ya la pregunta del millón es, ¿cómo defino,
Speaker A
profe, el éxito del fracaso? Pues va a depender cómo yo quiero modelar, ¿no? Si estoy en un banco y un banco pues un cliente pide un préstamo, ¿no? Generalmente, y el banco pues le dará o no le dará el
Speaker A
préstamo. Para eso se usa moroso y no moroso. En base a tu estural crediticio, el banco ya sabe pues cuál es tu probabilidad de morosidad.
Speaker A
Entonces, si quiero saber si un cliente es moroso o no moroso, ¿a quién le pondría uno, no? ¿Al no moroso o al moroso, no?
Speaker A
Obviamente lo que a mí me interesa como banco es identificar los morosos. Por ende, mi éxito va a ser encontrar un moroso.
Speaker A
Por eso le voy a asignar uno a esa categoría. Así es como se trabaja, muchachos.
Speaker A
Así es como se trabaja. Ya. Si estoy en un, no sé, en salud y un tumor es cancerígeno y no cancerígeno, ¿cuál sería mi éxito?
Speaker A
Pues que el tumor sea cancerígeno. No me interesan los no cancerígenas. No me interesa. Y a mí me interesa los cancerígenos. Eso es mi éxito para mí.
Speaker A
Si estoy en educación, un alumno deserta o no deserta, ¿no? ¿Cuál es mi éxito? La deserción. Me interesa eso. Me interesa estudiar la deserción.
Speaker A
Entonces, por ende, mi variable éxito debe ser la deserción. ¿Por qué? Porque a mí me interesa medir esa esa categoría como no. Muy bien.
Speaker A
Entonces, identificar el ex fracaso es sencillo. ¿Cuáles son las aplicaciones de las variables binarias actualmente?
Speaker A
Prácticamente todo, muchachos. Por ejemplo, los ejemplos más comunes, todos tenemos un correo electrónico, ¿no?
Speaker A
A veces cuando nos envía un correo malicioso, el el correo electrónico por sí solo tiene un algoritmo que detecta correos no deseados y automáticamente lo manda al spam.
Speaker A
Eso, por ejemplo, es un detección de spam. Te permite predecir si un correo es spam o no.
Speaker A
binario ¿no? ¿Dónde más existe? En fraude de tarjeta de crédito, muchachos. ¿Cómo saber si una transacción es fraudulenta o no?
Speaker A
Se puede. Claro, los bancos usan algoritmos de transacciones fraudulentas ¿no? Imaginemos que ustedes tuvieron su tarjeta de crédito por 10 años y siempre lo usaban pues en el horario pues de supongamos, ¿no?, de 9 de la mañana hasta máximo eh 10 de la noche
Speaker A
por 10 años. Este comportamiento lo han tenido por 10 años y por x motivos le roban su tarjeta de crédito y hacen un consumo a las 4 de la mañana.
Speaker A
Para ese ese comportamiento o esa transacción para el banco es una transacción fraudulenta. Automáticamente el banco bloquea, muchachos, tu tarjeta de crédito.
Speaker A
¿Por qué? Porque durante 10 años tú no has tenido ese comportamiento. Por ende, después de años que sucede eso, es una traición fraudulenta y por ende se bloquea la tarjeta de crédito y ya nadie lo puede usar.
Speaker A
Eso es automático, muchachos. No es que una persona está revisando esa hora, nada que ver.
Speaker A
Y hay algoritmos de fraude y crediticio que están implementados, que al mínimo alerta se procede con con el bloqueo, ¿no?
Speaker A
Entonces, eso es fraude de tarjeta de crédito en salud. Muchachos, ¿cómo puedo saber si un tumor es benigno o maligno?
Speaker A
Es un evento binario. Sí, se puede predecir con clasificados binarias. Sí, también se puede en marketing. Muchachos, ¿cómo saber si un cliente va a comprar o no un producto?
Speaker A
¿Se podrá cuantificar la probabilidad de compra de un producto por parte de un cliente? Se puede, claro que sí.
Speaker A
en banca, muchachos, para predecidir si un cliente será moroso o no moroso. Moroso o no moroso es un evento binario, muchachos. Entonces, las aplicaciones de estos modelos de clasificación binaria son muchos en la actualidad, muchos.
Speaker A
Muchos. Todo lo que ustedes ven se puede hacer binario. Profe, yo tengo tres categorías. ¿Cómo lo puo binario? Los agrupas, los agrupas y listo, ¿no?
Speaker A
Pero también existe clasificaciones multiclase, ¿no? Tres de clases, cuatro grupos, no hay ningún problema, solo que lo binario es mucho más útil, mucho más informativo.
Speaker A
Bien, esos son las aplicaciones más importantes ¿no? ¿Qué es la regresión logística? Dice, "No se dice que la regresión logística binaria es un tipo especial de regresión donde la variable respuesta binaria está relacionado con un conjunto de variables
Speaker A
explicativas, obviamente, ¿no? Y en función a varias variables, ¿no? Obviamente y tiene que ser una variable binaria ¿no?
Speaker A
Si no sería una revisión lineal múltiple, ¿no? Pero al ser binaria ya se trata de una revisión logística binaria, ¿no?
Speaker A
Eh, muchachos, la revisión logística binaria pertenece a una familia mucho más grande de modelos llamado los modelos lineales generalizados ¿no?
Speaker A
Esta familia de modelos lineales generalizados es mucho más grande, como quien dice, ¿no? Si los GLM son todo este conjunto grandazo, la revisión logística binaria es una pulguita.
Speaker A
Esto sería la reción logística binaria, ¿no? Sería una pulguita porque acá hay un montón de modelos, pero uno de ellos es la reión logística binaria, ¿no? Que forma parte de los modelos lineales generalizados, ¿no? Es una familia mucho más grande.
Speaker A
Si ustedes piensan que solamente existen dos modelos, están equivocados, ¿no? Hay un montón. Solo que la logística binaria es uno de los más populares, los más usados, ¿no?
Speaker A
Eh, muy bien, hablemos de los supuestos del modelo, supuestos entre comillas, porque en sí los modelos lineales generalizados no tienen supuestos muy fuertes, muchachos. Es más, no tienen supuestos.
Speaker A
Lo que sí tienen son algunas especificaciones para que el modelo funcione ¿no? Por ejemplo, en la revisión lineal, ¿cuál era el supuesto? No, un supuesto era la normalidad de los errores, ¿no?
Speaker A
Y eso es un dolor de cabeza, muchachos. ¿Por qué? Porque el error al ser una distribución normal con media cero y valencia constante, ya esto es un supuesto que limita mucho, muchachos, el análisis, ¿no?
Speaker A
Sin embargo, los modelos lineales generalizados, en especial la revisión logística binaria, no asume ninguna relación lineal entre las variables dependientes, ¿no?
Speaker A
Es decir, no hay ninguna relación de dependencia, no existe, no hay esta relación tampoco, tampoco hay una linealidad de este tipo.
Speaker A
Otro punto, la variable dependiente, es decir, la variable Y, no necesita tener distribución normal, no requiere ningún supuesto muchachos.
Speaker A
La regresión lineal simple y múltiple usa un método de estimación de los parámetros llamados mínimos cuadrados ordinarios. Muchachos, esta técnica de estimación de los parámetros solo sirve para la redión lineal.
Speaker A
Para la revisión logística binaria se usa otro método de estimación de los parámetros llamado máxima velosimilitud.
Speaker A
Y ustedes se preguntarán, "Profesor, ¿y qué son los parámetros?" Los coeficientes muchachos. Estos son los parámetros.
Speaker A
¿Cómo encuentro esos valores? Encontrar esos valores es parte de la estimación de los parámetros, ¿no?
Speaker A
Y obviamente como todo modelo estadístico, muchachos, los errores siempre deben ser independientes. Siempre. Esto es un supuesto de todo modelo estadístico.
Speaker A
Siempre los herreros deben ser independientes, pero no hay ninguna distribución para el error. No es como la reacción lineal que te lo imponen.
Speaker A
Acá no hay ninguna restricción, ninguna limitación, ningún supuesto, muchachos. implementa algunas consideraciones para tener en cuenta, ¿no?
Speaker A
Bien, ahora hablemos algo muy importante. ¿Cómo se construye el modelo? El modelo de revisión logística binaria, ¿no?
Speaker A
En probabilidades. Ya. Primero vamos a hablar lo siguiente. Yo ya sé que mi y es una variable binaria, ¿no? Unos y ceros.
Speaker A
La probabilidad de éxito que sea uno tiene una probabilidad de éxito. A esto lo voy a llamar pi. La probabilidad de fracaso 1 men pi.
Speaker A
Por ejemplo, si yo lanzo una moneda, ¿cuál es la probabilidad que salga cara? 0.5 ¿no?
Speaker A
La probabilidad que salga sello 0.5. siempre es el complemento, pero como acá yo no sabe cuál es la probabilidad de éxito, entonces le voy a poner pi. Su complemento 1 - pi, porque ambos deben sumar uno, ¿no?
Speaker A
Ahora, ¿qué es lo que debo hacer? Tengo mi y, pero también tengo mis X, ¿no? X1, X2, que van a entrar en el modelo.
Speaker A
Yo tengo que ver la manera de cómo relacionar con esto, ¿no? Entonces, ¿cómo relaciono ellos? ¿No?
Speaker A
¿Cómo vinculo estos dos conceptos, no? Para ello, en probabilidades, muchachos, existe un tema llamado teoría de probabilidades ¿no?
Speaker A
En el cual dice, "Oye, si tu variable es dicotómica, entonces es una variable bernul con probabilidad de éxito igual a pi." Efectivamente, ¿no? Yo lanzo una moneda, solamente tengo dos posibilidades, cara y sello. Eso es una componente o una
Speaker A
variable aleatoria de tipo bernulín. Entonces, la primera componente del modelo es la componente aleatoria, que básicamente es una variable vernuli con parámetro pis.
Speaker A
Ahí está la aleatoriedad que hemos encontrado de manera natural, muchachos. Una aleatoriad propio de la variable, ¿no?
Speaker A
¿Qué más? La componente sistemática, muchachos, tiene que ver con si tú tienes estas variables, obviamente tú vas a tener estas combinaciones, ¿no?
Speaker A
Beta1, x1 + beta2, x2, ¿no? Y así sucesivamente. Esa combinación lineal, muchachos, es la es la componente sistemática.
Speaker A
En otras palabras, todo esto acá lo puedes expresar de esta manera. Beta1 x1 + beta 2x2 y así sucesivamente, ¿no?
Speaker A
Muy bien. Eso es, ¿no? Muy bien. Entonces, tengo dos componentes definidos, la componente aleatoria y la componente sistemática.
Speaker A
Y ahora la pregunta es, ¿cómo vinculo estos dos componentes? Lo voy a vincular usando una función de una función de enlace, muchachos.
Speaker A
La función de enlace va a vincular estos dos conceptos, lo va a conectar mediante una función justamente llamado función de enlace, pero no va a vincular mi y, sino va a vincular la probabilidad de éxito de esta manera, en otras palabras.
Speaker A
Entonces, G evaluado a la probabilidad de éxito va a ser igual a la parte sistemática ¿no?
Speaker A
Muy bien. ¿Y qué valor o qué función puede tomar la función G? Si la función G, muchachos, toma un una función logit, la regresión se llama regresión logit binario o logística binario, muchachos.
Speaker A
Entonces, de acuerdo a la función de enlace, la redión tendrá un nombre apropiado. Si la función enlace es un enlace logit, la reacción se llamará reacción logística binaria, ¿no?
Speaker A
Y se transforma en esta expresión, muchachos. Y acá viene la pregunta al millón. ¿Qué quiere decir? ¿Qué es la revisión logística binaria?
Speaker A
La revisión logística binaria mide o modela el logaritmo de cociente de probabilidades de pertenencia a un grupo u otro en función a la parte sistemática.
Speaker A
Eso es lo que va a modelar la revisión logística binal. no modela directamente el y, lo que modela es el logaritmo de cociente de probabilidades, ¿no?
Speaker A
O también conocido como los ods ratio, ¿no? Eso es, muchachos, el famoso o la famoso revisión logística binaria, ¿no? Esta es la forma cómo se construye, ¿no? ¿Qué pasaría si la función G sería un enlace probit?
Speaker A
La revisión se llamaría reacción probinaria y así para los diferentes enlaces que existen ¿no?
Speaker A
Muy bien. En otras palabras, muchachos, la reacción logística binaria es todo esto de acá, ¿no?
Speaker A
Y esto ya les comenté que lo podemos expresar de esa manera. X1 + beta P XP, ¿no?
Speaker A
Entonces muchachos ya sabemos que esto es la revisión logística binaria, logaritmo de cociente de probabilidades en función o igual a la parte sistemática, ¿no?
Speaker A
Por ahí si me preguntan lo siguiente, "Profe, ¿cómo interpreto, por ejemplo, este coeficiente acá?" Y todo el mundo me va a decir, "Profe, por cada incremento x1 y acá no existe y, muchachos, así que mucho cuidado." Ya.
Speaker A
La revisión logística binaria, muchachos, es un modelo no lineal. Es un modelo no lineal.
Speaker A
Por ende, no se puede interpretar directamente. Para interpretar los coeficientes en una revisión logística binaria, lo que se hace es tomar el exponencial, muchachos, el exponencial a ese coeficiente y el valor que te sale recién lo interpretas como si fuera una
Speaker A
reión lineal simple, ¿no? Eso es lo único que se tiene que hacer, muchachos, para poder interpretar los coeficientes.
Speaker A
Es lo único. Bien, es lo único que se tiene que no puedes interpretar directamente como la reacción lineal. Mucho cuidado ahí.
Speaker A
tiene primero tienes que transformar y esta transformación se conoce como los famosos OR, ¿no? O R.
Speaker A
Primero transformas y recién interpretas ¿no? Justamente acá menciona, ¿no? No se trata de una reacción lineal, no se puede interpretar directamente, no se debe considerar ciertas transformaciones a la variable, ¿no? En este caso, el OR, el OR no es más que el
Speaker A
exponencial, los coeficientes, ¿no? Eso sería justo. ¿Qué pasa si te sale el ratio igual a 1, por ejemplo? Justo este exponencial ¿no?
Speaker A
El exponencial del coeficiente es el famoso OR. ¿Qué pasa si el OD ratio te sale igual a 1?
Speaker A
Implica que no hay relación entre las variables. ¿Qué pasa si el OR es mayor a 1?
Speaker A
indica asociación positiva entre las variables. Si el OR es menor a 1, señala una asociación negativa entre las variables.
Speaker A
Lo que se debería esperar casi siempre, muchachos, es que el otro ratio sea mayor a uno. Eso es lo ideal.
Speaker A
Eso es lo que desearíamos siempre, ¿no? Pero va a depender pues del conjunto o de las bases de datos que disponemos, ¿no? Entonces, no es que el modelo tampoco va a ser maravillas, ¿no?
Speaker A
Hay que tener mucho cuidado esa parte. Bien, muy bien. Muy bien, muchachos. Bien, ahora vamos a ver cómo se puede valiar un modelo.
Speaker A
Claro, tú puedes construir tu modelo de regresión logística binaria, pero también hay que saber pues eh si es bueno o malo ese modelo, ¿no?
Speaker A
Y eso, muchachos, va a depender de qué es lo que yo quiero hacer, ¿no? Justo como su compañero preguntaba, ¿no? ¿Cómo saber si estoy en un caso explicativo o un caso predictivo?
Speaker A
Y eso ya lo tienes que saber de antemano por los objetivos de tu investigación.
Speaker A
¿Qué es lo que quieres hacer? Si tu objetivo de investigación es explicar tal, tal, tal, es un caso explicativo o un enfoque explicativo.
Speaker A
Pero si tu objetivo dice predecir la deserción estudiantil, tal, tal, tal, es un modelo predictivo.
Speaker A
Entonces, no son lo mismo, muchachos, hay que tener mucho cuidado. Más aún en la reción logística binaria.
Speaker A
Por ejemplo, cuando estoy en un caso explicativo, cuando quiero explicar mi variable Y en función a un grupo de variables X, ahí me interesa, por ejemplo, la significancia de los parámetros, que las variables sean significativas, es decir, que sean importantes.
Speaker A
el test de B, que es la significancia global de la regresión logística binaria, el test de host show que me dice bondad de ajuste.
Speaker A
Basta con estos tres suficiente para decir que mi modelo es bueno, es decir, es apropiado para explicar el evento de interés.
Speaker A
El Cosper de Maow es muy parecido al R cuadrado, pero para el caso de la logística primaria no es no es igual, no, pero son muy equivalentes.
Speaker A
Entonces para validar un modelo bajo el enfoque explicativo, sí me interesa, muchachos, la significancia de los parámetros.
Speaker A
Sí me interesa. Pero, ¿qué pasaría si estoy en un enfoque predictivo? En un enfoque predictivo, a mí no me interesa si mis variables son significativas o no, muchachos.
Speaker A
No me interesa porque mi objetivo no es explicar, sino predecir. Por ende, hay otras maneras de validar un modelo para el caso predictivo. No son los mismos, muchachos.
Speaker A
Hay muchos colegas míos se equivocan, inclusive discutimos, ¿no? Me dice, "Pero Luis, es un modelo puede ser explicativo, predictivo a la vez. Eso es falso, amigo. No se puede.
Speaker A
¿Por qué? Porque ambos son de propósito distinto. Ambos se valían de una u otra manera. No es igual. No se puede hacer eso.
Speaker A
Es imposible. No son dos enfoques totalmente diferentes. No puedes fusionar los enfoques para que te dé uno, para que funcione para todo.
Speaker A
Eso no existe. No, todo va a depender de tus objetivos de investigar. Por ejemplo, para el caso predictivo, tenemos la matriz de confusión, la curva de rock, la variación cruzada, el área bajo la curva, el famoso AUC.
Speaker A
Si tengo mayor a el modelo va a ser el mejor y así se discriminan los modelos predictivos ¿no?
Speaker A
Bien, aunque no lo crean, muchachos, este tema de modelo explicativo, modelo predictivo, no lo tiene claro muchas personas.
Speaker A
¿Cómo me he dado cuenta de eso? En las tesis ¿no? Las tesis que usan redon logística binaria mezclan todo explicativo y predictivo en uno solo.
Speaker A
Sacan todo lo que el software bota y lo agregan al Pero eso no es así, muchachos. Ya les está explicando que son enfoques totalmente diferentes que no se pueden mezclar.
Speaker A
Independientemente pueden explicar o pueden interpretarse, sí, pero no se puede uno solo un solo modelo que sea explicativo y predictivo.
Speaker A
Eso es imposible. ¿Por qué? Porque tienen tratamientos diferenciados, no son los mismos. Bien, vamos a ver algunos ejemplos, muchachos. Miren, este es un caso real de morosidad.
Speaker A
Entonces, una base de datos de morosidad, tengo el sexo, calificación del sistema financiero, saldo de tarjeta de crédito, línea promedio y queremos pues acá está la pregunta, ¿no?
Speaker A
¿Cómo determinar si un cliente es moroso muchacho? Tú que eres entidad financiera, un banco X del Perú, ¿cómo sabría si un cliente es moroso con su historia del crediticio, no?
Speaker A
Con su historia del crediticio y tu modelo que tienes de predicción lo usas y automáticamente te va a arrojar su probabilidad de moros.
Speaker A
Si es 0.95 95 probabilidad morosidad alta, alto, alto riesgo aunque sea moroso ¿no? Entonces, vas a predecir si un cliente es moroso. Sí. ¿En función a qué? En función de las probabilidades de morosidad, ¿no? Si las probabilidades de
Speaker A
morosidad son altas, quiere decir que el cliente tiene alto riesgo de ser moroso. O sea, estás determinando un cliente moroso. Sí, usando un muelo predictivo, ¿no? ¿Te das cuenta?
Speaker A
Así de simple, muchachos. Determinar predecir clasificar segmentar. Es un modelo predictivo, muchachos. Así de simple, porque vas a predecir probabilidades y en función a esas probabilidades tú lo vas a clasificar en un grupo u otro.
Speaker A
Eso es, muchachos. A ver, vamos a dar otro ejemplo. La angina de pecho, seguramente ustedes lo han escuchado, ¿no?
Speaker A
Es una enfermedad coronaria que da más o menos a la altura del del corazón, ¿no?
Speaker A
Es un dolor intenso, presivo detrás del esternón que está catalogado como una enfermedad eh coronaria, ¿no? Entonces, la angina de pecho es un una enfermedad coronaria, ¿no?
Speaker A
Imagínense que yo quiero saber qué cosa es lo que influye para que una persona tenga angina de pecho a lo largo de su vida.
Speaker A
¿Qué cosa? ¿Cuáles son los factores asociados, por ejemplo, no? A la angina de pecho.
Speaker A
En otras palabras, ¿cuáles son los factores determinantes para que una persona tenga o parezca esquina de pecho en algún momento de su vida? No, yo quiero saber qué variables influyen, muchachos. Entonces, quiere decir que quiero explicar el evento de interés en
Speaker A
función a un grupo de variables. No, para nada me interesa predecir si un cliente, un paciente va a tener angí de pecho. No, yo quiero explicar a qué se debe que una persona tenga gen Es un modelo explicativo.
Speaker A
¿Se dan cuenta? Así es. Simple, muchachos. No se confundan, no hagan su tesis todo lo que se les antoja. No, no es así.
Speaker A
Es más, los asores tampoco se dan cuenta y por eso se publican esas tesis.
Speaker A
La persona que no tiene mucho conocimiento, replican y replican y replican y sigue y sigue la misma cosa.
Speaker A
No es así. Hay que tener mucho cuidado, por favor. Esto es un ejemplo interesante, muchachos. Miren, el SPCS te va a permitir hacer tu reveleción logística binaria de una manera muy sencilla, much demasiado sencillo, diría yo.
Speaker A
Pero lo más importante es pues conocer la teoría. Eso es lo más importante. Eso es lo más importante.
Speaker A
Bien. Entonces, un ejemplo interesante de si votó o no votó. Por ejemplo, acá tengo mi X, no, acá tengo mi Y acá tengo mi X, ¿no? Si votó o no votó, si está relacionado con si lee periódico o no lee periódico. Un ejemplo
Speaker A
eh poco muy didáctico, diría yo, ¿no? Por ejemplo, les interesa estudiar la abstención de votos.
Speaker A
Depende si una persona Bueno, lee o no lee, se esperaría. Los que los que leen son los que más votan.
Speaker A
Te esperaría eso, ¿no? Pero vamos a ver qué nos dice el modelo. Entonces, acá tengo una tabla cruzada en el cual se hace pues un conteo caso, ¿no? Por ejemplo, de los que leen el 75% sí votaron, ¿no? Los que no leen,
Speaker A
miren, votó de 25 y lo que no leen y no votaron son un montón, ¿no? Entonces, la idea es ver si hay una asociación o una relación entre esas o dos variables categóricas.
Speaker A
Y bueno, se hizo una reacción logística binaria y el SPCSCS pues arroja una eh su regresión logística binaria.
Speaker A
Todo modelo logístico binario, muchachos, lo que te va a proporcionar son probabilidades. Por ejemplo, ¿cómo saber si un cliente es moroso o no moroso?
Speaker A
Fácil. Recuerden que las probabilidades varían de 0 a 1. Si yo como banco digo, oye, de 0.5 en adelante son morosos.
Speaker A
Caso esto de acá no moros. Yo defino el punto de corte. Eso se hace acá, ¿no? Si yo defino acá como el punto de corte 0.05, 05.
Speaker A
Entonces podré clasificar a un individuo como yo desee, ¿no? Eso es muy importante definir los puntos de corte.
Speaker A
A veces los bancos son muy estrictos, ¿no? Dice, "Oye, 0.5 no es muy muy amplio mi margen. ¿Sabes qué? 0.8 para arriba.
Speaker A
Y eso también es pues una decisión de negocio, ¿no? No es no depende muchas veces de nosotros, pero sí o sí se tiene que fijar un punto de corte. Por default es 0.5.
Speaker A
El SPCS, muchachos, te va a proporcionar una salida de este tipo. Acá está mi beta sub1, acá está mi beta sub0.
Speaker A
Muy bien, con esto, esto de acá sería mi ecuación de regresión, muchachos. Regresión logística binaria, ¿no?
Speaker A
Expesada de una manera exponencial. ¿Qué es lo que tengo que hacer? Simplemente reemplazar pues la magnitud de esos coeficientes, ¿no? Esos coeficientes lo reemplazo acá y automáticamente tendría mi ecuación de reión logística binaria.
Speaker A
Ahí está. Eso sería mi ecuación de reión logística binaria muchachos. Y una vez que conozca mi ecuación de reición, ¿qué es lo que puedo hacer?
Speaker A
Predecir cualquier probabilidad para la persona X. Y en función a esas probabilidades puedo clasificar a un individuo en un grupo un. Eso ya lo convierte en un modelo si es que eso fuera tu objetivo.
Speaker A
Si no fuese eso tu objetivo, entonces no viene el caso a hacer todas esas cosas.
Speaker A
Hay que tener mucho cuidado esa parte. Bien muchachos. Muy bien. Y acá puedes evaluar pues cualquier valor, ¿no? No hay niún problema. Puedes evaluar valores y calcular sus probabilidades, ¿no? Miren, para estos valores la probabilidad de morosidad, perdón, la su probabilidad es 0.5. 52.
Speaker A
¿Dónde lo ubico? En el grupo de que no votó, ¿no? Para otros valores, ahí está su probabilidad.
Speaker A
¿Dónde lo ubico? En el grupo, en el primer grupo, ¿no? Y así sucesivamente. En función a las probabilidades, muchachos, tú vas a reemplazar.
Speaker A
Claro, eso se encarga de hacer el software, ¿no? El programa, pero siempre es bueno, muchachos, pues explicar eh explicar pues cómo se origina todo, cuál es el proceso de todas, ¿no?
Speaker A
Bien muchachos. Muy bien. Eso, muchachos, es la regresión logística vin. Eso es. Bien, ahora veamos la aplicación, muchachos.
Speaker A
Veamos la aplicación. Abran la base de datos que dice angina de pecho, muchachos. Y cierren la otra base de datos para no confundirnos.
Speaker A
Muchachos, la reacción logística binaria, así como la reacción lineal, siempre es sencillo, muy sencillo.
Speaker A
Claro, la teoría es un poco molestoso, ¿no? Pero es necesario para poder, por ejemplo interpretar para saber si estamos en un caso explicativo, en un caso proyectivo.
Speaker A
Entonces, es muy importante eso. y directo al SPS no tiene sentido porque no vamos a entender lo que estamos haciendo.
Speaker A
Bien, entonces esta base de atos tiene pues la variable Y. Uno, si tiene angina, cero si no tiene angina, la edad de la persona, el sexo, colesterol, triglicerio, si tiene hipertensión, si tiene glucosa, si tiene obesidad.
Speaker A
¿Qué le dice el sentido común, muchachos? ¿Qué variable creen que influye para que una persona tenga de pecho?
Speaker A
El sexto quizás la edad, colesterol, trilisterio. Yo quiero qué cosa explicar qué variables influyen para que una persona tenga aquí en el pecho el sentido. ¿Cómo me diría, profe?
Speaker A
Obesidad, edad, colesterol también puede ser, ¿no? Si está si una enfermedad coronaria, colesterol debería de estar se supone, ¿no?
Speaker A
Bien. ¿Quién me va a decir qué vares son los que más influyen sobre si tiene angina o no sobre una varel dicotómica? Por cierto, la regresión logística binaria.
Speaker A
Profe, ¿y cómo saben que tiene que aplicar regresión logística binaria? Porque mi y es unos y ceros. Pues es dicotómica. Quiero modelar mi mi y en función a estas a todas estas variables.
Speaker A
¿Cuántos datos tengo? 149 personas ¿no? Entonces, vamos a ver, pues, ¿qué es lo que nos dice eh este conjunto de datos, ¿no? ¿Cómo hago para hacer la revisión logística binaria?
Speaker A
Sencillo, muchachos. Miren, me voy a analizar regresión y donde dice logística binaria. Me voy ahí, muchachos.
Speaker A
Regresión y logística binaria ¿no? Simplemente le doy aceptar. Acá le pongo dependiente es mi y en todo lo demás lo pongo en covariables acá.
Speaker A
Listo muchachos. y simplemente le doy aceptar. Listo. ¿Qué es lo que me interesa? No me interesa nada de estas cosas porque también te bota muchas cosas y eso confunde también el estudiante.
Speaker A
Recuerden que ustedes qué cosa necesitan un modelo explicativo. Todo lo demás no le hagas caso porque te va a confundir.
Speaker A
¿Qué me interesa? esto de acá, las ecuaciones de la del modelo, no lo voy a copiar y por acá lo voy a llamar. Ya.
Speaker A
Muy bien, muchachos. Miren, pregunta del millón. Y yo les he dicho que no pueden interpretar directamente el coeficiente, no se hace eso. Lo que se interpreta son el exponencial de los de los coeficientes, muchachos. Esto es el famoso ORD ratio.
Speaker A
Y acá yo tengo que fijarme las magnitudes más grandes para saber cuál es el que tiene más impacto o qué variable.
Speaker A
Hipertensión, sexo. Esas son las dos más fuertes. ¿Se dan cuenta? ¿Se dan cuenta, muchachos? La hipertensión, la hipertensión es el que más influye para que una persona tenga angina de pecho.
Speaker A
Así de simple, muchachos. ¿Cómo se interpreta esto? Lo que pasa hipertensión es una variable dicotómica. Uno hipertenso, cero no hipertenso.
Speaker A
Quiere decir que una persona que es hipertensa tiene 10, claro, 11 veces más chances de tener angina de pecho que una persona que no tiene hipertensión.
Speaker A
Así es. Siempre cómo se interpreta esto acá. Sexo es uno, hombre, cero mujer. Quiere decir que el solo ser hombre, tu chance de tener angina de pecho se incrementa en un 53%.
Speaker A
Imagínense, el solo ser hombre aumenta tu riesgo de padecer angina de pecho en un 53%.
Speaker A
53.7%. Exactamente. Eso, muchachos, eso es la forma cómo se interpreta. Entonces, si les preguntan a ustedes cuál es la variable que más influye para que una persona tenga anina de pecho, es la hipertensión.
Speaker A
Una magnitud inmensa, muchachos. Tremendo valor. 11. Si una persona que no tiene hipertensión tiene una chance que tenga, el que tiene hipertensión tiene 11 veces más chance que tenga hipertensión. Es decir, sí o sí va a tener angina de P.
Speaker A
Es inevitable, muchachos. Lo dicen las estadísticas, lo dicen los datos. Por cierto, esta base de datos es el policlínico de Chorrío acá en Lima. Es una data real, muchachos. No es una data ficticia, es un dato, caso peruano, ya, data real que
Speaker A
se usa una tesis de investigación que está publicada, por cierto, de ahí jalen los bases de datos.
Speaker A
Es una data real. Demostraron que efectivamente la hipertensión era la variable que más influye.
Speaker A
Efectivamente, ¿no? Edad, sexo, colesterol también influye, pero una magnitud bien pequeña. Sin embargo, la hipertensión es lo que define todo, muchachos.
Speaker A
Eso, muchachos, es la famosa eh como quien dice hm la interpretación del modelo logístico binario.
Speaker A
Vamos a llevar esto a la IA, muchachos, para hacerle un plus. Ya, recuerden que las interpretaciones que hemos hecho son a veces un poco limitadas, ¿no?
Speaker A
Pero, ¿quién quién se luce bastante acá? Es son las inteligencias artificiales, ¿no? Le voy a dar, ¿no?
Speaker A
Eh, mi y es gina de pecho. Gina de pecho. Ayúdame, ayúdame a interpretar. Le voy a decir, eh, no tiene que ser un prom pues superclejo, ¿no? Simplemente dile, "Ayúdame a interpretar." Lo que pasa, las IAS, específicamente CHG GPT, muchachos, ha mejorado
Speaker A
notablemente su eh sus respuestas, ¿no? No necesitas darle un prom tan exacto. Claro, si le das un buen prom es mucho más preciso tu respuesta, ¿no? Pero si le das así poco no tan bien escrita, también te va a dar
Speaker A
una buena respuesta. Le he dado el modelo, le he dicho que mi var en el pecho y que me ayude a interpretar.
Speaker A
Miren muchachos acá está mi OR. Acá pone la ecuación de reacción logística binaria, inclusive. Miren, interesante ¿no?
Speaker A
Y acá me estima la variable edad, ¿no? Edad. El OR de la variable de edad es 0.1.087.
Speaker A
¿Qué quiere decir el OR 1.087? indica que por cada año adicional de edad los ODS de presentar angin de pecho se multiplican por 1.087.
Speaker A
En otras palabras, su incremento es 8.7 puntos porcentuales. En otras palabras, más práctico aún, por cada año adicional de edad, las OTS de angina aumentan aproximadamente en 8.7%.
Speaker A
Así se interpreta hipertensión. Me gusta esto. OR 10 pun 11 prácticamente, ¿no? Hipertensión uno, hipertenso cero, no hipertenso. Miren cómo se interpreta, muchachos.
Speaker A
Un individuo con hipertensión presenta 11 veces las OTS de presentar angí de pecho en comparación con aquellos sin hipertensión.
Speaker A
Terrible muchachos. Numéricamente o porcentualmente se podría decir que los OTS de angina son aproximadamente 993% mayores en las personas con hipertensión que aquellas sin hipertensión.
Speaker A
Es terriblemente impactante, muchachos, este resultado, ¿no? Una persona con hipertensión está condenado a sí o sí sufrir angina de pecho y la lo sabe, ¿no?
Speaker A
Muy bien. Y acá pues te da una interpretación mucho más técnica, ¿no? Por ejemplo, acá me interesa esta mucho más interesante, ¿no?
Speaker A
Creo que esta es mucho más técnico. Dice, "La edad, el colesterol, los trigliceridos y principalmente la hipertensión se asociaron significativamente con la presencia angí de pecho. La hipertensión mostró la mayor magnitud de asociación, un UR de casi 11, ¿no?
Speaker A
Eso es, muchachos. Entonces, la también, muchachos, te ayuda a interpretar de la mejor manera, ¿no?
Speaker A
Eh, a ver, gráficamente le voy a decir gráfica, a ver, le voy a decir si gráficamente me lo podría explicar.
Speaker A
Pues la también el GPT, muchachos, ha mejorado notablemente también. Ahí está, ¿no? Bueno, acá me hace un gráfico no tan bonito, pero bueno, ahí ayuda en algo.
Speaker A
Miren, hipertensión, muchachos, el OR 11 prácticamente seguido del sexo y así no en proporciones muy pequeño.
Speaker A
Le voy a decir si me da si me da una imagen. Ahí está. Ahí está Cran. que me me puede dar una infografía mucho más interesante, ¿no? De tal manera que yo pueda quizás comunicar mejor resultado, ¿no?
Speaker A
Entonces, actualmente la muchachos ayuda para mucho, ¿no? Y no hay que ser un experto, pues simplemente le dice, "Oye, tengo mis análisis, ayúdame a interpretarlo." No, claro, nosotros también sabemos cómo interpretar, pero en la IA te da eh
Speaker A
cosas más interesantes, ¿no? O sea, que un parafraseo mucho mejor, eh mejor estructura de la interpretación y todo ello, ¿no?
Speaker A
A ver, vamos a ver dónde está mi Ahí está cargando. Ya, eso sí, hay que tener un poco de paciencia, ¿no? que no no es tan rápido, ¿no?
Speaker A
A ver, vamos a esperar las últimas pulidas y ahí lo tiene que hacer. Ya está interesante. Esto sí me gusta.
Speaker A
A ver, vamos a ver. Ahí está, muchachos. Miren, esto sí es top. Ah, no me lo esperaba que lo hiciera tan bonito, pero miren, todo lo que le hemos dado lo ha hecho un una infografía superinesante sobre los
Speaker A
factores asociados a la angina de pecho, ¿no? Se usó, ¿qué cosa? La reacción logística binaria. ¿Cuál tiene el OR más alto? Hipertensión, ¿no? Miren el impacto que tiene acá.
Speaker A
mayor riesgo va a tener angina de pecho, pero un riesgo enorme, muchachos. Luego sigue el sexo, ¿no?
Speaker A
Hipertensión y sexo son los que más influyen muchachos. principales resultados acá al costadito. Hipertensión es el factor más fuertemente asociado con la angina de pecho, ¿no?
Speaker A
La persona que tiene hipertensión tiene 11 veces más OTS de presentar angina de pecho que uno que no tiene hipertensión.
Speaker A
La edad también es un factor que aporta mínimamente, pero aporta también el colesterol, también los tiglicerios.
Speaker A
Sin embargo, se demostró que el sexo, la glucosa y la obesidad no mostraron evidencia estadísticamente significativa, es decir, no influye tanto en la gina de pecho.
Speaker A
¿Por qué? Porque son no significativas. Si se fijan el P valor son rojitos y eso quiere decir que no son significativos, no aportan en nada al modelo.
Speaker A
Entonces toda esa información que nos dio el SPCC en la el chat GPT lo ha plasmado en una infografía mucho más interesante, muchachos. Y esto es, mejor dicho, esto da mayor valor a tus interpretaciones. No puedes presentar una PPT o algo así.
Speaker A
No es que la IA te ha inventado los valores, tú le has dado los valores y la simplemente ha mejorado la presentación.
Speaker A
¿Se dan cuenta? Son tus propios datos, mujeres. Entonces, ustedes pueden potenciar así muchos análisis propios que que ustedes tienen, ¿no? Ya sea en la parte académica, ya sea en la parte laboral.
Speaker A
Usen la muchachos, como un aliado de ustedes que hace muchas cosas y hace cosas muy buenas por cierto.
Speaker A
Muy bien. Con eso no digo que no tienen que estudiar la teoría, no, si tienen que estudiar. Recuerden que la A simplemente es un aliado, un ayudante, un asistente, ¿no? Pero quienes lo dirigen son ustedes, ¿no? Cuando tienen
Speaker A
más conocimiento van a poder dirigir mucho mejor, ¿no? Bien muchachos. Eso es entonces todo relacionado a nuestro a nuestro curso de SPCS para la investigación.
Speaker A
No sé si hay alguna consulta al respecto, alguna duda quizás. Recuerden, muchachos, que hoy día es nuestra última sesión. Eh, ninguna muchachos.
Speaker A
Bien, en ese sentido, entonces damos por finalizado nuestro curso de eh SPCS, ¿no? Buenas noches, estimados. Un favor, ¿pueden ayudarnos a poder llenar esta encuesta, por favor? Que nos va a ayudar a poder mejorar. Les enviado ahí al
Speaker A
mensaje de Zoom, como también al mensaje al WhatsApp, si nos pueden ayudar, por favor.
Speaker A
Okay, muy bien. A ver, por favor, un apoyo con las encuestas. A ver, su compañera María Chávez pregunta, ¿cuándo es recomendable utilizar este modelo proyectivo?
Speaker A
Primero, si es que tienes una variable dicotómica, si tienes una variable binaria en, no sé, en tu trabajo o en la universidad o en alguna investigación, estos modelos son muy útiles para eventos binarios. morosidad, deserción, tumor cancerígeno, no cancerígeno,
Speaker A
enfermo sano esos eventos binarios, ¿no? Si tuvieras la necesidad de modelar o explicar un evento binario, estos modelos son muy apropiados para ellos, solo para esos casos.
Speaker A
Si ya tienes variables numéricas, sería la regresión lineal, simple o múltiple, ¿no? Bien, muchachos, por mi parte llegamos hasta acá. Un gusto con ustedes y conmigo será hasta una nueva oportunidad, muchachos. Muchas gracias por su atención y buena.
Speaker A
Adelante. ¿Cuál es la duda? Profesor, buenas noches. Este y si queremos hacer alguna consulta, eh, algún número nos puede dejar.
Speaker A
Claro, a mí. A ver, yo les mando por el chat, ahí me agregan. Ya.
Speaker A
Ya, profesor. Gracias. Ahí cualquier cosa me escriben, muchachos. Ya, ahí está mi número. Bien. Eh, bien, muchachos, nos quedamos acá y a ver si pueden llenar la encuesta, por favor. Muchas gracias y conmigo será hasta una nueva oportunidad. Muchas gracias, muchachos.
Speaker A
Nos vemos. Gracias. Buenas noches,
Topics:regresión linealcorrelaciónmodelos predictivosanálisis estadísticovariable dependientevariable independienteerror aleatorioregresión múltipleregresión logísticamodelos lineales generalizados











