Saltar ao contido

Función de verosimilitude

Na Galipedia, a Wikipedia en galego.
Función de verosimilitude
 Subclase de
Fontes e ligazóns
Freebase/m/0c7sj Editar o valor en Wikidata
MeSHD016013 Editar o valor en Wikidata
MathWorldLikelihoodFunction Editar o valor en Wikidata
OpenAlexC89106044 Editar o valor en Wikidata
Wikidata

Unha función de verosimilitude (normalmente chamada simplemente verosimilitude) mide o éxito co que un modelo estatístico explica un conxunto de datos observados calculando a probabilidade de ter xerado tales datos a partir de distintos valores dos parámetros do modelo. Constrúese a partir da distribución de probabilidade conxunta da variable aleatoria que (presuntamente) xerou as observacións.[1][2][3] Deste xeito, ao avaliarse nos datos observados convértese nunha función que depende unicamente dos parámetros do modelo.

Na estimación por máxima verosimilitude, o argumento que maximiza a función de verosimilitude serve como un estimador puntual do parámetro descoñecido. Ademais, a través da información de Fisher podemos obter unha aproximación da precisión do estimador.

Pola contra, na estatística bayesiana, o interese céntrase no inverso da verosimilitude, coñecido como a probabilidade posterior do parámetro en función dos datos observados, que se calcula mediante a aplicación do teorema de Bayes.[4]

Definición

[editar | editar a fonte]

A función de verosimilitude, dada en función dun parámetro (ou vector de parámetros), defínese de xeito diferente segundo traballemos con distribucións de probabilidade discretas ou continuas. Dada unha función de densidade ou unha función de masa de probabilidade

onde é a realización da variable aleatoria , a función de verosimilitude é

tamén escrita habitualmente como .

Noutras palabras, cando se ve como unha función de con fixo, é unha función de densidade de probabilidade, e cando se ve como unha función de con fixado, é unha función de verosimilitude. No paradigma frecuentista, a notación adoita evitarse empregando no seu lugar ou para indicar que é unha cantidade descoñecida, pero fixa, en lugar dunha variable aleatoria condicionante.

A función de verosimilitude non especifica que a probabilidade de que sexa o verdadeiro parámetro, dada a mostra observada . Tal interpretación é un erro común, con potenciais consecuencias desastrosas (ver a falacia da frecuencia base).

Distribución de probabilidade discreta

[editar | editar a fonte]

Sexa é unha variable aleatoria discreta con función de masa de probabilidade dada polo parámetro . A función

como función de é a función de verosimilitude, dada a observación , da variable aleatoria . En ocasións a probabilidade de "obter o valor de dado o valor do parámetro " escríbese como ou . A verosimilitude é a probabilidade de que un posible resultado se observe cando o valor verdadeiro do parámetro é , equivalente á masa de probabilidade sobre . É importante sinalar que isto non define unha densidade de probabilidade sobre , que está fixo. Tampouco debe de confundirse a verosimilitude, , coa probabilidade a posteriori de dado , .

Figura 1. Función de verosimilitude () para a probabilidade de que unha moeda caia de "cara" (sen coñecemento da fidelidade da moeda), dado que se ten observado "HH"
Figura 2. Función de verosimilitude () para a probabilidade de que unha moeda caia de "cara" (sen coñecemento da fidelidade da moeda), dado que se ten observado "HHT"

Consideremos un modelo estatístico simple, tirar unha moeda ao aire. Este vén dado por un único parámetro que determina a probabilidade de que a moeda caia coa "cara" para arriba ao lanzar a moeda (H). Polo tanto, . Se a moeda fose "legal" (non estivese trucada), teríamos que .

Lanzamos a moeda dúas veces e en ambas sae cara ("HH"). Supoñendo que cada lanzamento é i.i.d., entón a probabilidade de observar "HH" é

Do mesmo xeito, a función de verosimilitude de observar "HH" supoñendo é

o que non equivale a dicir que . Para poder calcular dita probabilidade teríamos que empregar o teorema de Bayes

Se agora consideramos unha moeda trucada, con . Entón a probabilidade de obter cara dúas veces é

Polo tanto, . Na Figura 1 represéntase o resultado de calcular, para cada valor de , a verosimilitude correspondente. Mentres, na Figura 2 realízase unha representación similar para o caso no que a moeda teña caído dúas veces de cara e unha de cruz ("HHT").

Distribución de probabilidade continua

[editar | editar a fonte]

Sexa unha variable aleatoria cunha seguindo unha distribución de probabilidade (absolutamente) continua con función de densidade . A función

como función de , é a función de verosimilitude (de , dada a observación ). Igualmente, cabe recalcar que non define unha función de densidade ou de masa de probabilidade sobre .

Relación entre a verosimilitude e as funcións de densidade de probabilidade

[editar | editar a fonte]

O uso da densidade de probabilidade para especificar a función de verosimilitude ten a seguinte xustificación. Dada unha observación , a verosimilitude no intervalo , onde é constante, e vén dada por . Obsérvase que

xa que é positivo e constante. Tense que

onde é a función de densidade de probabilidade. Empregando o primeiro teorema fundamental do cálculo chégase a que

Logo, tendo en conta todo o anterior

Chegando a que: , polo que maximizar a densidade de probabilidade en leva a que esteamos maximizando a verosimilitude dada a observación .[5][6]

Razón de verosimilitudes e verosimilitude relativa

[editar | editar a fonte]

Razón de verosimilitudes

[editar | editar a fonte]

Unha razón de verosimilitudes é o cociente de calquera dúas verosimilitudes, dado por

A razón de verosimilitudes é un concepto central da análise estatística. A lei da verosimilitude establece que o grao no que uns datos (considerados como unha evidencia) sosteñen un valor dun parámetro respecto doutro mídese a través da razón de verosimilitudes.

Na inferencia frecuentista, a razón de verosimilitudes é a base para un test estatístico, levando o nome de test de razón de verosimilitudes. Pódese comprobar, mediante o lema de Neyman-Pearson, que este é o test máis potente para comparar dúas hipóteses simples dado un nivel de significación. Moitos outros tests poden verse como tests de razón de verosimilitudes ou como aproximacións dos mesmos.[7] A distribución asintótica da razón de log-verosimilitudes, considerada como un test estatístico, vén dada polo teorema de Wilks.

A razón de verosimilitude tamén ten unha importancia capital na inferencia bayesiana, onde se coñece como o factor de Bayes, que se usa na regra de Bayes. Expresada en termos de probabilidades, a regra de Bayes afirma que as probabilidades "posteriores" de dúas alternativas, e , dado un evento , son as probabilidades "a priori", multiplicadas pola razón de verosimilitude. Isto é

A razón de verosimilitude non se usa directamente nas estatísticas baseadas no AIC. En cambio, o que se usa é a verosimilitude relativa dos modelos (que se trata máis abaixo).

Na medicina baseada na evidencia, as razóns de verosimilitude empréganse nas probas diagnósticas para avaliar o valor de realizas.

Función de verosimilitude relativa

[editar | editar a fonte]
Véxase tamén: Verosimilitude relativa.

Dado que o valor real da función de verosimilitude depende da mostra, a miúdo é conveniente traballar cunha medida estandarizada. Supoñamos que a estimación de máxima verosimilitude para o parámetro é . As verosimilitudes relativas doutros valores de pódense obter comparando as verosimilitudes deses outros valores coa verosimilitude de . A verosimilitude relativa de defínese como[8][9][10][7][11]

Así, a verosimilitude relativa é a razón de verosimilitude (mencionada anteriormente) co denominador fixo . Isto correspondese coa estandarización da verosimilitude para que teña un máximo de 1.

Rexión de verosimilitude

[editar | editar a fonte]

Unha rexión de verosimilitude é o conxunto de todos os valores de θ cuxa verosimilitude relativa é maior ou igual a un limiar determinado. En termos de porcentaxes, unha «rexión de de verosimilitude para defínese como[8][10][12]

Se consta dun único parámetro real, unha rexión de verosimilitude de % normalmente comprenderá un intervalo de valores reais. Se a rexión comprende un intervalo, entón chámase «intervalo de verosimilitude».[8][10][13]

Os intervalos de verosimilitude, e máis xeralmente as rexións de verosimilitude, empréganse para a estimación de intervalos dentro das estatísticas baseadas na verosimilitude: son similares aos intervalos de confianza nas estatísticas frecuentistas e aos intervalos de cribles nas estatísticas bayesianas. Os intervalos de verosimilitude interprétanse directamente en termos de verosimilitude relativa, non en termos de probabilidade de cobertura (frecuentismo) ou probabilidade posterior (bayesianismo).

Dado un modelo, os intervalos de verosimilitude pódense comparar cos intervalos de confianza. Se é un único parámetro real, entón, baixo certas condicións, un intervalo de verosimilitude do 14,65% (aproximadamente unha verosimilitude de 1:7) para será o mesmo que un intervalo de confianza do 95% (probabilidade de cobertura de 19:20).[8][12] Nunha formulación lixeiramente diferente, axeitada para o uso de log-verosimilitudes (véxase o teorema de Wilks), o estatístico de contraste é o dobre da diferenza nas log-verosimilitudes e a distribución de probabilidade do estatístico de contraste é aproximadamente unha distribución khi cadrado con graos de liberdade iguais á diferenza dos graos de liberdade dos dous modelos (polo tanto, o % intervalo de verosimilitude é o mesmo que o intervalo de confianza ao 95,4%; asumindo que a diferenza nos graos de liberdade é 1).[12][13]

Verosimilitude para eliminar parámetros molestos

[editar | editar a fonte]

En moitos casos, a verosimilitude é función de máis dun parámetro, pero o interese céntrase na estimación dun só, ou como máximo duns poucos deles, considerándose os demais parámetros molestos. Desenvolvéronse varios enfoques alternativos para eliminar estes parámetros molestos, de xeito que unha verosimilitude pódese escribir como función só do parámetro (ou parámetros) de interese: os principais son as probabilidades de perfil, condicionais e marxinais.[14][15] Estas abordaxes tamén son útiles cando unha superficie de verosimilitude de alta dimensionalidade precisa ser reducida a un ou dous parámetros de interese de xeito que sexa posible representala graficamente.

Verosimilitude perfil

[editar | editar a fonte]

É posible reducir as dimensións concentrando a función de verosimilitude para un subconxunto de parámetros, expresando os parámetros molestos como funcións dos parámetros de interese e substituíndoos na expresión da función de verosimilitude.[16][17] En xeral, para unha función de verosimilitude que depende do vector de parámetros que se pode dividir en , e onde se pode determinar explicitamente unha relación , a concentración reduce a carga computacional do problema de maximización orixinal.[18]

Por exemplo, nunha regresión lineal con erros distribuídos normalmente, , o vector de coeficientes podería particionarse en (e, en consecuencia, a matriz de deseño ). Maximizar con respecto a produce unha función onde o valor óptimo séguese de

Empregando este resultado, o estimador de máxima verosimilitude para pódese derivar como

onde é a matriz de proxección de . Este resultado coñécese como o teorema de Frisch-Waugh-Lovell.

Dado que graficamente o procedemento de concentración é equivalente a cortar a superficie de verosimilitude ao longo da crista de valores do parámetro de molestia que maximiza a función de verosimilitude, creando un perfil isométrico da función de verosimilitude para un dado, o resultado deste procedemento tamén se coñece como verosimilitude perfil.[19][20] Ademais de representarse graficamente, a probabilidade de perfil tamén se pode usar para calcular intervalos de confianza que a miúdo teñen mellores propiedades en mostras pequenas que os baseados en erros estándar asintóticos calculados a partir da verosimilitude total.[21][22]

Verosimilitude condicional

[editar | editar a fonte]

Ás veces é posible atopar un estatístico suficiente para os parámetros molestos de forma que, condicionando respecto deste estatístico, se obteña unha verosimilitude que non depende dos parámetros molestos.[23]

Produtos de probabilidades

[editar | editar a fonte]

A probabilidade, dados dous ou máis eventos independentes, é o produto das probabilidades de cada un dos eventos individuais:

Isto é particularmente importante cando os eventos proveñen de variables aleatorias independentes e identicamente distribuídas, como observacións independentes ou observacións obtidas mediante mostraxe con substitución. Nunha situación deste tipo, a función de probabilidade factorízase nun produto de funcións de verosimilitude individuais.

Log-verosimilitude

[editar | editar a fonte]
Véxase tamén: Log-verosimilitude.

A "función logarítmica de verosimilitude" é o logaritmo da función de verosimilitude, a miúdo denotada por unha l ou minúscula, en contraste coa L ou maiúscula para a verosimilitude. Dado que os logaritmos son funcións estritamente crecentes, maximizar a verosimilitude é equivalente a maximizar a verosimilitude logarítmica. Pero para fins prácticos é máis conveniente traballar coa función de log-verosimilitude na estimación de máxima verosimilitude, en particular porque a maioría das distribucións de probabilidade habituais, especialmente a familia exponencial, son só logaritmicamente cóncavas,[24][25] e a concavidade da función obxectivo xoga un papel fundamental na maximización da mesma.

Un logaritmo dunha razón de verosimilitude é igual á diferenza das verosimilitudes logarítmicas:

Do mesmo xeito que a verosimilitude, dado ningún evento, é 1, a verosimilitude logarítmica, dado ningún evento, é 0, o que corresponde ao valor da suma baleira: sen ningún dato, non hai soporte para establecer ningún modelo.

O gráfico da verosimilitude logarítmica chámase curva de soporte (no caso univariante).[26] No caso multivariante, o concepto xeneralizase nunha superficie de soporte sobre o espazo de parámetros. Ten relación co soporte dunha distribución, pero é distinto del.

O termo foi acuñado por A. W. F. Edwards[26] no contexto dos contrastes de hipóteses estatísticas, é dicir, se os datos "apoian" ou non unha hipótese (ou valor do parámetro) que se está a probar en maior medida que calquera outra.

A función de verosimilitude logarítmica que se está a representar utilízase no cálculo da score (o gradiente da verosimilitude logarítmica) e a información de Fisher (a curvatura da verosimilitude logarítmica). Polo tanto, o gráfico ten unha interpretación directa no contexto da estimación de máxima verosimilitude e dos contrastes de razón de verosimilitudes.

Ecuacións de verosimilitude

[editar | editar a fonte]

Se a función logarítmica de verosimilitude é suave, o seu gradiente con respecto ao parámetro, coñecido como score e escrito como , existe e permite a aplicación do cálculo diferencial. A forma básica de maximizar unha función diferenciable é atopar os seus puntos estacionarios (os puntos onde a derivada é cero); dado que a derivada dunha suma é só a suma das derivadas, pero a derivada dun produto require da regra do produto, é máis doado calcular os puntos estacionarios da verosimilitude logarítmica de eventos independentes que para a verosimilitude de eventos independentes.

As ecuacións definidas polo punto estacionario da función de score serven como ecuacións de estimación para o estimador de máxima verosimilitude

Nese sentido, o estimador de máxima verosimilitude defínese implicitamente polo valor en da función inversa , onde é o espazo euclidiano de dimensión d e é o espazo de parámetros. Mediante o teorema da función inversa pódese demostrar que está ben definido nunha veciñanza aberta arredor de cunha probabilidade de un, e é unha estimación consistente de . En consecuencia, existe unha secuencia tal que asintoticamente con converxencia case segura, e .[27] Un resultado similar pódese establecer empregando o teorema de Rolle.[28][29]

A segunda derivada avaliada en , coñecida como información de Fisher, determina a curvatura da superficie de verosimilitude,[30] e, polo tanto, indica a precisión da estimación.[31]

Familias exponenciais

[editar | editar a fonte]
Artigo principal: Familia exponencial.

A verosimilitude logarítmica tamén é particularmente útil para familias exponenciais de distribucións, que inclúen moitas das distribucións de probabilidade paramétricas habituais. A función de distribución de probabilidade (e, polo tanto, a función de verosimilitude) para familias exponenciais contén produtos de factores que implican a exponenciación. O logaritmo dunha función deste tipo é unha suma de produtos, de novo máis fácil de diferenciar que a función orixinal.

Unha familia exponencial é aquela cuxa función de densidade de probabilidade ten a forma (para algunhas funcións, escribindo para o produto interno):

Cada un destes termos ten unha interpretación, pero simplemente cambiando de probabilidade a verosimilitude e tomando logaritmos obtense a suma:

As funcións e corresponden cada unha a un cambio de coordenadas, polo que nestas coordenadas, a verosimilitude logarítmica dunha familia exponencial vén dada pola fórmula simple:

Noutras palabras, a verosimilitude logarítmica dunha familia exponencial é o produto interno do parámetro natural e o estatístico suficiente , menos o factor de normalización (función de partición logarítmica) . Así, por exemplo, a estimación de máxima verosimilitude pódese calcular tomando derivadas do estatístico suficiente e da función de partición logarítmica .

Exemplo: a distribución gamma

[editar | editar a fonte]

A distribución gamma é unha familia exponencial con dous parámetros, e . A súa función de verosimilitude é

Atopar a estimación de máxima verosimilitude de para un único valor observado parece bastante desalentador. O seu logaritmo é moito máis sinxelo de manexar:

Para maximizar a verosimilitude logarítmica, primeiro tomamos a derivada parcial con respecto a :

Se hai varias observacións independentes , entón a verosimilitude logarítmica conxunta será a suma das verosimilitudes logarítmicas individuais, e a derivada desta suma será unha suma das derivadas de cada verosimilitude logarítmica individual:

Para completar o procedemento de maximización da verosimilitude logarítmica conxunta, a ecuación iguálase a cero e resólvese para :

Aquí denota a estimación de máxima verosimilitude e é a media mostral das observacións.

  1. Casella, George; Berger, Roger L. (2002). Statistical Inference [Inferencia Estatística] (en inglés) (2ª ed.). Duxbury. p. 290. ISBN 0-534-24312-6.
  2. Wakefield, Jon (2013). Frequentist and Bayesian Regression Methods [Métodos de Regresión Frecuentistas e Bayesianos] (en inglés) (1ª ed.). Springer. p. 36. ISBN 978-1-4419-0925-1.
  3. Lehmann, Erich L.; Casella, George (1998). Theory of Point Estimation [Teoría da Estimación Puntual] (en inglés) (2ª ed.). Springer. p. 444. ISBN 0-387-98502-6.
  4. Zellner, Arnold (1971). An Introduction to Bayesian Inference in Econometrics [Unha Introdución á Inferencia Bayesiana en Econometría] (en inglés). Wiley. pp. 13–14. ISBN 0-471-98165-6.
  5. Billingsley, Patrick (1995). Probability and Measure [Probabilidade e Medida] (en inglés) (3ª ed.). John Wiley & Sons. pp. 422-423.
  6. Shao, Jun (2003). Mathematical Statistics [Estatística Matemática] (en inglés) (2ª ed.). Springer.
  7. 1 2 Buse, A. (1982). "The Likelihood Ratio, Wald, and Lagrange Multiplier Tests: An Expository Note". The American Statistician 36 (3a): 153–157. doi:10.1080/00031305.1982.10482817.
  8. 1 2 3 4 Kalbfleisch, J. G. (1985). "9.3". Probability and Statistical Inference [Probabilidade e Inferencia Estatística] (en inglés). Springer.
  9. Azzalini, A. (1996). Statistical Inference--Based on the likelihood [Inferencia Estatística--Baseada na verosimilitude] (en inglés). Chapman & Hall. ISBN 9780412606502.
  10. 1 2 3 Sprott, D. A. (2000). "2". Statistical inference in Science [Interencia Estatística na Ciencia] (en inglés). Springer.
  11. Held, Leonhard; Sabanés Bové, Daniel (2014). "Applied Statistical Inference" [Inferencia Estatística Aplicada]. Springer (en inglés). doi:10.1007/978-3-642-37887-4.
  12. 1 2 3 Rossi, Richard J. (2018-07-18). Mathematical Statistics: An Introduction to Likelihood Based Inference [Estatística Matemática: Unha Introdución á Inferencia Baseada na Verosimilitude] (en inglés) (1 ed.). Wiley. ISBN 978-1-118-77104-4. doi:10.1002/9781118771075.
  13. 1 2 Hudson, D. J. (1971-07-01). "Interval Estimation from the Likelihood Function" [Estimación de intervalos a partir da función de verosimilitude]. Journal of the Royal Statistical Society Series B: Statistical Methodology (en inglés) 33 (2): 256–262. ISSN 1369-7412. doi:10.1111/j.2517-6161.1971.tb00877.x.
  14. Pawitan, Yudi (2001). In all likelihood: statistical modelling and inference using likelihood. Oxford : New York: Clarendon Press; Oxford University Press. ISBN 978-0-19-850765-9.
  15. Hsiang Wei, Wen. "Generalized Linear Models". Course notes. Taichung, Taiwan: Tunghai University. Consultado o 2025-09-04.
  16. Amemiya, Takeshi (1985). Advanced econometrics. Cambridge: Harvard University Press: Harvard University Press. pp. 125–127. ISBN 978-0-674-00560-0.
  17. Davidson, Russell; MacKinnon, James G. (1993). Estimation and inference in econometrics. New York: Oxford University Press. ISBN 978-0-19-506011-9.
  18. Gourieroux, Christian; Monfort, Alain (1995). Statistics and econometric models. Themes in modern econometrics. Cambridge [England] ; New York, NY, USA: Cambridge University Press. ISBN 978-0-521-40551-5.
  19. Pickles, Andrew (1984). An introduction to likelihood analysis. Norwich: W. H. Hutchins & Sons. pp. 21–24. ISBN 978-0-86094-190-3.
  20. Bolker, Benjamin M. (2008). Ecological models and data in R. Princeton: Princeton university press. ISBN 978-0-691-12522-0.
  21. Murray, Aitkin (1982-08-31). "Direct Likelihood Inference". GLIM 82: Proceedings of the International Conference on Generalised Linear Models (en inglés). Springer New York. pp. 76–86. ISBN 978-0-387-90777-2.
  22. Venzon, D. J.; Moolgavkar, S. H. (1988). "A Method for Computing Profile-Likelihood-Based Confidence Intervals". Applied Statistics 37 (1): 87. doi:10.2307/2347496.
  23. Kalbfleisch, J. D.; Sprott, D. A. (1973). "Marginal and Conditional Likelihoods". Sankhya: The Indian Journal of Statistics, Series A (1961-2002) 35 (3): 311–328. ISSN 0581-572X.
  24. Kass, Robert E.; Vos, Paul W. (1997). Geometrical foundations of asymptotic inference. Wiley series in probability and statistics. New York: Wiley. ISBN 978-0-471-82668-2.
  25. "Why we always put log() before the joint pdf when we use MLE(Maximum likelihood Estimation)?". Cross Validated (en inglés). Consultado o 2025-09-14.
  26. 1 2 Edwards, A. W. F. (1992). Likelihood (Expanded ed ed.). Baltimore: Johns Hopkins University Press. ISBN 978-0-8018-4445-4.
  27. Foutz, Robert V. (1977-03). "On the Unique Consistent Solution to the Likelihood Equations". Journal of the American Statistical Association (en inglés) 72 (357): 147–148. ISSN 0162-1459. doi:10.1080/01621459.1977.10479926.
  28. Tarone, Robert E.; Gruenhage, Gary (1975-12). "A Note on the Uniqueness of Roots of the Likelihood Equations for Vector-Valued Parameters". Journal of the American Statistical Association (en inglés) 70 (352): 903–904. ISSN 0162-1459. doi:10.1080/01621459.1975.10480321.
  29. Rai, Kamta; Van Ryzin, John (1982-01). "A note on a multivariate version of rolle's theorem and uniqueness of maximum likelihood roots". Communications in Statistics - Theory and Methods (en inglés) 11 (13): 1505–1510. ISSN 0361-0926. doi:10.1080/03610928208828325.
  30. Rao, B. Raja (1960). "A formula for the curvature of the likelihood surface of a sample drawn from a distribution admitting sufficient statistics". Biometrika (en inglés) 47 (1-2): 203–207. ISSN 0006-3444. doi:10.1093/biomet/47.1-2.203.
  31. Ward, Michael D.; Ahlquist, John S. (2018-11-15). Maximum Likelihood for Social Science. Cambridge University Press. ISBN 978-1-316-88854-4.

Véxase tamén

[editar | editar a fonte]

Outros artigos

[editar | editar a fonte]