1. Qué mide el instrumento
TraitTune estima la posición de cada persona en cada una de quince dimensiones de la personalidad, junto con una cifra de precisión de medición por dimensión. Las dimensiones son bipolares y continuas —cada una es un espectro anclado por dos etiquetas de polo— y cada puntuación se reporta en una escala de 0 a 100 junto con la precisión con la que se midió.
Las quince dimensiones se organizan en cuatro grupos interpretativos: Curiosidad e impulso, Compromiso social, Estructura y enfoque, y Base emocional. Los grupos se derivaron empíricamente de la estructura de correlación posterior de la calibración desplegada, no se impusieron tomando prestada la taxonomía de un marco competidor. La estructura dimensional subyacente se apoya en la literatura moderna de la psicología de los rasgos —la tradición de los cinco factores (Goldberg 1993; McCrae y Costa 2008), la extensión HEXACO (Ashton y Lee 2007) y otros constructos bien atestiguados en varias taxonomías académicas— pero TraitTune no hereda en bloque las etiquetas ni la estructura factorial de ningún marco concreto.
Una puntuación intermedia en una dimensión es informativa, no un fallo en detectar la señal. Significa que el comportamiento de la persona en esa dimensión depende del contexto o está equilibrado entre los dos polos: un patrón real, no su ausencia. Cada puntuación reportada se acompaña de una cifra de precisión de medición, por lo que un resultado intermedio se lee como un hallazgo sustantivo, no como ruido.
2. Cómo interactúa la persona con el instrumento
Todo instrumento de un solo formato tiene un modo de fallo característico. Los ítems de escala de acuerdo invitan al sesgo de aquiescencia; los de elección forzada producen artefactos intrapersona (ipsativos) difíciles de comparar entre personas; los ítems de escenario son ricos en información pero costosos por unidad de tiempo. TraitTune mezcla deliberadamente cuatro formatos para que sus fortalezas se sumen y sus debilidades se cancelen (Christiansen, Burns y Montgomery 2005; Brown 2016).
Los ítems de tipo Likert presentan una afirmación y preguntan en qué medida la persona está de acuerdo en una escala de cinco puntos; estos forman la mayoría de la evaluación. Los ítems de elección forzada de dos opciones presentan un par de paráfrasis —ambas plausibles— que anclan extremos opuestos de una misma dimensión y preguntan cuál encaja mejor. Los ítems de escenario describen una breve situación cotidiana con tres respuestas conductuales plausibles que corresponden a niveles graduados del constructo subyacente.
Las triadas de elección forzada multidimensional (MFC) presentan tres afirmaciones extraídas de dimensiones distintas y piden a la persona que seleccione primero la que mejor le describe y luego la que menos. La presentación secuencial Más-Menos sigue la tradición del Best-Worst Scaling (Finn y Louviere 1992; Marley y Louviere 2005; Louviere, Flynn y Marley 2015), que a su vez se apoya en la Ley del Juicio Comparativo de Thurstone (Thurstone 1927). Presentar las dos elecciones de forma secuencial en lugar de simultánea reduce la carga cognitiva y aporta la misma información de ranking por pares.
De forma crucial, tres de los cuatro formatos son normativos —la respuesta de cada persona es directamente comparable con la de otra— mientras que la MFC es ipsativa, es decir, sus respuestas son comparaciones intrapersona. Los instrumentos exclusivamente ipsativos son notoriamente difíciles de interpretar entre personas; los exclusivamente normativos son vulnerables a artefactos de estilo de respuesta y deseabilidad social. Combinar ambos es más robusto frente al fingimiento y los estilos de respuesta que cualquiera de las dos familias por separado (Jackson, Wroblewski y Ashton 2000; Christiansen, Burns y Montgomery 2005; Brown 2016).
3. Cómo se calcula una puntuación
Cada respuesta se puntúa con un modelo de Teoría de Respuesta al Ítem (IRT) apropiado a su formato. La IRT es el marco de medición que sustenta los programas de evaluación adaptativa a gran escala en todo el mundo, incluidos el GRE, el GMAT y la batería de aptitudes vocacionales de las fuerzas armadas estadounidenses (Embretson y Reise 2000; van der Linden y Glas 2010). A diferencia de la teoría clásica de los tests, cada ítem lleva sus propios parámetros calibrados de dificultad y discriminación, lo que permite al motor ponderar la evidencia de ítems de distintos formatos en una única escala común.
Cada formato se puntúa con el modelo IRT adecuado a su estructura de respuesta. Los ítems Likert se modelan con el Graded Response Model (Samejima 1969); los de elección forzada de dos opciones con el modelo logístico de dos parámetros (Birnbaum 1968); los de escenario con el Generalised Partial Credit Model (Muraki 1992) sobre tres categorías ordenadas. Las triadas MFC se modelan con IRT thurstoniana siguiendo a Brown y Maydeu-Olivares (2011), donde cada afirmación lleva una utilidad latente U = λ·κ·θ + ε con carga λ específica del ítem, polaridad κ ∈ {+1, −1} y residuo gaussiano ε. Una selección Más/Menos se descompone en tres probabilidades por pares, cada una función de la CDF normal de las diferencias de utilidad entre las afirmaciones emparejadas; es la misma familia de modelos que sustenta el enfoque Multi-Unidimensional Pairwise Preference para la evaluación adaptativa de la personalidad (Stark, Chernyshenko y Drasgow 2005, 2012).
Como una respuesta puede aportar información sobre más de una dimensión a la vez —y porque las triadas MFC son intrínsecamente multidimensionales— la estimación de rasgos se realiza dentro de un marco de IRT multidimensional (MIRT) sobre un único vector latente de quince dimensiones con un prior estándar normal compartido (Reckase 2009; Ackerman 1994). Tras cada respuesta, la distribución posterior de cada dimensión se recalcula mediante una actualización expected a posteriori (EAP) sobre una rejilla de 61 puntos, implementada como un barrido de ascenso por coordenadas en dos pasadas a través de las quince dimensiones (Bock y Mislevy 1982). La puntuación, la cifra de precisión y la categoría interpretativa que se muestran a la persona se derivan todas de la media y la desviación estándar posteriores por dimensión.
La selección de ítems es adaptativa. En un cuestionario de longitud fija, todas las personas ven los mismos ítems en el mismo orden; en TraitTune, el siguiente ítem se elige a partir de lo que el motor ya sabe de esa persona. En concreto, cada ítem candidato se puntúa por su información de Fisher en la media posterior actual, multiplicada por la varianza posterior actual de la dimensión a la que apunta: score(i) = I_i(θ̂_d) · Var(θ_d | respuestas hasta el momento). La información de Fisher es el criterio clásico de optimalidad para seleccionar ítems en IRT; la ponderación por varianza dirige al motor hacia las dimensiones cuyas estimaciones siguen siendo amplias, en lugar de las ya resueltas. La regla es simple y estacionaria: no hay una heurística aparte para el inicio de la sesión ni una transición de fase. Como la varianza difiere entre dimensiones, el motor explora de forma amplia al principio (cuando todas las varianzas rondan 1.0) y se enfoca más adelante (cuando la mayoría de dimensiones han convergido y solo unas pocas siguen amplias). Es una forma práctica de selección de Fisher ponderada por la posterior (Chang y Ying 1996; van der Linden y Pashley 2010).
Para el contenido MFC se aplica la misma regla a nivel de bloque: cada triada candidata se puntúa por la información de Fisher esperada que aportaría a cada una de las tres dimensiones que cubre, ponderada por la varianza posterior actual de cada dimensión y sumada sobre las dimensiones aún activas (Stark, Chernyshenko y Drasgow 2012). La selección en una dimensión termina cuando su desviación estándar posterior cruza un umbral de precisión; los ítems y bloques que solo aportarían información a dimensiones ya convergidas quedan descartados. El motor trabaja en tres zonas de precisión: una dimensión se considera resuelta cuando su SD posterior cae por debajo de un umbral estricto, se refina con uno o dos ítems adicionales de alta información en una zona intermedia y —si sigue siendo ampliamente incierta tras agotar los ítems paramétricos— se deriva a un intercambio abierto de seguimiento (el chat de aclaración) antes de reportar una estimación final. Los valores exactos de los umbrales se versionan con cada calibración, no se fijan en esta página.
Como las dimensiones convergen a distinto ritmo —en función de la profundidad del banco de ítems de esa dimensión y de la posición de la persona en ella— el número total de ítems que verá no está fijado de antemano. Una sesión completa de quince dimensiones suele requerir entre 40 y 70 ítems, sustancialmente menos de lo que necesitaría un inventario de longitud fija comparable para una precisión equivalente. La barra de progreso muestra una previsión de ítems restantes esperados, calculada proyectando el selector hacia delante bajo las estimaciones posteriores actuales en lugar de contar hacia una meta prefijada.
Algunas personas no necesitan un perfil completo de quince dimensiones de una sola vez. TraitTune ofrece ámbitos enfocados por caso de uso —Carrera y desempeño, Citas y pareja, Estilo de colaboración, Autoconocimiento— cada uno orientado a las cinco dimensiones prioritarias de ese ámbito, en lugar de las quince. El motor de puntuación es el mismo en ambos casos; solo cambia el grupo de candidatos, por lo que una sesión enfocada es más corta (unos 25–40 ítems) y solo las cinco dimensiones del ámbito reciben una estimación con precisión asociada. Las dimensiones fuera de ámbito no se reportan como cero: simplemente no se miden en esa sesión, y la persona puede ampliar más tarde al instrumento completo sin repetir lo ya respondido.
4. Desarrollo de ítems
La calidad de los ítems es el factor que más determina la precisión de la medición en la práctica moderna de la IRT (Clark y Watson 1995; DeVellis 2017). El banco activo contiene actualmente unos 885 ítems repartidos entre las quince dimensiones —un promedio de unos 59 por dimensión, con la distribución real moldeada por la amplitud de cada dimensión y la mezcla de formatos—. Cada ítem ha superado una revisión estructurada en varias fases antes de entrar al instrumento en vivo.
Los ítems se redactan a partir de la definición operativa de una única dimensión y se revisan tanto por su constructo principal como por cualquier carga cruzada en constructos no relacionados; los ítems que cargan en más de una dimensión se reescriben o se retiran. Cada dimensión incorpora ítems con polaridad directa y polaridad inversa en proporciones aproximadamente iguales, de modo que el sesgo de aquiescencia y los artefactos de respuesta descuidada no puedan sesgar sistemáticamente la estimación en una dirección.
Los ítems que aparecen dentro de triadas MFC pasan una calibración estructural adicional. Dentro de un bloque, las tres afirmaciones se agrupan de modo que sus valoraciones de deseabilidad social estén estrechamente equiparadas; el agrupamiento por deseabilidad equiparada es la condición bajo la cual la IRT thurstoniana produce las estimaciones de utilidad menos sesgadas, y es lo que convierte un bloque de elección forzada en una tarea genuinamente discriminativa, no en una preferencia por deseabilidad social (Jackson, Wroblewski y Ashton 2000; Brown y Maydeu-Olivares 2013). El ensamblaje del bloque garantiza además que cada triada provenga de tres dimensiones distintas, contenga al menos un ítem con polaridad inversa y al menos uno con polaridad directa, y no reutilice el mismo ítem entre bloques activos solapados. Estas restricciones las hace cumplir una pipeline automatizada de ensamblaje de bloques, siguiendo las recomendaciones de la literatura sobre metodología de formato de elección forzada (Hicks 1970; Meade 2004).
Cada ítem también pasa una revisión de contenido para detectar formulaciones dobles, expresiones con carga cultural, ambigüedad y consistencia de nivel de lectura. Cuando los datos post-despliegue indican funcionamiento diferencial del ítem, baja discriminación o problemas de localización, la política es retirar y reemplazar: se redacta y calibra un ítem nuevo en lugar de reescribir el antiguo en su sitio, para que cada registro histórico de calibración quede vinculado al ítem exacto sobre el que se calculó. Los ítems retirados bajo esta política no regresan al banco activo. El análisis formal del Funcionamiento Diferencial del Ítem (DIF) entre estratos lingüísticos y demográficos está en la hoja de ruta de validación.
5. Calibración
Los parámetros de los ítems —discriminaciones, dificultades, umbrales de categoría de respuesta y las cargas y unicidades de la MFC— se estiman conjuntamente bajo un único modelo bayesiano jerárquico en el que los quince rasgos latentes comparten un prior multivariado-normal estándar y cada formato de respuesta aporta su propia verosimilitud sobre el mismo vector θ. La inferencia posterior usa Hamiltonian Monte Carlo con No-U-Turn (NUTS; Hoffman y Gelman 2014) implementado en PyMC (Salvatier, Wiecki y Fonnesbeck 2016), con diagnósticos estándar de r-hat y tamaño de muestra efectivo (Gelman et al. 2013). Cada despliegue está condicionado a superar esos diagnósticos en todos los parámetros de los ítems. Cada calibración se archiva junto con su instantánea de datos, su configuración de MCMC, su informe de diagnóstico y sus trazas posteriores, de modo que cada parámetro desplegado sea totalmente reproducible hasta la muestra sobre la que se ajustó. La calibración MIRT conjunta actualmente desplegada se finalizó en abril de 2026 bajo esos controles.
La calibración se reestima sobre el conjunto de personas en vivo a medida que crece: se reajusta sobre el mismo modelo jerárquico conjunto con respuestas reales, con validación cruzada fuera de muestra sobre personas reservadas en el control de versión, de modo que los parámetros desplegados sigan ajustándose a la población a la que sirve el instrumento. La recalibración iterativa de este tipo es práctica estándar en los programas de evaluación adaptativa a gran escala (van der Linden y Glas 2010).
Los valores de los parámetros en sí —discriminaciones, dificultades, utilidades— no se exponen en las salidas dirigidas a la persona. Se reservan tanto porque no son informativos para quien lee el informe como porque serían una entrada nada trivial para cualquier intento de manipular el instrumento. En un informe de TraitTune solo aparecen las salidas agregadas de medición: una puntuación, una estimación de precisión y un resumen interpretativo.
6. Fiabilidad, validez y lo que este instrumento no es
La precisión de medición de cada dimensión se reporta como la desviación estándar posterior sobre θ̂, obtenida directamente de la actualización EAP. En el límite de Fisher esto equivale a la fiabilidad IRT marginal ρ_d = 1 − 1/(1 + I_d(θ̂_d)), que es como suele reportarse la misma magnitud en la literatura de evaluación adaptativa. Como cada puntuación se reporta con su precisión asociada, quien la lee no tiene que adivinar cuánto peso darle a un resultado. Reportar una puntuación sin su precisión asociada es, en nuestra opinión, mala práctica psicométrica, y no es algo que hagamos.
La medición de la personalidad es probabilística. Una puntuación reportada no es un veredicto categórico; es la media posterior de una estimación continua, emparejada con la desviación estándar que cuantifica cuánto la restringen las respuestas. Dos personas con la misma estimación puntual pueden tener distribuciones posteriores significativamente distintas, y la cifra de precisión es lo que hace visible esa diferencia. La confianza en una medición depende de la información de los ítems y del conjunto de respuestas, no de lo fuerte que suene un rasgo en forma narrativa.
Este instrumento no es un diagnóstico clínico. Mide la personalidad autorreportada en una serie de continuos bien definidos, y sus resultados están pensados como insumo para la autorreflexión, el desarrollo personal y —cuando la persona así lo decide— como contexto para la personalización por IA. No es adecuado como base única para decisiones vitales, de contratación o clínicas importantes. La evaluación clínica tiene otro propósito —diagnóstico, formulación del caso, planificación del tratamiento— y es la herramienta correcta para esas preguntas; TraitTune es complementario, no un sustituto.
7. Base jurídica y datos de categoría especial
Las puntuaciones de personalidad derivadas de respuestas psicométricas se tratan como inferencias sobre la disposición mental y conductual de una persona. Bajo el Reglamento General de Protección de Datos de la UE (RGPD), las inferencias de este tipo entran dentro de las categorías especiales de datos personales definidas en el artículo 9. Procesarlas requiere por tanto una base jurídica específica, más allá de la que se usa para los datos personales ordinarios.
TraitTune se basa en el consentimiento explícito de la persona encuestada conforme al artículo 9(2)(a) del RGPD como base jurídica. El consentimiento se registra en una pantalla específica antes de mostrar cualquier ítem, es granular respecto al acto de calcular un perfil de personalidad y puede retirarse en cualquier momento: en ese caso el tratamiento se detiene y los datos de respuesta y de perfil subyacentes se eliminan según el calendario documentado en la Política de Privacidad. No inferimos puntuaciones de personalidad a partir de ningún otro tipo de señal conductual: solo los ítems que la persona responde en la evaluación, con conocimiento y tras dar su consentimiento, se utilizan como entrada del motor. El panorama completo de protección de datos —datos del responsable del tratamiento, plazos de conservación, subencargados, mecanismos de transferencia y derechos de la persona encuestada— se encuentra en la Política de Privacidad, que es el documento de referencia autorizado para esas cuestiones; esta sección existe únicamente para hacer explícita la cuestión de la base jurídica junto a la metodología.
Glosario
Definiciones en lenguaje claro de los términos técnicos usados arriba.
- Teoría de Respuesta al Ítem (IRT)
- Familia de modelos estadísticos para tests y cuestionarios en la que la probabilidad de una respuesta dada a un ítem se modela como función del rasgo latente de la persona y un pequeño número de parámetros del ítem (típicamente discriminación y dificultad). Las estimaciones del rasgo y los parámetros del ítem se recuperan conjuntamente a partir de los datos de respuesta.
- IRT multidimensional (MIRT)
- Extensión de la IRT en la que cada ítem puede cargar en más de una dimensión latente. Se usa cuando los rasgos están correlacionados y los ítems miden varios rasgos a la vez, como ocurre con la personalidad.
- Evaluación adaptativa por ordenador (CAT)
- Formato de evaluación en el que el siguiente ítem mostrado se selecciona sobre la marcha usando la estimación actual del rasgo y el banco de ítems restante. Cada ítem se elige para ser máximamente informativo para la persona que se tiene delante, de modo que se alcanza la misma precisión con menos ítems que en un test de forma fija.
- Elección forzada multidimensional (MFC)
- Formato de ítem en el que se presenta junto un pequeño bloque de afirmaciones (típicamente de dos a cuatro) y la persona las ordena o elige la más y la menos característica. Los bloques de elección forzada reducen los artefactos de estilo de respuesta y deseabilidad social que contaminan los ítems Likert de una sola afirmación.
- IRT thurstoniana
- Modelo IRT para datos de elección forzada y preferencia por pares, propuesto originalmente para comparaciones por pares por Thurstone (1927) y reformulado para la evaluación multidimensional de la personalidad por Brown y Maydeu-Olivares (2011, 2013). Recupera rasgos latentes a partir de juicios comparativos, no de valoraciones Likert absolutas.
- Best-Worst Scaling (BWS)
- Tarea de juicio en la que la persona elige la opción más y la menos aplicable de un pequeño conjunto. Los datos se analizan después bajo un modelo de elección discreta o thurstoniano. Aporta más información por bloque que una ordenación simple.
- Información de Fisher
- Medida de cuánto se espera que un ítem dado reduzca la incertidumbre sobre la estimación del rasgo de la persona en su nivel actual. La usan los motores adaptativos para elegir el siguiente ítem: se selecciona el candidato con la mayor información esperada en la estimación actual del rasgo.
- Estimación bayesiana jerárquica
- Enfoque de estimación en el que los parámetros de los ítems y las estimaciones de rasgos se tratan como variables aleatorias extraídas de distribuciones a priori, y las distribuciones posteriores se obtienen conjuntamente vía Markov chain Monte Carlo o métodos variacionales. Proporciona intervalos creíbles para cada parámetro y rasgo, no solo estimaciones puntuales.
- Rasgo latente
- Propiedad subyacente no observable de una persona (p. ej., extraversión, responsabilidad) que el test intenta estimar a partir de las respuestas observables a los ítems. Cada persona tiene una posición en cada dimensión del rasgo; el test devuelve una estimación con una incertidumbre asociada.
- Big Five (Modelo de los Cinco Factores)
- Taxonomía empírica de la personalidad basada en cinco dimensiones amplias —típicamente apertura a la experiencia, responsabilidad, extraversión, amabilidad y neuroticismo— que se han recuperado repetidamente en distintos idiomas, culturas e instrumentos. TraitTune la trata como una referencia dimensional de dominio público, no como un producto comercial.
- HEXACO
- Taxonomía de la personalidad de seis factores que añade una dimensión de honestidad-humildad a los Big Five y reorganiza las demás. Se usa como marco de referencia adicional para la estructura dimensional.
Referencias seleccionadas
Todas las referencias son obras publicadas en la literatura psicométrica y de investigación de la personalidad revisada por pares. Sustentan los métodos específicos descritos arriba.
Fundamentos del juicio comparativo y del modelado de rasgos latentes
- Thurstone, L. L. (1927). A law of comparative judgment. Psychological Review, 34, 273–286.
- Lord, F. M. (1980). Applications of Item Response Theory to practical testing problems. Erlbaum.
- Rasch, G. (1960). Probabilistic models for some intelligence and attainment tests. Danish Institute for Educational Research.
Modelos de Teoría de Respuesta al Ítem utilizados en el instrumento
- Samejima, F. (1969). Estimation of latent ability using a response pattern of graded scores. Psychometrika Monograph Supplement, 17.
- Birnbaum, A. (1968). Some latent trait models and their use in inferring an examinee's ability. In Lord & Novick, Statistical theories of mental test scores. Addison-Wesley.
- Muraki, E. (1992). A generalized partial credit model: application of an EM algorithm. Applied Psychological Measurement, 16, 159–176.
- Reckase, M. D. (2009). Multidimensional Item Response Theory. Springer.
- Ackerman, T. A. (1994). Using multidimensional item response theory to understand what items and tests are measuring. Applied Measurement in Education, 7, 255–278.
Elección forzada y modelado thurstoniano
- Brown, A., & Maydeu-Olivares, A. (2011). Item response modeling of forced-choice questionnaires. Educational and Psychological Measurement, 71, 460–502.
- Brown, A. (2016). Item response models for forced-choice questionnaires: a common framework. Psychometrika, 81, 135–160.
- Maydeu-Olivares, A. (1999). Thurstonian modeling of ranking data via mean and covariance structure analysis. Psychometrika, 64, 325–340.
- Stark, S., Chernyshenko, O. S., & Drasgow, F. (2005). An IRT approach to constructing and scoring pairwise preference items involving stimuli on different dimensions: The Multi-Unidimensional Pairwise Preference model. Applied Psychological Measurement, 29, 184–203.
- Stark, S., Chernyshenko, O. S., & Drasgow, F. (2012). Adaptive testing with multidimensional pairwise preference items: improving the efficiency of personality and other noncognitive assessments. Organizational Research Methods, 15, 463–487.
Best-Worst Scaling
- Finn, A., & Louviere, J. J. (1992). Determining the appropriate response to evidence of public concern. Journal of Public Policy and Marketing, 11, 12–25.
- Marley, A. A. J., & Louviere, J. J. (2005). Some probabilistic models for best, worst, and best-worst choices. Journal of Mathematical Psychology, 49, 464–480.
- Louviere, J. J., Flynn, T. N., & Marley, A. A. J. (2015). Best-Worst Scaling: Theory, Methods and Applications. Cambridge University Press.
Metodología del formato de elección forzada y su motivación
- Hicks, L. E. (1970). Some properties of ipsative, normative, and forced-choice normative measures. Psychological Bulletin, 74, 167–184.
- Meade, A. W. (2004). Psychometric problems and issues involved with creating and using ipsative measures for selection. Journal of Occupational and Organizational Psychology, 77, 531–552.
- Jackson, D. N., Wroblewski, V. R., & Ashton, M. C. (2000). The impact of faking on employment tests: does forced choice offer a solution? Human Performance, 13, 371–388.
- Christiansen, N. D., Burns, G. N., & Montgomery, G. E. (2005). Reconsidering forced-choice item formats for applicant personality assessment. Human Performance, 18, 267–307.
Evaluación adaptativa
- Wainer, H., et al. (2000). Computerized Adaptive Testing: A Primer (2nd ed.). Erlbaum.
- van der Linden, W. J., & Glas, C. A. W. (2010). Elements of Adaptive Testing. Springer.
Construcción del banco de ítems y calidad de la escala
- Clark, L. A., & Watson, D. (1995). Constructing validity: basic issues in objective scale development. Psychological Assessment, 7, 309–319.
- DeVellis, R. F. (2017). Scale development: theory and applications (4th ed.). SAGE.
Estimación bayesiana
- Fox, J.-P. (2010). Bayesian Item Response Modeling: theory and applications. Springer.
- Gelman, A., et al. (2013). Bayesian Data Analysis (3rd ed.). CRC Press.
Marcos de personalidad sobre los que se apoya la estructura dimensional
- Goldberg, L. R. (1993). The structure of phenotypic personality traits. American Psychologist, 48, 26–34.
- McCrae, R. R., & Costa, P. T. (2008). The Five-Factor Theory of personality. In Handbook of Personality: Theory and Research (3rd ed.). Guilford.
- Ashton, M. C., & Lee, K. (2007). Empirical, theoretical, and practical advantages of the HEXACO model of personality structure. Personality and Social Psychology Review, 11, 150–166.