{"as_of":"2026-08-09T04:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:415749e3be8b3a3893e5c602ead78157ae9a9d8c3bd216d4f267db5e829d3148","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T08:12:51.081669Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.22170/citation-record","integrity":"/paper/2510.22170/integrity","json":"/paper/2510.22170/citation-record.json","paper":"/paper/2510.22170"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:12:48.299902Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:48.299902Z"},"links":{"citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:a4d12db55808cc4161d0789dae9363abf315a60c1b54ad528bec4d262f8cb8e7","observation_id":"d4250f58-b24a-4755-b548-7e727093b870","resolution":{"observed_at":"2026-08-04T08:12:48.299902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:12:48.442591Z","title":"The chosen profile in- cludes: • Sections derived from an intake inter- view","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:48.442591Z"},"links":{"citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:c9cffbb316af963e033a78a48facdc52867e309115bca3209792305c6435ce90","observation_id":"059c62ee-bbb1-48d3-8fc2-12a7cd88cd64","resolution":{"observed_at":"2026-08-04T08:12:48.442591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-04T08:12:47.399871Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:47.399871Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:c2757a89e9b32d3ed4a903546b4b46f81a8b331e0cfcd823c087316b89f68cb0","observation_id":"46086fd5-7323-4629-8957-255abeb62912","resolution":{"observed_at":"2026-08-04T08:12:47.399871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:12:48.676584Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:48.676584Z"},"links":{"citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:7e59036819af87e4b91e09a35ee60c8722e80772a2fc9d5af8f5a1606cc54035","observation_id":"7a00c4e2-5790-4f6b-984e-09aacc956bd5","resolution":{"observed_at":"2026-08-04T08:12:48.676584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:12:47.573510Z","title":"Louis Kwok, Michal Bravansky, and Lewis D Griffin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:47.573510Z"},"links":{"citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:bfca257324489b7e8a597fa501d0c3d0e6d2018d815f8df7d40e267109e6b678","observation_id":"5496eb0c-d72a-45cf-a55c-4ad9a90df8f2","resolution":{"observed_at":"2026-08-04T08:12:47.573510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06929","last_updated":"2024-08-13T14:32:43Z","snapshot_observed_at":"2026-07-06T19:00:13.547242Z","submitted_at":"2024-08-13T14:32:43Z","title":"Evaluating Cultural Adaptability of a Large Language Model via Simulation of Synthetic Personas","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06929","snapshot_observed_at":"2026-08-04T08:12:47.651092Z","title":"arXiv preprint arXiv:2408.06929","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:47.651092Z"},"links":{"cited_paper":"/paper/2408.06929","citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:faac362fcf3aecfb2b92455ae2f5e4f47f17d8e43b51b37c2e1e1ebe9771297a","observation_id":"0849d6fb-6524-4655-ba8a-a04564affaf1","resolution":{"observed_at":"2026-08-04T08:12:47.651092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:12:47.752962Z","title":"arXiv preprint arXiv:2412.12144","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:47.752962Z"},"links":{"citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:0d272e583944b2b3cd2b2e46d444f3491989155072821e424e91675a93e6cea0","observation_id":"25624926-3d67-4fae-9b09-a188ec5a99d7","resolution":{"observed_at":"2026-08-04T08:12:47.752962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:12:48.566672Z","title":"The report should be based on the indi- vidual described in the attached mem- oir","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:48.566672Z"},"links":{"citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:2b938d35400a6814f5ff912ba442444106120dae4961a744cc4381114ce18235","observation_id":"99ae126a-8fd5-4eec-b1eb-679d1431f9f2","resolution":{"observed_at":"2026-08-04T08:12:48.566672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:12:48.828638Z","title":"Behav- ioral Observations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:48.828638Z"},"links":{"citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:da96b2763fda2c58bb6755562910654ba0ca889fcc04548e4a68541995a60c76","observation_id":"d7927fc9-44aa-45a8-b029-f02dd971873c","resolution":{"observed_at":"2026-08-04T08:12:48.828638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:12:49.153385Z","title":"The Avoider","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:49.153385Z"},"links":{"citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:9edbc17a788cc853bcae3507b45e2f2e191d7b5766a6628a816e2dd46bb40b99","observation_id":"fcc26858-fce0-4800-8da3-2c2471566ab6","resolution":{"observed_at":"2026-08-04T08:12:49.153385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:12:49.307589Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:49.307589Z"},"links":{"citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:af47419c9ddf35b820030ea2cda3735ef216806d99a8848f7f1b9190879f20fe","observation_id":"8e233671-d93f-4418-b9b4-64117ae4c39a","resolution":{"observed_at":"2026-08-04T08:12:49.307589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:12:49.503746Z","title":"Agreeable- ness)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:49.503746Z"},"links":{"citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:9881ef92ec32ca426a13fd7b3a28cb5b59a7b5ab4205122fb527b7c51a8bf277","observation_id":"eaf6e63b-7db1-4ca6-8677-15912d995802","resolution":{"observed_at":"2026-08-04T08:12:49.503746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:12:49.721747Z","title":"Ensure each rewrite minimizes overlap with other traits and includes specific, actionable decisions rather than vague choices","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:49.721747Z"},"links":{"citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:dd1b0dc32712b7daa72eec389ce3d45de5a982fd557b9297f543f3239b2e19e8","observation_id":"946bdc58-5f47-4947-b242-0503cb8e645c","resolution":{"observed_at":"2026-08-04T08:12:49.721747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:12:49.886944Z","title":"scenario_summary","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:49.886944Z"},"links":{"citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:dcd866e6422288a16d7644a70678cd9a6def88839f397df59ea45234fbb4dfef","observation_id":"ea724e88-ce81-4be2-89cb-10f927949e77","resolution":{"observed_at":"2026-08-04T08:12:49.886944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:12:50.111016Z","title":"Write it as a concrete, sensory, scene-level story (180–250 words)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:50.111016Z"},"links":{"citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:8fff08bd4eed7a00a23c4e86bf8ac9a4a4ed9b1e239bb9c79f73607cfcc292b0","observation_id":"047c94d6-b683-4e5c-8b54-33860d0d08bc","resolution":{"observed_at":"2026-08-04T08:12:50.111016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:12:50.150279Z","title":"Do NOT quote or paraphrase it; never list ‘Core trait/Focus/Strength- s/Challenges’","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:50.150279Z"},"links":{"citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:9989d4b90ef99e61c7ce186a6b7dbb829d7fd3655d4edd75afb54a2672958b5e","observation_id":"681a6432-a417-441f-865e-5b27751b407b","resolution":{"observed_at":"2026-08-04T08:12:50.150279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:12:50.244100Z","title":"Rephrase and localize details to the scene","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:50.244100Z"},"links":{"citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:bc58ed9d903ae1be983e5e0f47b6f3c80ffdb83eda3428b92b032f316accfc74","observation_id":"41d87e80-6fb2-47f2-aa01-55bfaf17ad24","resolution":{"observed_at":"2026-08-04T08:12:50.244100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:12:50.347637Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:50.347637Z"},"links":{"citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:0d834b008abe266c0cfa339a4ebf0a4e988de34e59fbc066b0545b6c6abab906","observation_id":"a3db08a7-a8ca-4292-a19c-5782f6ff3d4d","resolution":{"observed_at":"2026-08-04T08:12:50.347637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:12:50.489054Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:50.489054Z"},"links":{"citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:b2d4339c7aa7f3ba85a1c470f1aed5a6001d4e83832b4c0b75b52dabc421b51d","observation_id":"33c6b183-0be3-4667-a598-d98d6ea8ac0a","resolution":{"observed_at":"2026-08-04T08:12:50.489054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:12:50.595869Z","title":"Prefer specific, scene-derived wording","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:50.595869Z"},"links":{"citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:de310d8e7d596a1e22cb7f19b3bb23748ba712ecc69bd3fad2a63321e5b1dd3a","observation_id":"7c370bd3-8804-472e-8561-968dd6f13853","resolution":{"observed_at":"2026-08-04T08:12:50.595869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:12:50.666874Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:50.666874Z"},"links":{"citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:189697a4888d3bd545dcb6bf3e89634f7526ea88d80ab42dfdf07f10f75f0d20","observation_id":"d9bec102-2717-4e14-95ed-6c79c5d32c27","resolution":{"observed_at":"2026-08-04T08:12:50.666874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:12:50.749999Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:50.749999Z"},"links":{"citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:e060fab7a226fd616e478df71c433b966bfb662f93cb6b960a8141a0567f7bb5","observation_id":"cb1aadfa-880c-4324-9698-23dfd166b7f3","resolution":{"observed_at":"2026-08-04T08:12:50.749999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:12:50.834074Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:50.834074Z"},"links":{"citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:72736744b13f93df4f56e9e340b8766a3750d278d43607c75c1fae823648699f","observation_id":"5aa8e90c-8507-4b4c-8081-894dfe50b960","resolution":{"observed_at":"2026-08-04T08:12:50.834074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:12:50.990912Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:50.990912Z"},"links":{"citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:169588d57fbfe2b36cf6a197245d68c037128f60acfdadc8b411a2ab15a3d579","observation_id":"91c360c6-2542-4ba2-90bf-87e7a862e371","resolution":{"observed_at":"2026-08-04T08:12:50.990912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:12:51.081669Z","title":"Future work could include indepen- dent raters and inter-rater reliability assessments to enhance robustness and minimize potential bias","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:51.081669Z"},"links":{"citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:79257ed0742fe6541ec657fb9977449ad4372e5977182e8e7157355d217b2bee","observation_id":"8bddb3f0-0275-41ae-aae3-f3249067b7cb","resolution":{"observed_at":"2026-08-04T08:12:51.081669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:12:47.272047Z","title":"Jacob Cohen","venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":2001,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:47.272047Z"},"links":{"citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:a7895f904a2042c2706fb7ddb8a949fc9d40abadca5dfe168fdccc5d028c5586","observation_id":"78b9a35e-ebcb-46c4-abdc-da810a93b0e4","resolution":{"observed_at":"2026-08-04T08:12:47.272047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09702","last_updated":"2023-08-19T21:27:51Z","snapshot_observed_at":"2026-07-06T15:55:41.294452Z","submitted_at":"2023-07-19T01:14:49Z","title":"Efficient Guided Generation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09702","snapshot_observed_at":"2026-08-04T08:12:48.178479Z","title":"Brandon T Willard and Rémi Louf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:48.178479Z"},"links":{"cited_paper":"/paper/2307.09702","citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:b35a4eec4d5f22b5197387ae497966131ac17714b2e7cd3f5b037a3c05db3e03","observation_id":"cd20594e-37f0-4c63-88f1-cb5d83963471","resolution":{"observed_at":"2026-08-04T08:12:48.178479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10811","last_updated":"2024-06-17T11:06:57Z","snapshot_observed_at":"2026-07-06T17:31:17.058043Z","submitted_at":"2024-02-16T16:35:35Z","title":"Quantifying the Persona Effect in LLM Simulations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10811","snapshot_observed_at":"2026-08-04T08:12:47.494670Z","title":"Tiancheng Hu and Nigel Collier","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:47.494670Z"},"links":{"cited_paper":"/paper/2402.10811","citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:5e647d7c6cc75533798293939d3bfa6a3718a585acc00a124ba9b1324bd422c8","observation_id":"936e29f9-351c-4609-858e-6f55abe1810f","resolution":{"observed_at":"2026-08-04T08:12:47.494670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:12:48.987263Z","title":"Specifically, we used PGMs created from US Census data and the names data of Rosenman et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:48.987263Z"},"links":{"citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:5e45b17e043290f3301b45d909def2e20484c02a2ce62edf630cdf339b613823","observation_id":"1478f678-030e-4605-9379-270738dc6dd5","resolution":{"observed_at":"2026-08-04T08:12:48.987263Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14202","last_updated":"2023-12-21T04:57:21Z","snapshot_observed_at":"2026-07-06T17:06:45.522731Z","submitted_at":"2023-12-21T04:57:21Z","title":"Illuminating the Black Box: A Psychometric Investigation into the Multifaceted Nature of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14202","snapshot_observed_at":"2026-08-04T08:12:48.012642Z","title":"Bolei Ma, Berk Yoztyurk, Anna-Carolina Haensch, Xin- peng Wang, Markus Herklotz, Frauke Kreuter, Bar- bara Plank, and Matthias Assenmacher","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:48.012642Z"},"links":{"cited_paper":"/paper/2312.14202","citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:386b40eb6f5bbfc14ff0463d7fb6761fb7663f5a9fd22e7972d6227a49603ca4","observation_id":"0a3568d8-9c11-4484-bb69-c521ce55fc7a","resolution":{"observed_at":"2026-08-04T08:12:48.012642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:12:47.164062Z","title":"Michael A McDaniel Cabrera and Nhung T Nguyen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:47.164062Z"},"links":{"citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:523e09dba41d793b8a33f288b34937d713415c710c4e00a3641b08fb507241b7","observation_id":"d5a9d736-ea70-4073-9350-c49cbdd88c7a","resolution":{"observed_at":"2026-08-04T08:12:47.164062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:12:47.857736Z","title":"Yang Lu, Jordan Yu, and Shou-Hsuan Stephen Huang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:47.857736Z"},"links":{"citing_paper":"/paper/2510.22170"},"observation_digest":"sha256:34f5ee32d79c2ab9d9d27b3ab94f383631151b4542ad503f644e6bea346c2b8d","observation_id":"7b88bde1-3fed-482d-bdf2-278d6bfee478","resolution":{"observed_at":"2026-08-04T08:12:47.857736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.22170","last_updated":"2026-07-29T03:51:46Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T10:50:52.989551Z","submitted_at":"2025-10-25T05:45:10Z","title":"Measure what Matters: Psychometric Evaluation of AI with Situational Judgment Tests"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2510.22170."}