{"as_of":"2026-08-17T09:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:54c883d0df3c4c81f325dc84be632391d397317dbe2c00dab31f160ecec1bd02","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T23:59:16.490327Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-30T13:33:12.993729Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.15190","snapshot_observed_at":"2026-07-30T13:33:12.993729Z","title":"Jiang, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27023","last_updated":"2026-07-29T15:20:39Z","snapshot_observed_at":"2026-08-14T15:24:08.542139Z","submitted_at":"2026-07-29T15:20:39Z","title":"BayesAME: Bayesian Active Model Evaluation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-07-30T13:33:12.993729Z"},"links":{"cited_paper":"/paper/2607.15190","citing_paper":"/paper/2607.27023"},"observation_digest":"sha256:c766820f461e3d826a8422a359d698806b556f059a05a324529b9943dbe960b2","observation_id":"3fa28171-7feb-4c14-93e1-b558fe7e8999","resolution":{"observed_at":"2026-07-30T13:33:12.993729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.15190/citation-record","integrity":"/paper/2607.15190/integrity","json":"/paper/2607.15190/citation-record.json","paper":"/paper/2607.15190"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:09.526016Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:09.526016Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:4320c8f09b136caf73cc34fe21917fdba6a3fa63851c8b91215dcd1862b153c6","observation_id":"dbbb850c-a00a-40c3-896d-071dce283262","resolution":{"observed_at":"2026-08-01T23:59:09.526016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:09.669775Z","title":null,"venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:09.669775Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:bc3b61b0d57a8ff898a13c865b07c1144ec13b56b74cfb24616fe17976a70c23","observation_id":"87bb731e-c226-4e68-84e3-63eaa95956cc","resolution":{"observed_at":"2026-08-01T23:59:09.669775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:09.774288Z","title":null,"venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:09.774288Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:7880dd8370c155873864845ab5ea4163c9820297b61e53cd49b4726fc626463f","observation_id":"25278321-69bf-4880-8ca8-df8bbaa543fd","resolution":{"observed_at":"2026-08-01T23:59:09.774288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:09.948356Z","title":null,"venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:09.948356Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:29f13d0af3ed325c20591a509a95821477c89fb2f10b97c602e80c16329abb0c","observation_id":"4d3c4f2b-162c-4b46-a29b-28b807fa32fb","resolution":{"observed_at":"2026-08-01T23:59:09.948356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:10.129106Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:10.129106Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:28802f073aad1f383d4e2a357a1c9d4fafb8b1c36c0e540ba3c33e78a4ef6791","observation_id":"6afb321a-be8e-4aae-ac8b-90bebfae01fe","resolution":{"observed_at":"2026-08-01T23:59:10.129106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:10.260392Z","title":"Byrd and S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:10.260392Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:233f529c6c4f6045ef04cbf339060bced36d61c20149cf9528250a4874f6e429","observation_id":"70822170-ff15-4825-b1eb-c38a254ca5cc","resolution":{"observed_at":"2026-08-01T23:59:10.260392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:10.449138Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:10.449138Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:a6eeb26548f1436eac5a6541f3a23e485e0532eb11f45319d322eddc7783ca4f","observation_id":"6f4c041e-064b-4d3c-ba79-1df81482effc","resolution":{"observed_at":"2026-08-01T23:59:10.449138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:10.607911Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:10.607911Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:5ddb5fb308baaf7c546bf34864033fe632a72d4f0d385afaaaba4cc9cacd6690","observation_id":"1fe6524b-98a5-4583-b8c8-e296f3e7994b","resolution":{"observed_at":"2026-08-01T23:59:10.607911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:10.748106Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:10.748106Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:d797c0c3468002e56b980d2df0bf6aa6829fd6a90de00eff0647283700c44290","observation_id":"cae0a6f2-b710-4813-bd89-f430ae61cd53","resolution":{"observed_at":"2026-08-01T23:59:10.748106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:10.852182Z","title":"Clark, I","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:10.852182Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:000e9cdd577cd2532f04c3a08e7c613b618458be980e45a18fe8e548ce68a553","observation_id":"e30a50f8-8041-4977-b5a4-599a653d50e0","resolution":{"observed_at":"2026-08-01T23:59:10.852182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:10.924783Z","title":"Cobbe, V","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:10.924783Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:bd3cd06cd4d81edbb069bf7b1bc5c49fec43df7214005f6c132286a1035e2eb6","observation_id":"bd655c86-f257-4585-9e98-7acd6ad40dab","resolution":{"observed_at":"2026-08-01T23:59:10.924783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:10.977778Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:10.977778Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:31ff91ff6ba2903a9675a5b02001a750f950505f29858d71b509603d41298a29","observation_id":"6dd3ae78-9933-4128-a21e-47ea5232bf4c","resolution":{"observed_at":"2026-08-01T23:59:10.977778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:11.047901Z","title":"DeMars.Item Response Theory","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:11.047901Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:88de4e0cc918b5c999a194df6fb1753e66712afaf9272a72a63abc2ac13bed11","observation_id":"c19c41e2-c689-443e-937f-01c4dd4dcd8a","resolution":{"observed_at":"2026-08-01T23:59:11.047901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:11.128059Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:11.128059Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:bb17fb6f81e18c92540eb441be3a17ca30388be03258c6d3033bc032ce533b91","observation_id":"c4d891b3-0431-4aa8-818a-ed8512fb993c","resolution":{"observed_at":"2026-08-01T23:59:11.128059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:11.201346Z","title":"Ethayarajh and D","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:11.201346Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:f58a91e9ca28f30d6affff849eeeb2d2b8f5d9f4eac6dfe1da7bc16d641d09be","observation_id":"3a4ab94d-136c-4612-9398-2ae92853170a","resolution":{"observed_at":"2026-08-01T23:59:11.201346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:11.355316Z","title":"Frick, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:11.355316Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:c59ee8f42112c6549eacd4d7b8cae3a808ecf42d4b342fd728a2848d994c0e22","observation_id":"d4d1df09-baef-4f15-863e-57393e0c0494","resolution":{"observed_at":"2026-08-01T23:59:11.355316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:11.487659Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:11.487659Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:1f935c5c77429ee7393a07cdb3d425b55b6cfe699ce9d1c8690061cbb6aef39b","observation_id":"fbbd2e68-fcf5-4e23-8788-8da8372956de","resolution":{"observed_at":"2026-08-01T23:59:11.487659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:11.588751Z","title":"Gulliksen.Theory of Mental Tests","venue":null,"work_id":null,"year":1950},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:11.588751Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:eccf305d8dfefdb3407d1baa0f825a16b432009c23c4908a96a6b479df709758","observation_id":"0a55c954-115d-43d6-a8c8-38b6b1695403","resolution":{"observed_at":"2026-08-01T23:59:11.588751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:11.716947Z","title":null,"venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:11.716947Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:0415d4ecec209361ca6ecf4594aac109371ae1f6b11f0144e367ba42062a9696","observation_id":"f17eb65f-7908-4805-9f04-56c54f8a46ee","resolution":{"observed_at":"2026-08-01T23:59:11.716947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:11.846619Z","title":null,"venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:11.846619Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:b5c154f7a4365d026e36136c986737a037259ccc2490b0ac09a6a44f422d9012","observation_id":"9f753dd6-7d7e-4ee4-b982-10e8c0f73deb","resolution":{"observed_at":"2026-08-01T23:59:11.846619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:11.975551Z","title":"Heineman, V","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:11.975551Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:e03417a438eaec0bae832509f45450d6cc24895313220657de31881b3eeaea61","observation_id":"b832a787-dcdd-47db-982e-a0e757453507","resolution":{"observed_at":"2026-08-01T23:59:11.975551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:12.150188Z","title":"Hendrycks, C","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:12.150188Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:08120901a4935ee1432edbc4fbf9c2e4cb33f334a8c7a350133fd521499d8409","observation_id":"1b09f344-f4bb-49c8-8c3e-a19ce62f355a","resolution":{"observed_at":"2026-08-01T23:59:12.150188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:12.236990Z","title":"Hofmann, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:12.236990Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:38f1ef7f76a6c816a7f6e45e5b4e7b83b596b3feb0130d109cd4bb1eac867e36","observation_id":"8eb7680f-8b7d-4bc0-9a93-940fb646ee88","resolution":{"observed_at":"2026-08-01T23:59:12.236990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:12.348077Z","title":"Jiang, X","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:12.348077Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:5fa7d794ef588b30a5df5822fa12ae1d326ff8e6f288e33964234fd7751a0d5f","observation_id":"9b0fd324-8c24-4211-9e34-4578bce12409","resolution":{"observed_at":"2026-08-01T23:59:12.348077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:12.444030Z","title":"Jiang, S","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:12.444030Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:875eca988968d4b19b297378ade7a48717e94fef2c3a529e74601a157b322d6d","observation_id":"2b26e0f2-b28e-4448-b904-2a615c73e2c7","resolution":{"observed_at":"2026-08-01T23:59:12.444030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:12.542522Z","title":"Jiang, C","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:12.542522Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:5f205cb3438cbf3181758eea7af898dd0ff9b929684300273ee13d9835e2cd6d","observation_id":"f90840ba-5244-47a6-b791-3afcba95cbab","resolution":{"observed_at":"2026-08-01T23:59:12.542522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:12.654345Z","title":null,"venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:12.654345Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:41297b24fd242df33428d2ac1ba8ac1b4366b8fe2e5fb7b6eedaff22734fa092","observation_id":"e8a35acd-2968-4e61-8895-7a76070442e6","resolution":{"observed_at":"2026-08-01T23:59:12.654345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:12.718387Z","title":"Kipnis, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:12.718387Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:4200a3846c31739e13a1606c6ff824b367b4ab4c504e571bd98476585d4993fd","observation_id":"f108595b-ceba-4d5e-a865-9e0fdf2f21cb","resolution":{"observed_at":"2026-08-01T23:59:12.718387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:12.824121Z","title":"Kirisci, T.-c","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:12.824121Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:a479a42dd6c0cf6f945eeca46acf4f7c3f6e61cf5464cb9538a9f28eb085a58f","observation_id":"e1e45721-6d5f-4568-bb43-ec9c3cc69304","resolution":{"observed_at":"2026-08-01T23:59:12.824121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:12.993097Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:12.993097Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:3e4780c7ad76a1269f7c79550e7842004cb4440f0c1cae123b7b7fc20c58c53a","observation_id":"e906389f-0d41-421e-913c-abe4fab3b783","resolution":{"observed_at":"2026-08-01T23:59:12.993097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:13.144006Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:13.144006Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:441aec8f166f0200136075e5a2814f8e2fc219eaa6ae96cc0b9bc7510b116022","observation_id":"59dfef96-fa4f-40bc-94dc-35a2fd426dd9","resolution":{"observed_at":"2026-08-01T23:59:13.144006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:13.263855Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:13.263855Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:4fca8cf39daee3f818e50544b298dae6fad8951df67746d78a8a7afef99bc11c","observation_id":"75885e03-7814-4a12-a438-5075e4345119","resolution":{"observed_at":"2026-08-01T23:59:13.263855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:13.418412Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:13.418412Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:2a86b05aa6c1ea29bff69b830dbeca00c6b5f76daf67ea91b6cf8b775168b213","observation_id":"9379cccd-3548-4ef9-8eaf-a8f6c26db8d8","resolution":{"observed_at":"2026-08-01T23:59:13.418412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:13.564506Z","title":"Liang, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:13.564506Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:27b31d02b611b23a9b9c8bad99e739251d3f5e251069db09f3fdfab7e591cf22","observation_id":"c1d3e9b5-bc44-400b-a5ae-0c93807647a5","resolution":{"observed_at":"2026-08-01T23:59:13.564506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:13.627066Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:13.627066Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:1b5296173548624538ae669644dc4fd48e19d5b4cfed498e04ca687814b51f37","observation_id":"f1a1f52b-dcab-4f04-b2a0-e770ec557bc9","resolution":{"observed_at":"2026-08-01T23:59:13.627066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:13.721418Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:13.721418Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:d878409fd7af684972d4690800d98863a59bdf630e0b95ae6a994c1df26246b6","observation_id":"75a01c42-6d76-4968-9910-fe622af65433","resolution":{"observed_at":"2026-08-01T23:59:13.721418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:13.841194Z","title":null,"venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:13.841194Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:bc49111756d3854272acd9edef2f161289fabb4d910830ce23f323cfaae32ba5","observation_id":"fc909a58-e26a-4876-bd6c-e4b25bba1e77","resolution":{"observed_at":"2026-08-01T23:59:13.841194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:13.950008Z","title":null,"venue":null,"work_id":null,"year":1968},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:13.950008Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:61b4a20b225f7509b722034882978f7c35db2c2a96d397816c084a9bde156391","observation_id":"df785ace-9084-4966-b77d-f6f537173635","resolution":{"observed_at":"2026-08-01T23:59:13.950008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:14.063203Z","title":null,"venue":null,"work_id":null,"year":1966},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:14.063203Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:a8c0517d539f9f6abc6ef56cce2416e30f6f024e3c7cf2e5b2c2094a0ef1d29c","observation_id":"4129592d-cf56-4b42-89a1-dd4a9ec98f89","resolution":{"observed_at":"2026-08-01T23:59:14.063203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:14.210058Z","title":"Martínez-Plumed, R","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:14.210058Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:1d9c4cadd7933e570d4d6260e7ef32b1eed8d2328f25f2f7a47d9eca5884d101","observation_id":"11de7e64-a428-436e-ae2d-a76eb5c8e62f","resolution":{"observed_at":"2026-08-01T23:59:14.210058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:14.318450Z","title":null,"venue":null,"work_id":null,"year":2074},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:14.318450Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:bc8b2770972baf48cb532464f4d776f0ae2a4448b490db6f192634ad90d544f0","observation_id":"e788279f-cbf6-4e8d-99d6-a88be88d58c8","resolution":{"observed_at":"2026-08-01T23:59:14.318450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:14.396465Z","title":"Myrzakhan, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:14.396465Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:b917f139188a36400b4ec50db9673aaed3cd6e3e511ec612c7923dad7b51045c","observation_id":"fec639e9-a12e-4482-b2e7-12a841ef6ac2","resolution":{"observed_at":"2026-08-01T23:59:14.396465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:14.474752Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:14.474752Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:52ca00d48d6111829c8b3706062c802a1e25d45cbf309ed99af05bec1fe6a6d0","observation_id":"89a63545-1423-4e18-a4da-b115a4dc750c","resolution":{"observed_at":"2026-08-01T23:59:14.474752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:14.558257Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:14.558257Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:9ed7b2ca42d68dd2f7ab30c7a0b0521ab105c616fcca5d30a0759a262a8cc288","observation_id":"5eff423b-3121-463f-bc5e-519f8e7cf8e8","resolution":{"observed_at":"2026-08-01T23:59:14.558257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:14.690801Z","title":"Rasch.Probabilistic Models for Some Intelligence and Attainment Tests","venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:14.690801Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:52c9a9af2af29742969887b37da8b5602a913e5c66637323a73c965d4b711247","observation_id":"da4476c6-180f-4123-aa55-e01d92dfe2a8","resolution":{"observed_at":"2026-08-01T23:59:14.690801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:14.812983Z","title":"Robertson","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:14.812983Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:dca79f55a1991ee8b91eeeae5c6e1e29a582ff909b284d654f6311fa00207f19","observation_id":"dab0e818-73da-4441-9fef-0102d2703c3a","resolution":{"observed_at":"2026-08-01T23:59:14.812983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:14.942477Z","title":"Rodriguez, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:14.942477Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:42ccbc95e49f3186d4cda5e542f9917eb4e8c4396aea45e2ad06fc5439ea0b52","observation_id":"dfffd6fe-d9b8-453e-9c3e-aa64be5386d4","resolution":{"observed_at":"2026-08-01T23:59:14.942477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:15.028344Z","title":"Sakaguchi, R","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:15.028344Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:3bc2806df6473ceee33c3e9bd48b6bf4ae02f93c1f9913c5ee59cc40b749578b","observation_id":"d677a513-ce12-4bdc-a89b-17a95b1c32f3","resolution":{"observed_at":"2026-08-01T23:59:15.028344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:15.143694Z","title":"Samejima","venue":null,"work_id":null,"year":1969},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:15.143694Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:e48dfe51bca9d192a42997faeaa0afa266218aa07c344e8083386f8b7fb65742","observation_id":"1cca5452-169b-4222-9820-787cec3e4946","resolution":{"observed_at":"2026-08-01T23:59:15.143694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:15.280350Z","title":"Schilling-Wilhelmi, N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:15.280350Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:ca946deb87912c6536129e5767f65ec0d573524f0ebacd13f3ae5d62a6ebb096","observation_id":"2669da09-d67d-4c9e-b619-00eaca4f7c06","resolution":{"observed_at":"2026-08-01T23:59:15.280350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:15.399319Z","title":"Schroeders and T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:15.399319Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:aa49d09c3ca2ea76e9f7f43b9547468665a875b7c37ed79069eeba4d9aaf637a","observation_id":"57b931d8-760c-47ab-9ecf-c7276d0982e6","resolution":{"observed_at":"2026-08-01T23:59:15.399319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:15.449661Z","title":"Sen and A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:15.449661Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:4a5afb26762741719d27838ab090c07b69b1a3486dfd8a9a86702d25e3801a90","observation_id":"be3fa3e0-1a95-4447-b3f1-785bdbf70606","resolution":{"observed_at":"2026-08-01T23:59:15.449661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:15.551475Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:15.551475Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:3519f4e2534fcc53f8f63dc7582e976ca7041561e04d47dca14105b8578f306b","observation_id":"5b51b18a-081a-4aee-bef6-6f286d1d671e","resolution":{"observed_at":"2026-08-01T23:59:15.551475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:15.647659Z","title":"Siska, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:15.647659Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:6cb0f6fe4e27bbb28d6cc25a522f1b23d2bc178c888033ed15725039f27d3be6","observation_id":"a89616f0-f374-44cc-9c02-8aaa8197f792","resolution":{"observed_at":"2026-08-01T23:59:15.647659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:15.700977Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:15.700977Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:0180c07fddf5fd02a41d7e3bda25aa1760bb6c186093fc11066d30d069d3a90f","observation_id":"08d1b82e-98be-481e-94dc-5c279cf6955a","resolution":{"observed_at":"2026-08-01T23:59:15.700977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:15.777547Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:15.777547Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:5c2b24be424d82dcbc2c935fb4a16370114392c9cbb774b4d01d31d921982504","observation_id":"3fed20e3-a476-4bdb-9600-cc64e8fde61d","resolution":{"observed_at":"2026-08-01T23:59:15.777547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:15.878649Z","title":"Vania, P","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:15.878649Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:1a128ceb1764944a07b8b89f49896b7914ab23e5050b82540af4d4a91927b753","observation_id":"2c571575-7e08-491b-b2cd-9c2291d0fdbe","resolution":{"observed_at":"2026-08-01T23:59:15.878649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:15.932756Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:15.932756Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:c0844b4be836b63256c94d06ec0e6fbd9357d93942913acad66f481878062c70","observation_id":"82b58604-0aca-4b0a-9c26-110b51bb85a6","resolution":{"observed_at":"2026-08-01T23:59:15.932756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:16.005620Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:16.005620Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:4e363359a3e4f7868d404c0586587f2932ca0a0e72138ec74c88034cd7a73600","observation_id":"a9d7bd0d-2668-4c41-ab3a-be035c3336f6","resolution":{"observed_at":"2026-08-01T23:59:16.005620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:16.105773Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:16.105773Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:59c91a2d82feaa869207825ee053992e0a4e9f0df5624d11da4a2015696ad0ae","observation_id":"bfee84f8-5e9c-47d0-8b22-f273ba885e90","resolution":{"observed_at":"2026-08-01T23:59:16.105773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:16.200198Z","title":"Zellers, A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:16.200198Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:86de29bd88ab75fd0bcf47d3d51be0a1a6f1c532714901821ca0cada57a8fbbd","observation_id":"1add4029-ecd7-4728-8d91-f57cf9ca06b4","resolution":{"observed_at":"2026-08-01T23:59:16.200198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:16.301203Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:16.301203Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:be6ea823bd14cda5e3b49de8a69a9f235aeb99dec6c8416693165bd90cf1567a","observation_id":"bd40c166-6e85-4dbf-abb8-a49fb5036c55","resolution":{"observed_at":"2026-08-01T23:59:16.301203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:16.381743Z","title":"we were unable to find the license for the dataset we used","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:16.381743Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:2d1d6cb120f457471455d1a86d4b54e3fa3d1f7cd3020e38f76993120eea9b27","observation_id":"b3367472-c0ef-4f8b-92db-21ca93c83ef3","resolution":{"observed_at":"2026-08-01T23:59:16.381743Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:16.490327Z","title":"Guidelines: • The answer [N/A] means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:16.490327Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:76eb55d87deb593b0d2685143a5efc91ff7c9c0dd34d5ba3e8aebc42f8e9637e","observation_id":"ec15b456-00e8-45f0-9c32-740a6e50d0f1","resolution":{"observed_at":"2026-08-01T23:59:16.490327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:59:11.260018Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-01T23:59:11.260018Z"},"links":{"citing_paper":"/paper/2607.15190"},"observation_digest":"sha256:7394257266702dec68ea66892f3954e10a5789392edb3975acecb26d54e46b7d","observation_id":"8f3ef3d3-22b9-46ca-a91b-df14862c9fdb","resolution":{"observed_at":"2026-08-01T23:59:11.260018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.15190","last_updated":"2026-07-17T07:01:44Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T05:04:01.569439Z","submitted_at":"2026-07-16T16:44:40Z","title":"Can We Trust Item Response Theory for AI Evaluation?"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":64,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 1 inbound Pith citation observation for arXiv:2607.15190."}