{"as_of":"2026-08-12T09:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bc2860b9195d03e0c2c8e83616aa684cd28c5307907a45bacf999a21f0fe915e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T20:32:51.345036Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":3,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.10573","last_updated":"2025-06-26T16:38:11Z","snapshot_observed_at":"2026-08-07T15:45:37.216640Z","submitted_at":"2025-05-13T20:36:22Z","title":"Measurement to Meaning: A Validity-Centered Framework for AI Evaluation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10573","snapshot_observed_at":"2026-08-04T20:32:51.345036Z","title":"Measurement to meaning: A validity-centered framework for ai evaluation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08593","last_updated":"2025-09-10T13:46:40Z","snapshot_observed_at":"2026-08-11T16:47:50.160636Z","submitted_at":"2025-09-10T13:46:40Z","title":"No-Knowledge Alarms for Misaligned LLMs-as-Judges","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T20:32:51.345036Z"},"links":{"cited_paper":"/paper/2505.10573","citing_paper":"/paper/2509.08593"},"observation_digest":"sha256:f990d243df58e95f243f19277a37fd7e00b40d7f2ab242b794f569689d26a695","observation_id":"daec776e-2a51-4fdc-8afc-a0a952caa826","resolution":{"observed_at":"2026-08-04T20:32:51.345036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10573","last_updated":"2025-06-26T16:38:11Z","snapshot_observed_at":"2026-08-07T15:45:37.216640Z","submitted_at":"2025-05-13T20:36:22Z","title":"Measurement to Meaning: A Validity-Centered Framework for AI Evaluation","version":4},"cited_work":{"arxiv_id":"2505.10573","doi":"10.48550/arxiv.2505.10573","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10573","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measurement to Meaning: A Validity-Centered Framework for AI Evaluation","venue":"ArXiv.org","work_id":"76e38f6b-e125-4627-9738-a6eb7d02af4f","year":2025},"citing_paper":{"arxiv_id":"2509.14528","last_updated":"2026-05-03T23:02:14Z","snapshot_observed_at":"2026-08-11T05:03:37.907362Z","submitted_at":"2025-09-18T01:51:29Z","title":"Why Johnny Can't Use Agents: Industry Aspirations vs. User Realities with AI Agents","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-18T16:55:47.922639Z"},"links":{"cited_paper":"/paper/2505.10573","citing_paper":"/paper/2509.14528"},"observation_digest":"sha256:960dfd2acda3c31a0c8e9a70590de4a537d0ecfad22d04ff29557b5b940b7ca4","observation_id":"08ef653f-f02e-4ba4-8052-2fa179d6da71","resolution":{"observed_at":"2026-05-18T16:56:38.077538Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10573","last_updated":"2025-06-26T16:38:11Z","snapshot_observed_at":"2026-08-07T15:45:37.216640Z","submitted_at":"2025-05-13T20:36:22Z","title":"Measurement to Meaning: A Validity-Centered Framework for AI Evaluation","version":4},"cited_work":{"arxiv_id":"2505.10573","doi":"10.48550/arxiv.2505.10573","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10573","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measurement to Meaning: A Validity-Centered Framework for AI Evaluation","venue":"ArXiv.org","work_id":"76e38f6b-e125-4627-9738-a6eb7d02af4f","year":2025},"citing_paper":{"arxiv_id":"2602.17753","last_updated":"2026-05-06T13:43:46Z","snapshot_observed_at":"2026-08-06T12:13:42.632788Z","submitted_at":"2026-02-19T18:57:43Z","title":"The 2025 AI Agent Index: Documenting Technical and Safety Features of Deployed Agentic AI Systems","version":2},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-05-15T20:41:49.137745Z"},"links":{"cited_paper":"/paper/2505.10573","citing_paper":"/paper/2602.17753"},"observation_digest":"sha256:f6e9fc594f114cbd608c49670d05dac49a5c3c5e169c175d1268bc094eceef5e","observation_id":"5f164392-0269-4c83-904b-7292b3b99a71","resolution":{"observed_at":"2026-05-15T20:46:35.604261Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10573","last_updated":"2025-06-26T16:38:11Z","snapshot_observed_at":"2026-08-07T15:45:37.216640Z","submitted_at":"2025-05-13T20:36:22Z","title":"Measurement to Meaning: A Validity-Centered Framework for AI Evaluation","version":4},"cited_work":{"arxiv_id":"2505.10573","doi":"10.48550/arxiv.2505.10573","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10573","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measurement to Meaning: A Validity-Centered Framework for AI Evaluation","venue":"ArXiv.org","work_id":"76e38f6b-e125-4627-9738-a6eb7d02af4f","year":2025},"citing_paper":{"arxiv_id":"2603.06811","last_updated":"2026-05-08T14:52:11Z","snapshot_observed_at":"2026-08-05T19:05:35.953649Z","submitted_at":"2026-03-06T19:17:50Z","title":"Making AI Evaluation Deployment Relevant Through Context Specification","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T14:46:09.944168Z"},"links":{"cited_paper":"/paper/2505.10573","citing_paper":"/paper/2603.06811"},"observation_digest":"sha256:f7394467c30e8fcb404d66eb8f74d49d79e019f57fb076f0dfa1b01963d0cb2b","observation_id":"83fd9b99-ed26-4611-b85a-f62bb04639da","resolution":{"observed_at":"2026-05-15T14:50:05.155166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10573","last_updated":"2025-06-26T16:38:11Z","snapshot_observed_at":"2026-08-07T15:45:37.216640Z","submitted_at":"2025-05-13T20:36:22Z","title":"Measurement to Meaning: A Validity-Centered Framework for AI Evaluation","version":4},"cited_work":{"arxiv_id":"2505.10573","doi":"10.48550/arxiv.2505.10573","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10573","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measurement to Meaning: A Validity-Centered Framework for AI Evaluation","venue":"ArXiv.org","work_id":"76e38f6b-e125-4627-9738-a6eb7d02af4f","year":2025},"citing_paper":{"arxiv_id":"2604.02406","last_updated":"2026-05-16T00:42:12Z","snapshot_observed_at":"2026-08-12T09:32:39.556916Z","submitted_at":"2026-04-02T17:17:12Z","title":"Evaluating AI-Generated Images of Cultural Artifacts with Community-Informed Rubrics","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-13T20:59:52.448832Z"},"links":{"cited_paper":"/paper/2505.10573","citing_paper":"/paper/2604.02406"},"observation_digest":"sha256:91fc16ac6ca06cd2792b41ed5e0d5221658570cd35803543ffbd9037b58fd069","observation_id":"562ca067-ebcf-4cb4-a100-7534dccc8cbb","resolution":{"observed_at":"2026-05-13T21:03:19.961732Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10573","last_updated":"2025-06-26T16:38:11Z","snapshot_observed_at":"2026-08-07T15:45:37.216640Z","submitted_at":"2025-05-13T20:36:22Z","title":"Measurement to Meaning: A Validity-Centered Framework for AI Evaluation","version":4},"cited_work":{"arxiv_id":"2505.10573","doi":"10.48550/arxiv.2505.10573","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10573","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measurement to Meaning: A Validity-Centered Framework for AI Evaluation","venue":"ArXiv.org","work_id":"76e38f6b-e125-4627-9738-a6eb7d02af4f","year":2025},"citing_paper":{"arxiv_id":"2604.02406","last_updated":"2026-05-16T00:42:12Z","snapshot_observed_at":"2026-08-12T09:32:39.556916Z","submitted_at":"2026-04-02T17:17:12Z","title":"Evaluating AI-Generated Images of Cultural Artifacts with Community-Informed Rubrics","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-21T10:35:39.269869Z"},"links":{"cited_paper":"/paper/2505.10573","citing_paper":"/paper/2604.02406"},"observation_digest":"sha256:ac341c7dc5d35a0be9ace07df740d6f1ece30484078a9df23e8cab819ff61b67","observation_id":"8de174f7-0c80-4bd6-80df-08da94e56963","resolution":{"observed_at":"2026-05-21T10:40:00.749430Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10573","last_updated":"2025-06-26T16:38:11Z","snapshot_observed_at":"2026-08-07T15:45:37.216640Z","submitted_at":"2025-05-13T20:36:22Z","title":"Measurement to Meaning: A Validity-Centered Framework for AI Evaluation","version":4},"cited_work":{"arxiv_id":"2505.10573","doi":"10.48550/arxiv.2505.10573","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10573","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measurement to Meaning: A Validity-Centered Framework for AI Evaluation","venue":"ArXiv.org","work_id":"76e38f6b-e125-4627-9738-a6eb7d02af4f","year":2025},"citing_paper":{"arxiv_id":"2604.19357","last_updated":"2026-04-21T11:38:59Z","snapshot_observed_at":"2026-07-06T23:06:02.635464Z","submitted_at":"2026-04-21T11:38:59Z","title":"FairTree: Subgroup Fairness Auditing of Machine Learning Models with Bias-Variance Decomposition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T03:32:02.079410Z"},"links":{"cited_paper":"/paper/2505.10573","citing_paper":"/paper/2604.19357"},"observation_digest":"sha256:af45745a86fa359eb4be18bd686957beadc9315321ad51494c2ad700b5aae08d","observation_id":"4281925b-e72c-49a9-b7f6-fbbeccab1147","resolution":{"observed_at":"2026-05-11T12:31:03.874897Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10573","last_updated":"2025-06-26T16:38:11Z","snapshot_observed_at":"2026-08-07T15:45:37.216640Z","submitted_at":"2025-05-13T20:36:22Z","title":"Measurement to Meaning: A Validity-Centered Framework for AI Evaluation","version":4},"cited_work":{"arxiv_id":"2505.10573","doi":"10.48550/arxiv.2505.10573","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10573","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measurement to Meaning: A Validity-Centered Framework for AI Evaluation","venue":"ArXiv.org","work_id":"76e38f6b-e125-4627-9738-a6eb7d02af4f","year":2025},"citing_paper":{"arxiv_id":"2605.06652","last_updated":"2026-05-07T17:56:41Z","snapshot_observed_at":"2026-08-11T13:46:01.060829Z","submitted_at":"2026-05-07T17:56:41Z","title":"When No Benchmark Exists: Validating Comparative LLM Safety Scoring Without Ground-Truth Labels","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-08T12:07:02.778631Z"},"links":{"cited_paper":"/paper/2505.10573","citing_paper":"/paper/2605.06652"},"observation_digest":"sha256:3e89b68fdbabe7704e2b1e17eb20b5a19bd1d0ab00f4eb55c00bf98ff183296e","observation_id":"f5a476b8-042f-4952-a799-58c1f61035a1","resolution":{"observed_at":"2026-05-08T21:39:24.632388Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10573","last_updated":"2025-06-26T16:38:11Z","snapshot_observed_at":"2026-08-07T15:45:37.216640Z","submitted_at":"2025-05-13T20:36:22Z","title":"Measurement to Meaning: A Validity-Centered Framework for AI Evaluation","version":4},"cited_work":{"arxiv_id":"2505.10573","doi":"10.48550/arxiv.2505.10573","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10573","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measurement to Meaning: A Validity-Centered Framework for AI Evaluation","venue":"ArXiv.org","work_id":"76e38f6b-e125-4627-9738-a6eb7d02af4f","year":2025},"citing_paper":{"arxiv_id":"2605.30916","last_updated":"2026-05-29T07:01:38Z","snapshot_observed_at":"2026-08-06T11:05:12.049404Z","submitted_at":"2026-05-29T07:01:38Z","title":"Welfare, Improvability, and Variance: A Principal-Agent Approach to Optimal Benchmark Item Aggregation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T23:49:57.580051Z"},"links":{"cited_paper":"/paper/2505.10573","citing_paper":"/paper/2605.30916"},"observation_digest":"sha256:85641dbd6c1a1ad0ce38425943c3abe660adbdaa1af59496661ec04519ad3633","observation_id":"7af2a256-0a3b-4b0e-a449-f237cd74fd43","resolution":{"observed_at":"2026-06-28T23:52:49.475216Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10573","last_updated":"2025-06-26T16:38:11Z","snapshot_observed_at":"2026-08-07T15:45:37.216640Z","submitted_at":"2025-05-13T20:36:22Z","title":"Measurement to Meaning: A Validity-Centered Framework for AI Evaluation","version":4},"cited_work":{"arxiv_id":"2505.10573","doi":"10.48550/arxiv.2505.10573","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10573","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measurement to Meaning: A Validity-Centered Framework for AI Evaluation","venue":"ArXiv.org","work_id":"76e38f6b-e125-4627-9738-a6eb7d02af4f","year":2025},"citing_paper":{"arxiv_id":"2606.10154","last_updated":"2026-06-08T20:33:49Z","snapshot_observed_at":"2026-08-06T00:05:43.511678Z","submitted_at":"2026-06-08T20:33:49Z","title":"Quality Is Not a Safety Proxy Under Quantization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T17:23:08.935056Z"},"links":{"cited_paper":"/paper/2505.10573","citing_paper":"/paper/2606.10154"},"observation_digest":"sha256:c1806060a42dc680c3865f164e10f519ae10947f35d6a1719c7de5050a749c06","observation_id":"029fdfae-f60a-4870-994f-e268d60cc0be","resolution":{"observed_at":"2026-07-03T00:17:28.804330Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10573","last_updated":"2025-06-26T16:38:11Z","snapshot_observed_at":"2026-08-07T15:45:37.216640Z","submitted_at":"2025-05-13T20:36:22Z","title":"Measurement to Meaning: A Validity-Centered Framework for AI Evaluation","version":4},"cited_work":{"arxiv_id":"2505.10573","doi":"10.48550/arxiv.2505.10573","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10573","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measurement to Meaning: A Validity-Centered Framework for AI Evaluation","venue":"ArXiv.org","work_id":"76e38f6b-e125-4627-9738-a6eb7d02af4f","year":2025},"citing_paper":{"arxiv_id":"2606.26079","last_updated":"2026-06-24T17:53:26Z","snapshot_observed_at":"2026-08-10T18:42:27.193503Z","submitted_at":"2026-06-24T17:53:26Z","title":"Same Evidence, Different Answer: Auditing Order Sensitivity in Multimodal Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-25T19:58:23.594907Z"},"links":{"cited_paper":"/paper/2505.10573","citing_paper":"/paper/2606.26079"},"observation_digest":"sha256:40fd800b6f5cfc048dc7a58cd6ea228964fc585af2596d55232cd19d786dcb0d","observation_id":"b3ddd3a3-d757-49a8-b4be-7684a6319362","resolution":{"observed_at":"2026-07-04T20:40:07.567081Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10573","last_updated":"2025-06-26T16:38:11Z","snapshot_observed_at":"2026-08-07T15:45:37.216640Z","submitted_at":"2025-05-13T20:36:22Z","title":"Measurement to Meaning: A Validity-Centered Framework for AI Evaluation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10573","snapshot_observed_at":"2026-07-13T06:19:53.291826Z","title":"Measurement to Meaning: A Validity-Centered Framework for","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08842","last_updated":"2026-07-15T16:06:16Z","snapshot_observed_at":"2026-08-12T06:34:50.588398Z","submitted_at":"2026-07-09T18:02:55Z","title":"L2-Bench: An Evaluation Benchmark for Measuring LLM Capabilities in Second Language Education","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-07-13T06:19:53.291826Z"},"links":{"cited_paper":"/paper/2505.10573","citing_paper":"/paper/2607.08842"},"observation_digest":"sha256:8ba53bb771093780175df2923bb1746ac5055761ca608a6c4ce4976a8fca58fe","observation_id":"8be2027d-c037-43ae-a307-9ef24e6b0059","resolution":{"observed_at":"2026-07-13T06:19:53.291826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10573","last_updated":"2025-06-26T16:38:11Z","snapshot_observed_at":"2026-08-07T15:45:37.216640Z","submitted_at":"2025-05-13T20:36:22Z","title":"Measurement to Meaning: A Validity-Centered Framework for AI Evaluation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10573","snapshot_observed_at":"2026-08-02T07:47:36.943427Z","title":"Measurement to Meaning: A Validity-Centered Framework for","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08842","last_updated":"2026-07-15T16:06:16Z","snapshot_observed_at":"2026-08-12T06:34:50.588398Z","submitted_at":"2026-07-09T18:02:55Z","title":"L2-Bench: An Evaluation Benchmark for Measuring LLM Capabilities in Second Language Education","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-02T07:47:36.943427Z"},"links":{"cited_paper":"/paper/2505.10573","citing_paper":"/paper/2607.08842"},"observation_digest":"sha256:9ccb9c3ea226a33029cfa97c1f5f5c220e28994cb38aadf0ee477ac7d8f6377e","observation_id":"30aa7dbf-48ba-4767-8b93-71d7c1898e5d","resolution":{"observed_at":"2026-08-02T07:47:36.943427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10573","last_updated":"2025-06-26T16:38:11Z","snapshot_observed_at":"2026-08-07T15:45:37.216640Z","submitted_at":"2025-05-13T20:36:22Z","title":"Measurement to Meaning: A Validity-Centered Framework for AI Evaluation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10573","snapshot_observed_at":"2026-08-02T07:44:03.428402Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09306","last_updated":"2026-07-30T11:40:45Z","snapshot_observed_at":"2026-08-02T23:59:13.473449Z","submitted_at":"2026-07-10T11:39:40Z","title":"Exposure is not manifestation: measurement target and output resolution jointly determine which behavioural-faithfulness evaluator wins","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:03.428402Z"},"links":{"cited_paper":"/paper/2505.10573","citing_paper":"/paper/2607.09306"},"observation_digest":"sha256:65afaa2a07610e5ce79dae61c1e509f5e8fdaa01b048982bd56e04d504c2ba04","observation_id":"0e40aeb1-1589-4e3d-a311-c25994277cd6","resolution":{"observed_at":"2026-08-02T07:44:03.428402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10573","last_updated":"2025-06-26T16:38:11Z","snapshot_observed_at":"2026-08-07T15:45:37.216640Z","submitted_at":"2025-05-13T20:36:22Z","title":"Measurement to Meaning: A Validity-Centered Framework for AI Evaluation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10573","snapshot_observed_at":"2026-07-31T01:29:52.661309Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25097","last_updated":"2026-07-27T21:54:19Z","snapshot_observed_at":"2026-08-09T22:40:06.719664Z","submitted_at":"2026-07-27T21:54:19Z","title":"On the Convergent Validity of Offline Evaluation Designs for Recommender Systems","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T01:29:52.661309Z"},"links":{"cited_paper":"/paper/2505.10573","citing_paper":"/paper/2607.25097"},"observation_digest":"sha256:4704e4554e3c112283aeb98666fc5a60ae99b9477acdca4b5afa3a46a7baf357","observation_id":"b46796ac-f749-410b-a7b8-98a6f8f55403","resolution":{"observed_at":"2026-07-31T01:29:52.661309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.10573/citation-record","integrity":"/paper/2505.10573/integrity","json":"/paper/2505.10573/citation-record.json","paper":"/paper/2505.10573"},"outbound":[],"paper":{"arxiv_id":"2505.10573","last_updated":"2025-06-26T16:38:11Z","latest_version":4,"primary_category":"cs.CY","snapshot_observed_at":"2026-08-07T15:45:37.216640Z","submitted_at":"2025-05-13T20:36:22Z","title":"Measurement to Meaning: A Validity-Centered Framework for AI Evaluation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2505.10573."}