{"as_of":"2026-08-08T00:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:92b1b275778b2c01a64d9b91d3172ffc9037f7d2908722e792562e45ff16470d","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:23:08.655335Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:13:47.447302Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T18:00:01.346988Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02856","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-06T20:17:04.975842Z","submitted_at":"2025-07-03T17:59:02Z","title":"Answer Matching Outperforms Multiple Choice for Language Model Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02856","snapshot_observed_at":"2026-08-04T14:43:11.483898Z","title":"Answer matching outperforms multiple choice for language model evaluation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.23782","last_updated":"2026-06-01T03:35:05Z","snapshot_observed_at":"2026-08-04T14:43:07.447205Z","submitted_at":"2025-09-28T09:57:24Z","title":"Bridging the Knowledge-Prediction Gap in LLMs on Multiple-Choice Questions","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:11.483898Z"},"links":{"cited_paper":"/paper/2507.02856","citing_paper":"/paper/2509.23782"},"observation_digest":"sha256:3502a3e91c7b3f9dbeee999b1791aca8e47806ba2e1498186b7898c3ae0ed5ad","observation_id":"7c5363e6-c712-4c37-aa28-cbdd340f86bd","resolution":{"observed_at":"2026-08-04T14:43:11.483898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02856","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-06T20:17:04.975842Z","submitted_at":"2025-07-03T17:59:02Z","title":"Answer Matching Outperforms Multiple Choice for Language Model Evaluation","version":1},"cited_work":{"arxiv_id":"2507.02856","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02856","snapshot_observed_at":"2026-07-04T18:00:01.346988Z","title":"Answer matching outperforms multiple choice for language model evaluation.arXiv preprint arXiv:2507.02856","venue":null,"work_id":"e06ad485-d3b6-42c6-a971-dffe3373a9c5","year":2025},"citing_paper":{"arxiv_id":"2509.26522","last_updated":"2026-04-08T14:33:47Z","snapshot_observed_at":"2026-07-06T22:31:15.349221Z","submitted_at":"2025-09-30T16:59:37Z","title":"Entropy After </Think> for reasoning model early exiting","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T11:51:58.579048Z"},"links":{"cited_paper":"/paper/2507.02856","citing_paper":"/paper/2509.26522"},"observation_digest":"sha256:452a3955757b9ceaa72a2d9c23dd11dab35b289ccc64a3c5facf419e8200baaf","observation_id":"6e6db20a-4026-483b-a1bd-cca37b5d2f2d","resolution":{"observed_at":"2026-05-18T11:52:35.599288Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02856","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-06T20:17:04.975842Z","submitted_at":"2025-07-03T17:59:02Z","title":"Answer Matching Outperforms Multiple Choice for Language Model Evaluation","version":1},"cited_work":{"arxiv_id":"2507.02856","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02856","snapshot_observed_at":"2026-07-04T18:00:01.346988Z","title":"Answer matching outperforms multiple choice for language model evaluation.arXiv preprint arXiv:2507.02856","venue":null,"work_id":"e06ad485-d3b6-42c6-a971-dffe3373a9c5","year":2025},"citing_paper":{"arxiv_id":"2510.24328","last_updated":"2026-04-16T21:08:22Z","snapshot_observed_at":"2026-08-07T14:30:05.110416Z","submitted_at":"2025-10-28T11:52:51Z","title":"Beyond MCQ: An Open-Ended Arabic Cultural QA Benchmark with Dialect Variants","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T03:12:03.909181Z"},"links":{"cited_paper":"/paper/2507.02856","citing_paper":"/paper/2510.24328"},"observation_digest":"sha256:44da0a0a4bc5f7188ea843f2caf0f060a9641c3e090461964999afed080979d2","observation_id":"12c11f98-a00a-4ed0-ba99-d3424204496e","resolution":{"observed_at":"2026-05-18T03:12:22.093472Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02856","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-06T20:17:04.975842Z","submitted_at":"2025-07-03T17:59:02Z","title":"Answer Matching Outperforms Multiple Choice for Language Model Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02856","snapshot_observed_at":"2026-07-15T13:17:48.274611Z","title":"An- swer matching outperforms multiple choice for language model evaluation.arXiv preprint arXiv:2507.02856, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.10044","last_updated":"2026-06-03T17:59:34Z","snapshot_observed_at":"2026-08-01T15:08:27.655089Z","submitted_at":"2026-03-08T01:37:45Z","title":"Safety Under Scaffolding: How Evaluation Conditions Shape Measured Safety","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-15T13:17:48.274611Z"},"links":{"cited_paper":"/paper/2507.02856","citing_paper":"/paper/2603.10044"},"observation_digest":"sha256:d30d3d0fd5d16768708e241861130ef6ca628fcd97397ff3c768a11cb9e064ef","observation_id":"14106616-9b6b-493c-8290-c9e419e0e622","resolution":{"observed_at":"2026-07-15T13:17:48.274611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02856","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-06T20:17:04.975842Z","submitted_at":"2025-07-03T17:59:02Z","title":"Answer Matching Outperforms Multiple Choice for Language Model Evaluation","version":1},"cited_work":{"arxiv_id":"2507.02856","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02856","snapshot_observed_at":"2026-07-04T18:00:01.346988Z","title":"Answer matching outperforms multiple choice for language model evaluation.arXiv preprint arXiv:2507.02856","venue":null,"work_id":"e06ad485-d3b6-42c6-a971-dffe3373a9c5","year":2025},"citing_paper":{"arxiv_id":"2606.09409","last_updated":"2026-06-08T12:26:54Z","snapshot_observed_at":"2026-07-06T23:48:44.159537Z","submitted_at":"2026-06-08T12:26:54Z","title":"Correct Looks Better: Pairwise Comparisons Reveal Accuracy Rankings","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-27T16:32:23.001110Z"},"links":{"cited_paper":"/paper/2507.02856","citing_paper":"/paper/2606.09409"},"observation_digest":"sha256:667107bff33e69605abe734eec81918aa086b96d0fe36c9a50177951ffb72e1a","observation_id":"6b6c605c-69f9-42ce-8b0b-e98af22fd748","resolution":{"observed_at":"2026-07-03T01:27:31.152523Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02856","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-06T20:17:04.975842Z","submitted_at":"2025-07-03T17:59:02Z","title":"Answer Matching Outperforms Multiple Choice for Language Model Evaluation","version":1},"cited_work":{"arxiv_id":"2507.02856","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02856","snapshot_observed_at":"2026-07-04T18:00:01.346988Z","title":"Answer matching outperforms multiple choice for language model evaluation.arXiv preprint arXiv:2507.02856","venue":null,"work_id":"e06ad485-d3b6-42c6-a971-dffe3373a9c5","year":2025},"citing_paper":{"arxiv_id":"2606.10657","last_updated":"2026-06-09T10:05:20Z","snapshot_observed_at":"2026-08-06T14:06:25.138441Z","submitted_at":"2026-06-09T10:05:20Z","title":"Are We Evaluating Knowledge or Phrasing? Mitigating MCQA Sensitivity with ParaEval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T13:13:21.687950Z"},"links":{"cited_paper":"/paper/2507.02856","citing_paper":"/paper/2606.10657"},"observation_digest":"sha256:3f36e62f58f333f2113a6fd8177e0b7a327dee2079055bb973ba2f35faaf0ef5","observation_id":"9a7f5675-c8a4-4ee0-8a6c-a4089dc377a3","resolution":{"observed_at":"2026-07-03T05:27:40.323764Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02856","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-06T20:17:04.975842Z","submitted_at":"2025-07-03T17:59:02Z","title":"Answer Matching Outperforms Multiple Choice for Language Model Evaluation","version":1},"cited_work":{"arxiv_id":"2507.02856","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02856","snapshot_observed_at":"2026-07-04T18:00:01.346988Z","title":"Answer matching outperforms multiple choice for language model evaluation.arXiv preprint arXiv:2507.02856","venue":null,"work_id":"e06ad485-d3b6-42c6-a971-dffe3373a9c5","year":2025},"citing_paper":{"arxiv_id":"2606.11643","last_updated":"2026-06-10T04:07:41Z","snapshot_observed_at":"2026-08-07T07:53:11.328999Z","submitted_at":"2026-06-10T04:07:41Z","title":"Improving Cross-Format Robustness in Language Models with Multi-Format Training","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-27T10:13:22.927828Z"},"links":{"cited_paper":"/paper/2507.02856","citing_paper":"/paper/2606.11643"},"observation_digest":"sha256:84ebbf04635baf7af42d76c68c052661a15d9f7386f570d6c78e6dd904cec327","observation_id":"0104e497-a442-4600-88db-9684d3bc0a6a","resolution":{"observed_at":"2026-07-03T10:07:56.335157Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02856","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-06T20:17:04.975842Z","submitted_at":"2025-07-03T17:59:02Z","title":"Answer Matching Outperforms Multiple Choice for Language Model Evaluation","version":1},"cited_work":{"arxiv_id":"2507.02856","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02856","snapshot_observed_at":"2026-07-04T18:00:01.346988Z","title":"Answer matching outperforms multiple choice for language model evaluation.arXiv preprint arXiv:2507.02856","venue":null,"work_id":"e06ad485-d3b6-42c6-a971-dffe3373a9c5","year":2025},"citing_paper":{"arxiv_id":"2606.20900","last_updated":"2026-06-18T19:55:11Z","snapshot_observed_at":"2026-07-29T18:03:34.959302Z","submitted_at":"2026-06-18T19:55:11Z","title":"Storyline Trees: Hierarchical Representations for Long-Form Narratives","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T17:10:05.604537Z"},"links":{"cited_paper":"/paper/2507.02856","citing_paper":"/paper/2606.20900"},"observation_digest":"sha256:7b60ac41a23ac5890c1b4ce837cb96bd2fc632b1276505641976a5824be915e9","observation_id":"caacba0b-b620-4009-8718-1170947ae885","resolution":{"observed_at":"2026-07-04T04:19:33.787019Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02856","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-06T20:17:04.975842Z","submitted_at":"2025-07-03T17:59:02Z","title":"Answer Matching Outperforms Multiple Choice for Language Model Evaluation","version":1},"cited_work":{"arxiv_id":"2507.02856","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02856","snapshot_observed_at":"2026-07-04T18:00:01.346988Z","title":"Answer matching outperforms multiple choice for language model evaluation.arXiv preprint arXiv:2507.02856","venue":null,"work_id":"e06ad485-d3b6-42c6-a971-dffe3373a9c5","year":2025},"citing_paper":{"arxiv_id":"2606.24819","last_updated":"2026-06-23T17:05:19Z","snapshot_observed_at":"2026-08-04T20:05:27.820745Z","submitted_at":"2026-06-23T17:05:19Z","title":"HelpBench: Assessing the Ability of LLMs to Provide Privacy, Safety, and Security Advice","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-25T23:08:27.995672Z"},"links":{"cited_paper":"/paper/2507.02856","citing_paper":"/paper/2606.24819"},"observation_digest":"sha256:1f556cbddfc3d91b77c794345568422503dc044ec8320c59fc5b4017c4d19c8b","observation_id":"22d4eb0e-8361-4029-849e-ce002bb215c0","resolution":{"observed_at":"2026-07-04T18:00:01.348676Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02856","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-06T20:17:04.975842Z","submitted_at":"2025-07-03T17:59:02Z","title":"Answer Matching Outperforms Multiple Choice for Language Model Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02856","snapshot_observed_at":"2026-08-06T00:42:56.011737Z","title":"An- swer matching outperforms multiple choice for language model evaluation.arXiv preprint arXiv:2507.02856, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-06T23:25:17.485005Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:56.011737Z"},"links":{"cited_paper":"/paper/2507.02856","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:8acdbf19d4a021c728b4060e60f8552ea65ceb3de94d7a3a599e2d76a06efc5f","observation_id":"c967abae-1ab3-4368-b4b6-5466d675666d","resolution":{"observed_at":"2026-08-06T00:42:56.011737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02856","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-06T20:17:04.975842Z","submitted_at":"2025-07-03T17:59:02Z","title":"Answer Matching Outperforms Multiple Choice for Language Model Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02856","snapshot_observed_at":"2026-08-07T00:13:47.447302Z","title":"Answermatchingoutperforms multiple choice for language model evaluation.arXiv preprint arXiv:2507.02856, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01755","last_updated":"2026-08-04T02:59:32Z","snapshot_observed_at":"2026-08-07T23:09:44.650149Z","submitted_at":"2026-08-03T06:24:36Z","title":"Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:47.447302Z"},"links":{"cited_paper":"/paper/2507.02856","citing_paper":"/paper/2608.01755"},"observation_digest":"sha256:62c13b8ab2180185ce60001efb6d6ea749871cec684edef620f204a0f704c35b","observation_id":"d1c55097-9c9a-49dc-bbdf-d047c057a294","resolution":{"observed_at":"2026-08-07T00:13:47.447302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02856/citation-record","integrity":"/paper/2507.02856/integrity","json":"/paper/2507.02856/citation-record.json","paper":"/paper/2507.02856"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:10.500526Z","title":"• Reversible: Expansion is infinitesimally slow, maintaining equilibrium","venue":null,"work_id":"83bfaa98-1c74-445f-b92a-9587dfd9fb5a","year":null},"citing_paper":{"arxiv_id":"2507.02856","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-06T20:17:04.975842Z","submitted_at":"2025-07-03T17:59:02Z","title":"Answer Matching Outperforms Multiple Choice for Language Model Evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:07.892717Z"},"links":{"citing_paper":"/paper/2507.02856"},"observation_digest":"sha256:d9ea8d0df1522928387c2e3a6f6b8ee4029ebbea7566caa6e098292eb4c909f3","observation_id":"2da168eb-6191-4d7f-8310-64499fb7d47c","resolution":{"observed_at":"2026-08-06T20:23:10.621361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:10.286722Z","title":null,"venue":null,"work_id":"758d6aef-407e-4444-a04c-1f87a65d31ce","year":null},"citing_paper":{"arxiv_id":"2507.02856","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-06T20:17:04.975842Z","submitted_at":"2025-07-03T17:59:02Z","title":"Answer Matching Outperforms Multiple Choice for Language Model Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:07.958785Z"},"links":{"citing_paper":"/paper/2507.02856"},"observation_digest":"sha256:a4052c3368603b86c4ada216c8615901af279f2acb880b93f15e5b49c6cea56b","observation_id":"498c18bb-1daf-4009-a314-41e5477a80ee","resolution":{"observed_at":"2026-08-06T20:23:10.418925Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:10.080430Z","title":null,"venue":null,"work_id":"ea3224c4-bf02-4fa7-b475-7d2fe656eeed","year":null},"citing_paper":{"arxiv_id":"2507.02856","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-06T20:17:04.975842Z","submitted_at":"2025-07-03T17:59:02Z","title":"Answer Matching Outperforms Multiple Choice for Language Model Evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:08.044400Z"},"links":{"citing_paper":"/paper/2507.02856"},"observation_digest":"sha256:c15dd73fc0dfd1045a54a8b3b9c004857e516545324b25fea19048754125cec6","observation_id":"478e6010-5de2-44f0-a451-1b74e04be053","resolution":{"observed_at":"2026-08-06T20:23:10.185150Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:09.906806Z","title":"Calculate the total change in entropy, when a sample of nitrogen gas of mass 14 g at 298 K and 1.00 bar doubles its volume in an isothermal reversible expansion","venue":null,"work_id":"59785a66-ceb5-44ad-9301-4af2e5a7d97d","year":null},"citing_paper":{"arxiv_id":"2507.02856","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-06T20:17:04.975842Z","submitted_at":"2025-07-03T17:59:02Z","title":"Answer Matching Outperforms Multiple Choice for Language Model Evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:08.111058Z"},"links":{"citing_paper":"/paper/2507.02856"},"observation_digest":"sha256:de8847691ee43949f55ccc616c0d1d8337fa13520d8676636464392a13139f78","observation_id":"5b9ed96b-4f81-40a1-ba5a-cf33897bef0b","resolution":{"observed_at":"2026-08-06T20:23:09.978120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:10.720742Z","title":"We find that MCQ estimates the highest accuracy followed by LLM-judges","venue":null,"work_id":"91ce2c74-dbc9-4931-9a07-4db312645213","year":2004},"citing_paper":{"arxiv_id":"2507.02856","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-06T20:17:04.975842Z","submitted_at":"2025-07-03T17:59:02Z","title":"Answer Matching Outperforms Multiple Choice for Language Model Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:07.805474Z"},"links":{"citing_paper":"/paper/2507.02856"},"observation_digest":"sha256:935bc409abca524a6041575578cdd471ffb3b70caf40df451d21c639ff62a482","observation_id":"a63bb3a2-be4b-4674-aba5-836b42a28dc2","resolution":{"observed_at":"2026-08-06T20:23:10.801232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:08.856296Z","title":"\" \" # The response can have more information than the ,→ ground− t r u t h . # I t can be more s p e c i f i c ( f o r example ,","venue":null,"work_id":"5a16885b-74ab-444d-8877-ec00ee60c9e8","year":null},"citing_paper":{"arxiv_id":"2507.02856","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-06T20:17:04.975842Z","submitted_at":"2025-07-03T17:59:02Z","title":"Answer Matching Outperforms Multiple Choice for Language Model Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:08.655335Z"},"links":{"citing_paper":"/paper/2507.02856"},"observation_digest":"sha256:15978c26cf9039ae97d382971e93a9559cd7a964a05b578fa7215e79700c43da","observation_id":"7992e3db-e97f-4297-a46e-d39ff3bb736c","resolution":{"observed_at":"2026-08-06T20:23:08.975801Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:09.753301Z","title":"• Reversible: Expansion occurs slowly enough to maintain equilibrium","venue":null,"work_id":"643e367a-b7ce-458c-a3eb-338a8846a1f8","year":null},"citing_paper":{"arxiv_id":"2507.02856","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-06T20:17:04.975842Z","submitted_at":"2025-07-03T17:59:02Z","title":"Answer Matching Outperforms Multiple Choice for Language Model Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:08.199589Z"},"links":{"citing_paper":"/paper/2507.02856"},"observation_digest":"sha256:dfcb493cd51d54dabc18a094979c61c741b4ce5938b6d93db959ef736d50e665","observation_id":"06cffa44-e03c-4bf0-b34e-c30b8d3f07e2","resolution":{"observed_at":"2026-08-06T20:23:09.822721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:09.598031Z","title":null,"venue":null,"work_id":"4c69e4b5-e55e-4872-afb7-01e151cf1be1","year":null},"citing_paper":{"arxiv_id":"2507.02856","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-06T20:17:04.975842Z","submitted_at":"2025-07-03T17:59:02Z","title":"Answer Matching Outperforms Multiple Choice for Language Model Evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:08.289554Z"},"links":{"citing_paper":"/paper/2507.02856"},"observation_digest":"sha256:844fc5e08537deadb726f0ffe9adde13cefe472d8f1365a4abd1252fca8ba3b3","observation_id":"6d569b6e-02ca-400c-9298-cf15e9353434","resolution":{"observed_at":"2026-08-06T20:23:09.674329Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:09.415259Z","title":null,"venue":null,"work_id":"ef0727a2-04c6-4887-9c0d-e7a823b33d4a","year":null},"citing_paper":{"arxiv_id":"2507.02856","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-06T20:17:04.975842Z","submitted_at":"2025-07-03T17:59:02Z","title":"Answer Matching Outperforms Multiple Choice for Language Model Evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:08.356038Z"},"links":{"citing_paper":"/paper/2507.02856"},"observation_digest":"sha256:5891ea967d001c188104e11b8acaa5afd683f5d889feb975d010f0ccb2c79c78","observation_id":"1bf6c3ef-6f46-4469-b995-a7d238a450d7","resolution":{"observed_at":"2026-08-06T20:23:09.489007Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:09.220699Z","title":null,"venue":null,"work_id":"293720b7-f44e-4906-a3c9-d251c4fc2d5a","year":null},"citing_paper":{"arxiv_id":"2507.02856","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-06T20:17:04.975842Z","submitted_at":"2025-07-03T17:59:02Z","title":"Answer Matching Outperforms Multiple Choice for Language Model Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:08.450396Z"},"links":{"citing_paper":"/paper/2507.02856"},"observation_digest":"sha256:3630938fab9a2fdfdbd27336454455d2f91c4216bddefd11424d2023ca3d8713","observation_id":"67b44c01-64bb-4470-99fb-410eb0e0a570","resolution":{"observed_at":"2026-08-06T20:23:09.334697Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:09.050054Z","title":null,"venue":null,"work_id":"82484447-331f-4fa5-93c2-5cd50a43fa05","year":null},"citing_paper":{"arxiv_id":"2507.02856","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-06T20:17:04.975842Z","submitted_at":"2025-07-03T17:59:02Z","title":"Answer Matching Outperforms Multiple Choice for Language Model Evaluation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:08.546381Z"},"links":{"citing_paper":"/paper/2507.02856"},"observation_digest":"sha256:025238c45e25115929f9d060e0dc695de87834c42eb86a5d9d44eef1685814a7","observation_id":"7b28d7db-4c2a-41b7-8754-b16ac26cda0a","resolution":{"observed_at":"2026-08-06T20:23:09.125448Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:23:07.761432Z","title":"cloze procedure","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02856","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-06T20:17:04.975842Z","submitted_at":"2025-07-03T17:59:02Z","title":"Answer Matching Outperforms Multiple Choice for Language Model Evaluation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:07.761432Z"},"links":{"citing_paper":"/paper/2507.02856"},"observation_digest":"sha256:89c4267fbb1807e783bebd61199aa0db3bb15fdfc12ebc6cfe3bc380a3f8afc7","observation_id":"dc0d4a58-c0d3-4146-bf3f-70b7017a9a22","resolution":{"observed_at":"2026-08-06T20:23:07.761432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.02856","last_updated":"2025-07-03T17:59:02Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T20:17:04.975842Z","submitted_at":"2025-07-03T17:59:02Z","title":"Answer Matching Outperforms Multiple Choice for Language Model Evaluation"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 11 inbound Pith citation observations for arXiv:2507.02856."}