{"as_of":"2026-08-24T04:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c42da2b23e6d259a355856a32a1ef3a1fb4a06f77642cb3e824953aad4dae17c","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T06:45:50.219157Z","state":"measured"},{"denominator":119,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":119,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":147,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:09:31.122730Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":12,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-12T13:07:48.894841Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16489","last_updated":"2024-11-25T15:31:27Z","snapshot_observed_at":"2026-08-21T00:33:19.968625Z","submitted_at":"2024-11-25T15:31:27Z","title":"O1 Replication Journey -- Part 2: Surpassing O1-preview through Simple Distillation, Big Progress or Bitter Lesson?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T13:07:48.894841Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2411.16489"},"observation_digest":"sha256:a44e1352f4b8f92b61eb1430fbd9dcac94128d93a2dae2b2fa88903dbd5ac419","observation_id":"e34ef943-f0b5-4d86-bc6f-10cae8658b79","resolution":{"observed_at":"2026-08-12T13:07:48.894841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-11T20:55:26.901084Z","title":"Measuring short- form factuality in large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05223","last_updated":"2025-03-26T15:18:53Z","snapshot_observed_at":"2026-08-19T23:20:32.539633Z","submitted_at":"2024-12-06T17:54:54Z","title":"100% Elimination of Hallucinations on RAGTruth for GPT-4 and GPT-3.5 Turbo","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T20:55:26.901084Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2412.05223"},"observation_digest":"sha256:f4ccc2bfc223cc19fa84dbea30a901381b3c160ff1fa4531c4e60bebe272c18d","observation_id":"3c931fb1-a8f3-46e2-9890-e16ce7c9656d","resolution":{"observed_at":"2026-08-11T20:55:26.901084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-11T10:44:16.347418Z","title":"Mea- suring short-form factuality in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-17T07:21:20.458339Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T10:44:16.347418Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2412.16339"},"observation_digest":"sha256:497253557661bf8f9178d1b850c0bc59623382360acf4403f24d2eeadf109b52","observation_id":"7cb769b5-1664-425b-950f-9cc7ed93c96b","resolution":{"observed_at":"2026-08-11T10:44:16.347418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-10T22:35:49.095505Z","title":"Measuring short-form factuality in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01306","last_updated":"2025-01-03T08:29:37Z","snapshot_observed_at":"2026-08-14T19:11:08.554167Z","submitted_at":"2025-01-02T15:36:50Z","title":"Think More, Hallucinate Less: Mitigating Hallucinations via Dual Process of Fast and Slow Thinking","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:49.095505Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2501.01306"},"observation_digest":"sha256:7b61bb4013508924521fec135cec17d3851302844476622bf0a80bda4b424193","observation_id":"6bdfc51e-a3d6-4f79-aa35-b1d2a30439c4","resolution":{"observed_at":"2026-08-10T22:35:49.095505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-10T22:33:24.532912Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01332","last_updated":"2025-01-02T16:34:10Z","snapshot_observed_at":"2026-08-18T17:00:36.944228Z","submitted_at":"2025-01-02T16:34:10Z","title":"Decoding Knowledge in Large Language Models: A Framework for Categorization and Comprehension","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T22:33:24.532912Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2501.01332"},"observation_digest":"sha256:156853b9c76af1ec2ab8bf836829be10d416c2056a61a8c5ff3b2f20d8588c48","observation_id":"c8ecd44b-6284-4d06-998a-a87c5b07c9d4","resolution":{"observed_at":"2026-08-10T22:33:24.532912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-10T21:57:11.916094Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03200","last_updated":"2025-01-06T18:28:04Z","snapshot_observed_at":"2026-08-18T21:49:44.851092Z","submitted_at":"2025-01-06T18:28:04Z","title":"The FACTS Grounding Leaderboard: Benchmarking LLMs' Ability to Ground Responses to Long-Form Input","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T21:57:11.916094Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2501.03200"},"observation_digest":"sha256:7360705c9f1ef710c28379e53a87e250462f293e2b2338b6cd8e62efdf4634f5","observation_id":"830fab3b-2009-431d-be43-48d6d4ded6b2","resolution":{"observed_at":"2026-08-10T21:57:11.916094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-10T20:43:45.409278Z","title":"Measuring short-form factuality in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07482","last_updated":"2025-05-20T17:09:53Z","snapshot_observed_at":"2026-08-16T18:33:37.341055Z","submitted_at":"2025-01-13T16:58:32Z","title":"TiEBe: Tracking Language Model Recall of Notable Worldwide Events Through Time","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:43:45.409278Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2501.07482"},"observation_digest":"sha256:825e9f8127ba6ac65367d8c375846b6a0e4e851f41b374b23d66342a2a5dca63","observation_id":"0219d421-062f-42b2-9758-a7ad296a4264","resolution":{"observed_at":"2026-08-10T20:43:45.409278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-10T19:54:58.050866Z","title":"Measuring short-form factuality in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09731","last_updated":"2026-06-21T18:34:43Z","snapshot_observed_at":"2026-08-14T01:10:11.504630Z","submitted_at":"2025-01-16T18:30:33Z","title":"Predictions as Surrogates: Revisiting Surrogate Outcomes in the Age of AI","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T19:54:58.050866Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2501.09731"},"observation_digest":"sha256:1fbe1e482f6d264c25bff5438c1df5e29c6649cb6b1e181211f45f23ecc73a96","observation_id":"250d4475-5baa-45c9-b35d-d1c508a22886","resolution":{"observed_at":"2026-08-10T19:54:58.050866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-08-20T14:04:31.329156Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:50.139345Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2501.14249"},"observation_digest":"sha256:67aa9328b047d435bb76b7eb1e596d34f61a8d23fea29f2e56e907018b732952","observation_id":"ea073248-6907-44e2-b96d-353a4f384ba4","resolution":{"observed_at":"2026-05-15T06:45:50.345693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-09T22:19:41.395082Z","title":"Measuring short-form factuality in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18841","last_updated":"2025-01-31T01:20:44Z","snapshot_observed_at":"2026-08-18T02:49:23.189544Z","submitted_at":"2025-01-31T01:20:44Z","title":"Trading Inference-Time Compute for Adversarial Robustness","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T22:19:41.395082Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2501.18841"},"observation_digest":"sha256:f7a6abc56e97da50422bb9e0005ca9f210ea587bef63aa436b3661860317b02a","observation_id":"9d1158f4-6348-4a56-97f5-b98797720e26","resolution":{"observed_at":"2026-08-09T22:19:41.395082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-17T02:11:36.932541Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2502.03387"},"observation_digest":"sha256:c5502be0bb80a7dbfa105cdbe390cd71147632d90ff633c681c120f701b3f2ba","observation_id":"77d63d76-0b38-4929-95cb-12c593631201","resolution":{"observed_at":"2026-05-17T02:11:37.251634Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-08T14:51:15.479245Z","title":"W., Jiao, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-20T11:53:40.868172Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.479245Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:b0fc85c043ac81698481cb9d4296b4290a7a03c87c84f9a2304cad908f2459ee","observation_id":"1bb2c226-877e-4409-9356-16042d1529cf","resolution":{"observed_at":"2026-08-08T14:51:15.479245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2502.12272","last_updated":"2026-04-30T11:57:30Z","snapshot_observed_at":"2026-08-16T20:21:19.982691Z","submitted_at":"2025-02-17T19:16:37Z","title":"Learning to Reason at the Frontier of Learnability","version":6},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-23T02:41:21.571824Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2502.12272"},"observation_digest":"sha256:33e4c95f5b9069446febfcf17bb88d6e0453d55a78b124bebf5bc2db9db0364d","observation_id":"75b9796e-604a-43ed-a377-36da011eea82","resolution":{"observed_at":"2026-05-23T02:42:26.155841Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2503.02574","last_updated":"2026-05-18T17:54:05Z","snapshot_observed_at":"2026-08-18T01:04:38.795907Z","submitted_at":"2025-03-04T12:55:07Z","title":"LLM-Safety Evaluations Lack Robustness","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-23T01:26:45.402983Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2503.02574"},"observation_digest":"sha256:f1a20d0673f1f16a5c7fdb5813fdc1e50cfdf724ffb10dedd53f525bc1945c98","observation_id":"c873965e-5314-42be-9784-99015204d247","resolution":{"observed_at":"2026-05-23T01:27:21.310735Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-16T12:09:31.122730Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13677","last_updated":"2025-06-04T15:25:43Z","snapshot_observed_at":"2026-08-20T14:26:08.494301Z","submitted_at":"2025-04-18T13:13:42Z","title":"Revisiting Uncertainty Quantification Evaluation in Language Models: Spurious Interactions with Response Length Bias Results","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T12:09:31.122730Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2504.13677"},"observation_digest":"sha256:7fa364f7f2462307467b410f605fa66bece8247672cedc3b0d64ca6677540e96","observation_id":"5f317ab6-a637-4ac1-8003-7c7c8dea20fa","resolution":{"observed_at":"2026-08-16T12:09:31.122730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-16T11:46:40.757700Z","title":"Measuring short-form factuality in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14693","last_updated":"2025-05-02T22:30:26Z","snapshot_observed_at":"2026-08-18T02:26:00.733954Z","submitted_at":"2025-04-20T17:58:46Z","title":"Video-MMLU: A Massive Multi-Discipline Lecture Understanding Benchmark","version":2},"reference_index":132,"source":"pdf_text","source_observed_at":"2026-08-16T11:46:40.757700Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2504.14693"},"observation_digest":"sha256:8dfba67b6ffa3871e57baf687160dbc3d92da951bbbd7494c37bfd5f43acca08","observation_id":"539bbfea-6fcc-4932-b7bf-33ec54fcd598","resolution":{"observed_at":"2026-08-16T11:46:40.757700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-16T11:39:11.275027Z","title":"Measuring short-form factuality in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14985","last_updated":"2025-04-23T16:52:54Z","snapshot_observed_at":"2026-08-19T05:45:48.314083Z","submitted_at":"2025-04-21T09:26:05Z","title":"aiXamine: Simplified LLM Safety and Security","version":2},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-08-16T11:39:11.275027Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2504.14985"},"observation_digest":"sha256:f67e7345f50d38ddc47068751f0d7172122ee39ccb74eca081100f7051584cc6","observation_id":"e10034c9-f11a-42d8-986e-814e5055f879","resolution":{"observed_at":"2026-08-16T11:39:11.275027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-16T10:40:19.340665Z","title":"world war II","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17550","last_updated":"2025-04-24T13:40:27Z","snapshot_observed_at":"2026-08-16T10:35:07.542501Z","submitted_at":"2025-04-24T13:40:27Z","title":"HalluLens: LLM Hallucination Benchmark","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-16T10:40:19.340665Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2504.17550"},"observation_digest":"sha256:4c2d2cb839047b58e272341e5277973df54be5337da76be1a91d6c0409df7830","observation_id":"ca7a9cbc-c633-41bf-8faf-dbd2ad02ca5e","resolution":{"observed_at":"2026-08-16T10:40:19.340665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-16T05:38:12.232963Z","title":"Measuring short-form factuality in large language models, November 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20271","last_updated":"2025-04-28T21:28:17Z","snapshot_observed_at":"2026-08-17T16:18:25.091374Z","submitted_at":"2025-04-28T21:28:17Z","title":"Investigating task-specific prompts and sparse autoencoders for activation monitoring","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T05:38:12.232963Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2504.20271"},"observation_digest":"sha256:a207bd5bf1b2b84368a5a527482f4af5b96fcd0120b103966080aa8b7e6abc70","observation_id":"6231d726-a778-47b9-b3f3-b19517bcab23","resolution":{"observed_at":"2026-08-16T05:38:12.232963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-15T22:03:20.469685Z","title":"Measuring short-form factuality in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08253","last_updated":"2025-05-13T06:02:37Z","snapshot_observed_at":"2026-08-18T18:20:39.141632Z","submitted_at":"2025-05-13T06:02:37Z","title":"Evaluating LLM Metrics Through Real-World Capabilities","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-15T22:03:20.469685Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2505.08253"},"observation_digest":"sha256:00b544af076a40868df510f7dcb2b178a1312810a74e0c689fef77be5ab492a0","observation_id":"b5aa205e-0465-4378-8d75-1f4719ce8f88","resolution":{"observed_at":"2026-08-15T22:03:20.469685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-15T21:38:44.694284Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09338","last_updated":"2025-06-27T11:15:26Z","snapshot_observed_at":"2026-08-20T08:54:28.008250Z","submitted_at":"2025-05-14T12:33:05Z","title":"Llama See, Llama Do: A Mechanistic Perspective on Contextual Entrainment and Distraction in LLMs","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T21:38:44.694284Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2505.09338"},"observation_digest":"sha256:74b4c1c997f7f58271fb1b18b8aade3c756b0f37f070e74ff9a2c460a3cb0af2","observation_id":"9bfd8c1c-7a42-490f-8262-aa9cc102b295","resolution":{"observed_at":"2026-08-15T21:38:44.694284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-15T20:58:23.215085Z","title":"Measuring short-form factuality in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-18T18:59:35.551356Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.215085Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:0cfffade86244ef71c4f160a95986c3a73c02d83586b338dc955402dfec76aa6","observation_id":"d3db9def-01cd-4792-bf47-2a938be442c0","resolution":{"observed_at":"2026-08-15T20:58:23.215085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-15T20:51:49.430503Z","title":"Measuring short-form factuality in large language models.arXiv preprint arXiv:2411.04368, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11896","last_updated":"2025-05-25T13:39:29Z","snapshot_observed_at":"2026-08-15T20:43:10.391637Z","submitted_at":"2025-05-17T08:27:00Z","title":"AdaCoT: Pareto-Optimal Adaptive Chain-of-Thought Triggering via Reinforcement Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:49.430503Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2505.11896"},"observation_digest":"sha256:d831b8f27fa31180e862e218d6bb42f5e7daf24530c48a97ab91998f49f56bb4","observation_id":"2a38d3bc-a9c3-4402-a5b7-0b8712479fa4","resolution":{"observed_at":"2026-08-15T20:51:49.430503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-07T15:34:43.846476Z","title":"Measuring short-form factuality in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14640","last_updated":"2025-05-20T17:26:32Z","snapshot_observed_at":"2026-08-13T16:34:59.517866Z","submitted_at":"2025-05-20T17:26:32Z","title":"VideoEval-Pro: Robust and Realistic Long Video Understanding Evaluation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:43.846476Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2505.14640"},"observation_digest":"sha256:b6a8f65ddf5000ee102f01abe97c1ee669e65d3c04bd65da593ff64df6b6eecd","observation_id":"cee2d8f7-c7d7-4872-8ffd-955bf72fc76f","resolution":{"observed_at":"2026-08-07T15:34:43.846476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-07T15:30:51.016582Z","title":"Measuring short-form factuality in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14963","last_updated":"2025-05-20T22:42:33Z","snapshot_observed_at":"2026-08-17T01:55:47.305744Z","submitted_at":"2025-05-20T22:42:33Z","title":"MedBrowseComp: Benchmarking Medical Deep Research and Computer Use","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:30:51.016582Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2505.14963"},"observation_digest":"sha256:6d41737b307a5b7dac54508ccb6bd5c0199c02f6e3e59221a81a4b1749ce805f","observation_id":"beeab439-929c-4b2b-aba6-664376dde5d1","resolution":{"observed_at":"2026-08-07T15:30:51.016582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-07T15:26:53.898164Z","title":"Measuring short-form factuality in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:53.898164Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:8b364851db669465dbb169afa6e58fc2313929d7d84ec71565ab43c2b2bb4998","observation_id":"29f35dad-8602-4e0c-91fc-4b05780a2a6c","resolution":{"observed_at":"2026-08-07T15:26:53.898164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-07T15:26:14.383511Z","title":"Measuring short-form factuality in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15242","last_updated":"2025-05-22T06:10:20Z","snapshot_observed_at":"2026-08-19T18:31:45.917541Z","submitted_at":"2025-05-21T08:18:41Z","title":"Adaptive Plan-Execute Framework for Smart Contract Security Auditing","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T15:26:14.383511Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2505.15242"},"observation_digest":"sha256:753d46682981d0b28bceeb3ad99b9a3cdb724acc0afcdd46146a584070940fa7","observation_id":"2769800b-4406-4c1e-8e46-04605919d1df","resolution":{"observed_at":"2026-08-07T15:26:14.383511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-07T14:46:52.150225Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17656","last_updated":"2025-09-08T04:28:15Z","snapshot_observed_at":"2026-08-18T17:50:47.626435Z","submitted_at":"2025-05-23T09:18:56Z","title":"Too Consistent to Detect: A Study of Self-Consistent Errors in LLMs","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:46:52.150225Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2505.17656"},"observation_digest":"sha256:2989bae9753490338ff8214cfe3bdf6cc9933217367f0dff8deaef7eb8fc3034","observation_id":"02815d34-6320-4292-86cb-a907077c71bd","resolution":{"observed_at":"2026-08-07T14:46:52.150225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-07T13:44:27.490649Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21115","last_updated":"2025-05-27T12:35:13Z","snapshot_observed_at":"2026-08-07T13:32:59.101097Z","submitted_at":"2025-05-27T12:35:13Z","title":"Will It Still Be True Tomorrow? Multilingual Evergreen Question Classification to Improve Trustworthy QA","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:44:27.490649Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2505.21115"},"observation_digest":"sha256:507b0dff49f4ec7079a422160fef20557def816f9b3fe15bfb8060f18c2af729","observation_id":"22190d48-0f88-4f5e-bb12-f47a37c0b9ae","resolution":{"observed_at":"2026-08-07T13:44:27.490649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-07T13:32:50.289751Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21409","last_updated":"2025-05-27T16:33:38Z","snapshot_observed_at":"2026-08-21T16:00:14.643292Z","submitted_at":"2025-05-27T16:33:38Z","title":"RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:32:50.289751Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2505.21409"},"observation_digest":"sha256:b4347c405bffc414f317ef70971782327590ba745261b095231aeecc5a70c104","observation_id":"acbd60b6-dba9-4d11-8652-d52550417321","resolution":{"observed_at":"2026-08-07T13:32:50.289751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-07T13:12:58.778096Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22501","last_updated":"2025-05-28T15:50:48Z","snapshot_observed_at":"2026-08-13T12:41:27.197094Z","submitted_at":"2025-05-28T15:50:48Z","title":"EvolveSearch: An Iterative Self-Evolving Search Agent","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:58.778096Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2505.22501"},"observation_digest":"sha256:15204067b893e2915fe2da20ff55fa9c15d24bb24da97848c7452f2c434fa1a5","observation_id":"a1abe4f0-9b5d-4aef-ba9a-c2fba24a4f3d","resolution":{"observed_at":"2026-08-07T13:12:58.778096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-07T12:45:32.707752Z","title":"Measuring short-form factuality in large language models.arXiv preprint CoRR, abs/2411.04368, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23646","last_updated":"2025-05-29T16:53:41Z","snapshot_observed_at":"2026-08-20T06:05:04.363087Z","submitted_at":"2025-05-29T16:53:41Z","title":"Are Reasoning Models More Prone to Hallucination?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:32.707752Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2505.23646"},"observation_digest":"sha256:766ae385ff671c440ff976201a4b4168cc13f0caf2d26aa6c0c401e95270c3be","observation_id":"fc6fa950-9580-4289-92bf-3011befb0c22","resolution":{"observed_at":"2026-08-07T12:45:32.707752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-07T11:58:51.492314Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01114","last_updated":"2025-06-01T18:42:24Z","snapshot_observed_at":"2026-08-23T20:36:29.997428Z","submitted_at":"2025-06-01T18:42:24Z","title":"Reconsidering LLM Uncertainty Estimation Methods in the Wild","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:51.492314Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2506.01114"},"observation_digest":"sha256:a7262b5c0c2f0c56358b0d1da7cb5db8dbd7c228ab6da8c033fe3653a207c27e","observation_id":"fa3b2187-3169-49b8-be3f-f2d630da372e","resolution":{"observed_at":"2026-08-07T11:58:51.492314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-07T11:10:45.669134Z","title":"Measuring short-form factuality in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-20T06:21:39.806874Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.669134Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:f1731fdc9a20e292594be48dbb42ee133142f8b1065125e3e14357facb43a40e","observation_id":"ce2080a2-9371-4e44-8d81-267562a7ef10","resolution":{"observed_at":"2026-08-07T11:10:45.669134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-07T10:27:49.586262Z","title":"Measuring short-form factuality in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05198","last_updated":"2025-06-05T16:10:47Z","snapshot_observed_at":"2026-08-13T00:28:12.353448Z","submitted_at":"2025-06-05T16:10:47Z","title":"Quantifying Cross-Modality Memorization in Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:49.586262Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2506.05198"},"observation_digest":"sha256:1b4027ec15b46dd32eb2b37bdcd5620e47ea5f92f042b3218fb8042a172186e9","observation_id":"b0e4bb2c-45b7-4e5d-8659-41979ecf42d5","resolution":{"observed_at":"2026-08-07T10:27:49.586262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2506.10060","last_updated":"2026-04-17T19:21:30Z","snapshot_observed_at":"2026-08-13T14:26:35.678786Z","submitted_at":"2025-06-11T18:00:00Z","title":"Textual Bayes: Quantifying Prompt Uncertainty in LLM-Based Systems","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-19T09:20:12.827871Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2506.10060"},"observation_digest":"sha256:0bcff37c7478c10133b964c8735024df802d2ca91059b2b01cd5aadcf6ae1051","observation_id":"62e5ed4e-0cb3-4a94-a314-773e22ff5983","resolution":{"observed_at":"2026-05-19T09:22:15.910547Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-07T05:48:18.755967Z","title":"W., Jiao, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11110","last_updated":"2025-06-08T14:08:22Z","snapshot_observed_at":"2026-08-14T14:49:58.241818Z","submitted_at":"2025-06-08T14:08:22Z","title":"AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:18.755967Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2506.11110"},"observation_digest":"sha256:57fa07fb181718cbd23eb7c71b8e25880512adf74a1e2fd03cf548dc699c8a1c","observation_id":"a67319c4-9aba-48ee-a765-8ba08e47cab0","resolution":{"observed_at":"2026-08-07T05:48:18.755967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-08-13T22:06:45.477681Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T09:28:16.189617Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2506.13585"},"observation_digest":"sha256:f52da6510b6e292381d09d3221befaf321694d57f3855c798de148787a597909","observation_id":"aa04c82a-eca2-449a-a320-c53ea51779a6","resolution":{"observed_at":"2026-05-15T06:45:50.345693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-06T23:26:56.940654Z","title":"Measuring short-form factuality in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18096","last_updated":"2025-09-03T15:32:23Z","snapshot_observed_at":"2026-08-15T20:12:18.032530Z","submitted_at":"2025-06-22T16:52:48Z","title":"Deep Research Agents: A Systematic Examination And Roadmap","version":2},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-08-06T23:26:56.940654Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2506.18096"},"observation_digest":"sha256:22e18a7dc35fe24c77d40771320a80d22ae14821206e7ade583cd591390afb41","observation_id":"048aff7e-4691-4cbb-89fe-1d70bc06fde9","resolution":{"observed_at":"2026-08-06T23:26:56.940654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-06T23:28:22.109878Z","title":"Measuring short-form factuality in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18183","last_updated":"2025-07-18T02:39:29Z","snapshot_observed_at":"2026-08-21T21:54:27.000460Z","submitted_at":"2025-06-22T21:46:42Z","title":"Reasoning about Uncertainty: Do Reasoning Models Know When They Don't Know?","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:22.109878Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2506.18183"},"observation_digest":"sha256:bf22c0452dd77d7e3304d6550639e3226f617fc331d17b166ebae8e8f579f170","observation_id":"4089ce7a-91ae-4ff1-a2f0-0ea4f506acc8","resolution":{"observed_at":"2026-08-06T23:28:22.109878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-06T22:04:33.833633Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22760","last_updated":"2025-07-15T00:13:39Z","snapshot_observed_at":"2026-08-15T01:37:02.081937Z","submitted_at":"2025-06-28T05:44:57Z","title":"Jan-nano Technical Report","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:33.833633Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2506.22760"},"observation_digest":"sha256:9494a808b0bf5b73826760a953720f0ca94d79ceda8a60fc14f04f8473a10be8","observation_id":"8a25a484-6c09-4d7d-823c-3e1bdf29f7df","resolution":{"observed_at":"2026-08-06T22:04:33.833633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-06T21:45:00.718465Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23667","last_updated":"2025-06-30T09:44:32Z","snapshot_observed_at":"2026-08-14T05:13:09.494260Z","submitted_at":"2025-06-30T09:44:32Z","title":"L0: Reinforcement Learning to Become General Agents","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:00.718465Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2506.23667"},"observation_digest":"sha256:96abdf00658f39cb31313b1832c972913a215c97dc33744d1b52f0ecf36fc711","observation_id":"e091268f-41eb-4008-bc86-6a39117b640e","resolution":{"observed_at":"2026-08-06T21:45:00.718465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2507.02592","last_updated":"2025-07-03T12:59:07Z","snapshot_observed_at":"2026-08-12T16:37:55.786203Z","submitted_at":"2025-07-03T12:59:07Z","title":"WebSailor: Navigating Super-human Reasoning for Web Agent","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T15:37:09.572241Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2507.02592"},"observation_digest":"sha256:4d5890f63ff6353ce20d665c150cea18982ae6dcfa0ab50658f30e00dad3938c","observation_id":"587eb515-049d-4032-a808-c06af7a2e0ba","resolution":{"observed_at":"2026-05-17T15:37:09.727529Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-06T20:24:27.263615Z","title":"Measuring short-form factuality in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02825","last_updated":"2025-08-07T06:58:08Z","snapshot_observed_at":"2026-08-22T09:27:33.969418Z","submitted_at":"2025-07-03T17:35:31Z","title":"Establishing Best Practices for Building Rigorous Agentic Benchmarks","version":5},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:27.263615Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2507.02825"},"observation_digest":"sha256:9360bde57616ad70b1eb467fce5e5b008010fccb5a61fbdaf63e1086983d10c0","observation_id":"7e007b0c-0b86-4d42-94b7-84dd4f755e1e","resolution":{"observed_at":"2026-08-06T20:24:27.263615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-06T20:25:55.431654Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03120","last_updated":"2025-07-03T18:57:43Z","snapshot_observed_at":"2026-08-17T04:49:42.885026Z","submitted_at":"2025-07-03T18:57:43Z","title":"How Overconfidence in Initial Choices and Underconfidence Under Criticism Modulate Change of Mind in Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:55.431654Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2507.03120"},"observation_digest":"sha256:d00cab427631f4f5fb501ef3106a4da9cc99eb6517b52a890e3e4f36823f16bd","observation_id":"949d3b7c-2feb-468e-ab0e-542558767ab6","resolution":{"observed_at":"2026-08-06T20:25:55.431654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-19T05:48:02.828938Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2507.06261"},"observation_digest":"sha256:af737e33e5690289b214e9818f72bb68dbbf1e68b713e8dba26d6fa5cc044fed","observation_id":"9fbcc871-6593-478b-b69d-5ef38f14d250","resolution":{"observed_at":"2026-05-19T05:52:07.841600Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-06T17:54:17.842336Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09662","last_updated":"2025-07-13T14:51:59Z","snapshot_observed_at":"2026-08-20T12:31:43.651320Z","submitted_at":"2025-07-13T14:51:59Z","title":"Towards Concise and Adaptive Thinking in Large Reasoning Models: A Survey","version":1},"reference_index":199,"source":"arxiv_source","source_observed_at":"2026-08-06T17:54:17.842336Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2507.09662"},"observation_digest":"sha256:6b39f5fbb74f0e6bfac7df3588b1bfe41722ad963982e08511e91ffbcf4c33a6","observation_id":"3c8a7c98-2fc2-429a-84e7-18a47b7acd64","resolution":{"observed_at":"2026-08-06T17:54:17.842336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-06T15:55:42.587682Z","title":"Dai, and Quoc V Le","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-19T12:08:46.453087Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.587682Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:40492e75df644e4420bc42c22802209ac59b72989926d766eb4f06af97885571","observation_id":"aea26196-b430-4ef0-bc43-bcd375bec63c","resolution":{"observed_at":"2026-08-06T15:55:42.587682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-15T17:54:29.262992Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20059","last_updated":"2025-07-26T20:57:24Z","snapshot_observed_at":"2026-08-19T02:18:03.977815Z","submitted_at":"2025-07-26T20:57:24Z","title":"RAG in the Wild: On the (In)effectiveness of LLMs with Mixture-of-Knowledge Retrieval Augmentation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:29.262992Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2507.20059"},"observation_digest":"sha256:b770de4f27166972d6f1323e24aef818731eda14e6aa380afa8796d4e2bdf34e","observation_id":"469bc87b-11d9-4711-8630-64820a91cc2e","resolution":{"observed_at":"2026-08-15T17:54:29.262992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-08-16T14:37:33.548231Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-10T17:49:27.926646Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2507.20534"},"observation_digest":"sha256:59100039cb19a6080e27c9f3a25250ce6f63f2b6b5d00b0f7563f076fa2b3ab3","observation_id":"02b01546-0239-435a-a083-f9976411cbf7","resolution":{"observed_at":"2026-05-15T06:45:50.345693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-06T04:47:25.277099Z","title":"arXiv preprint arXiv:2411.04368 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03054","last_updated":"2025-08-05T03:58:15Z","snapshot_observed_at":"2026-08-21T12:18:56.100349Z","submitted_at":"2025-08-05T03:58:15Z","title":"Beyond Surface-Level Detection: Towards Cognitive-Driven Defense Against Jailbreak Attacks via Meta-Operations Reasoning","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-06T04:47:25.277099Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2508.03054"},"observation_digest":"sha256:82e7ab9e8015d6ed5ad7117957b543acdfe59b842638f9f4fc7dcb2cb8a3fbd9","observation_id":"3d62732f-eedf-4992-90d0-6df84b72ea84","resolution":{"observed_at":"2026-08-06T04:47:25.277099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T22:54:25.574191Z","title":"W.; Jiao, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06225","last_updated":"2025-08-18T12:00:32Z","snapshot_observed_at":"2026-08-19T20:36:06.715982Z","submitted_at":"2025-08-08T11:11:22Z","title":"Overconfidence in LLM-as-a-Judge: Diagnosis and Confidence-Driven Solution","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:25.574191Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2508.06225"},"observation_digest":"sha256:cb3bdfe792c4e48c93c7917da8847e5dc94ff047e10e16ca78ab1d6707064677","observation_id":"7c39e5ee-23a0-4633-9785-eaa81364b574","resolution":{"observed_at":"2026-08-05T22:54:25.574191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-15T17:36:49.146226Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08992","last_updated":"2026-07-26T04:23:36Z","snapshot_observed_at":"2026-08-19T18:24:26.550700Z","submitted_at":"2025-08-12T15:02:16Z","title":"Rethinking Prospect Theory for LLMs: Revealing the Instability of Decision-Making under Epistemic Uncertainty","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T17:36:49.146226Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2508.08992"},"observation_digest":"sha256:d412be3af9fd69572431740b56f017a4b536d9380d7b146108b2e46430075627","observation_id":"ef6ec15e-a4ab-4d7a-8305-06bccb3321e2","resolution":{"observed_at":"2026-08-15T17:36:49.146226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T20:17:12.901494Z","title":"Measuring short-form factuality in large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:12.901494Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:34cd5f9cec73e4dea570605e05cc9890090369b27f90aa7e05818ccccccfa506","observation_id":"914e4dc4-33d4-4f3d-9017-87ea06285be2","resolution":{"observed_at":"2026-08-05T20:17:12.901494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T21:08:06.044958Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13180","last_updated":"2025-08-12T22:52:21Z","snapshot_observed_at":"2026-08-15T23:48:18.492614Z","submitted_at":"2025-08-12T22:52:21Z","title":"Search-Time Data Contamination","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T21:08:06.044958Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2508.13180"},"observation_digest":"sha256:2716bd63f563925a6be272512aac4d9a858f4e0916242a144f3921eadc4d66fc","observation_id":"4aeba49c-029e-42aa-bf11-55bf1c781dce","resolution":{"observed_at":"2026-08-05T21:08:06.044958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T20:18:58.169572Z","title":"Measuring short-form factuality in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-20T15:32:54.766727Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:58.169572Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:4d582c1c22fa77c14cedfea98dfd897c05072c97e7b86b38501462ff1965a1da","observation_id":"2cc5c784-86cf-42bb-8fe8-8a4622da8dc3","resolution":{"observed_at":"2026-08-05T20:18:58.169572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-15T17:20:17.413030Z","title":"Measuring short-form factuality in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.14118","last_updated":"2025-08-18T12:31:55Z","snapshot_observed_at":"2026-08-18T21:48:11.726605Z","submitted_at":"2025-08-18T12:31:55Z","title":"Hallucinations in medical devices","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T17:20:17.413030Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2508.14118"},"observation_digest":"sha256:c98bce41708bc5db4475b9f06bc78a462d2c243bda97e8bc7ea69c97993571d9","observation_id":"c6bd90e3-7244-4700-9910-041f1c89fc39","resolution":{"observed_at":"2026-08-15T17:20:17.413030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-15T17:07:19.840580Z","title":"Measuring short-form factuality in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17580","last_updated":"2025-08-25T01:07:59Z","snapshot_observed_at":"2026-08-17T14:10:52.413869Z","submitted_at":"2025-08-25T01:07:59Z","title":"UQ: Assessing Language Models on Unsolved Questions","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T17:07:19.840580Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2508.17580"},"observation_digest":"sha256:1d61af165b657af8d32c4462e371e90742f8623267f205bee2d58527c69514cc","observation_id":"c9f21bba-2b91-4da7-a383-e50b111deb34","resolution":{"observed_at":"2026-08-15T17:07:19.840580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T16:32:54.645316Z","title":"Measuring short-form factuality in large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18255","last_updated":"2025-09-02T17:12:12Z","snapshot_observed_at":"2026-08-13T15:01:58.323767Z","submitted_at":"2025-08-25T17:45:06Z","title":"Hermes 4 Technical Report","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T16:32:54.645316Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2508.18255"},"observation_digest":"sha256:6461eeef0289fc3dbb9c7817bce2ec5b41a250a3db34944177b0f5b01daba73e","observation_id":"2368bc24-3900-4dc0-b95f-49b04e3dff55","resolution":{"observed_at":"2026-08-05T16:32:54.645316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T10:39:08.083052Z","title":"Measuring short-form factuality in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":231,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:08.083052Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:657b8592ffeb108498cff68c56a9dee8b06a536f5d39555d11fd7ca9a2979d41","observation_id":"9f988073-9cb7-44ec-84ec-b22e5cb22be2","resolution":{"observed_at":"2026-08-05T10:39:08.083052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-04T22:03:02.053966Z","title":"Measuring short-form factuality in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.07571","last_updated":"2025-09-11T02:09:54Z","snapshot_observed_at":"2026-08-17T04:15:32.603336Z","submitted_at":"2025-09-09T10:15:42Z","title":"Towards Generalized Routing: Model and Agent Orchestration for Adaptive and Efficient Inference","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T22:03:02.053966Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2509.07571"},"observation_digest":"sha256:08af7c646d1ae2a022700326176eb1f1fc733e19bc7696c3b26d842815f59ee7","observation_id":"798a97a3-3e8d-496f-93ff-410cba03e8bd","resolution":{"observed_at":"2026-08-04T22:03:02.053966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-04T16:07:43.663112Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":184,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:43.663112Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:7b621b77088fec829709d50a0001e9fb27639dc610efa7c4895c6697cab8a8ac","observation_id":"e905bff6-e959-490e-b8ce-1316b2089016","resolution":{"observed_at":"2026-08-04T16:07:43.663112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2509.21267","last_updated":"2026-04-22T15:37:16Z","snapshot_observed_at":"2026-08-15T02:13:41.066025Z","submitted_at":"2025-09-25T14:58:07Z","title":"Task-Dependent Evaluation of LLM Output Homogenization: A Taxonomy-Guided Framework","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-18T13:34:22.790199Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2509.21267"},"observation_digest":"sha256:e27f940cca9718ff87ea0538ca8826aae09393892d505b66c2b86a019f0469ee","observation_id":"4020a24b-881d-4602-b6f1-a03f5b034ae3","resolution":{"observed_at":"2026-05-18T13:36:24.970158Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-15T15:51:23.756907Z","title":"Measuring short-form factuality in large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.21545","last_updated":"2026-01-31T16:12:10Z","snapshot_observed_at":"2026-08-21T18:28:12.702069Z","submitted_at":"2025-09-25T20:30:15Z","title":"Evidence for Limited Metacognition in LLMs","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T15:51:23.756907Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2509.21545"},"observation_digest":"sha256:c40ff350e03498757ed4aa469d826e970fb4f899c7b805bce6e82eeec7d53282","observation_id":"f5b3aea6-6b39-4bab-8574-fed944a3d09e","resolution":{"observed_at":"2026-08-15T15:51:23.756907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-04T14:43:54.380028Z","title":"Measuring short-form factuality in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.23694","last_updated":"2026-06-03T04:13:57Z","snapshot_observed_at":"2026-08-11T12:32:09.918488Z","submitted_at":"2025-09-28T07:05:17Z","title":"SafeSearch: Automated Red-Teaming of LLM-Based Search Agents","version":6},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:54.380028Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2509.23694"},"observation_digest":"sha256:cac1707159fef646f5fec0f93235605dd53975e4dcaf7e947e4b6c5b5a3156b6","observation_id":"c1364c78-bb7a-499e-8e71-cc8a28e1d0b7","resolution":{"observed_at":"2026-08-04T14:43:54.380028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2509.25868","last_updated":"2026-04-23T15:21:19Z","snapshot_observed_at":"2026-08-13T10:57:06.935268Z","submitted_at":"2025-09-30T07:06:23Z","title":"ReFACT: A Benchmark for Scientific Confabulation Detection with Positional Error Annotations","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-18T12:54:01.717015Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2509.25868"},"observation_digest":"sha256:30f952b9a03c0702addf62d2ed2e9c792f6eca1ccecd9289f3f45d9a83d2c487","observation_id":"fbbefafa-2783-4855-b415-739d359bdbca","resolution":{"observed_at":"2026-05-18T12:56:24.448221Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-04T13:23:15.694081Z","title":"Peter West and Christopher Potts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01171","last_updated":"2026-07-15T22:07:56Z","snapshot_observed_at":"2026-08-19T20:51:54.312491Z","submitted_at":"2025-10-01T17:55:37Z","title":"Verbalized Sampling: How to Mitigate Mode Collapse and Unlock LLM Diversity","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T13:23:15.694081Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2510.01171"},"observation_digest":"sha256:12c7d3f8ebb17173d76918b3eb47ac76a2342620526ca5025de846fcb8e745d4","observation_id":"3ac914c7-b7e5-420e-b1ce-7faa668ab44e","resolution":{"observed_at":"2026-08-04T13:23:15.694081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2510.07926","last_updated":"2026-05-07T16:46:45Z","snapshot_observed_at":"2026-08-09T12:07:52.369507Z","submitted_at":"2025-10-09T08:22:24Z","title":"Comprehensiveness Metrics for Automatic Evaluation of Factual Recall in Text Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T09:18:48.453505Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2510.07926"},"observation_digest":"sha256:3b69a9461086aa97df40322d9ea3f7a02dcea81d0c4a5210c0a86b0a97ad87c0","observation_id":"97876d2a-cfe0-490c-ac01-79b929618d3d","resolution":{"observed_at":"2026-05-18T09:21:10.034000Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2511.02805","last_updated":"2026-05-08T08:08:53Z","snapshot_observed_at":"2026-08-15T19:32:33.773422Z","submitted_at":"2025-11-04T18:27:39Z","title":"MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T00:57:25.902674Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2511.02805"},"observation_digest":"sha256:d336f9ee86521cdb12f8dfaf8af71e933a994efce844b85e03cd6f2d11274fda","observation_id":"f511b76f-0bb3-42c2-b79c-fa37532d1217","resolution":{"observed_at":"2026-05-18T01:00:34.635162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2512.03847","last_updated":"2026-05-06T14:15:19Z","snapshot_observed_at":"2026-08-16T02:48:57.063506Z","submitted_at":"2025-12-03T14:48:38Z","title":"DVPO: Distributional Value Modeling-based Policy Optimization for LLM Post-Training","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-17T01:46:21.744857Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2512.03847"},"observation_digest":"sha256:7c6373f2c4dcbe0d0740a75bf55d0d2a93b06a1324af9e338cba9d6e386c0b63","observation_id":"93d143fb-9a73-43a2-99fa-750dbff1eeb8","resolution":{"observed_at":"2026-05-17T01:48:51.115403Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2512.20182","last_updated":"2026-04-21T04:28:11Z","snapshot_observed_at":"2026-08-11T16:52:38.658500Z","submitted_at":"2025-12-23T09:20:32Z","title":"FaithLens: Detecting and Explaining Faithfulness Hallucination","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T20:44:22.891896Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2512.20182"},"observation_digest":"sha256:985058dd0b35f9d9f3ead1a68392f444fbe6cc283859be659d8ac1a507ebe066","observation_id":"55bdf1dc-13d7-4401-86db-cdc67205a95f","resolution":{"observed_at":"2026-05-16T20:48:32.840198Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-03T09:21:44.748564Z","title":"Measuring short-form factuality in large language models.arXiv preprint arXiv:2411.04368, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.14192","last_updated":"2026-07-03T11:26:58Z","snapshot_observed_at":"2026-08-20T13:01:24.661226Z","submitted_at":"2026-01-20T17:51:56Z","title":"Toward Efficient Agents: Memory, Tool learning, and Planning","version":2},"reference_index":143,"source":"pdf_text","source_observed_at":"2026-08-03T09:21:44.748564Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2601.14192"},"observation_digest":"sha256:15d88f6a617e4b669d9981b7219d1ae1c646deaa467b29732edfdb45229117f6","observation_id":"a7d60c3f-986a-4584-8259-9f8bc4885468","resolution":{"observed_at":"2026-08-03T09:21:44.748564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2602.07892","last_updated":"2026-05-12T03:21:50Z","snapshot_observed_at":"2026-08-11T15:42:35.247968Z","submitted_at":"2026-02-08T09:53:46Z","title":"Safety Alignment as Continual Learning: Mitigating the Alignment Tax via Orthogonal Gradient Projection","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T06:39:17.785715Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2602.07892"},"observation_digest":"sha256:8e5eaca6eafd3e467535b25855d635d39de0a492e9d4fac47e5a6f7cfb4b8e32","observation_id":"6b357cec-c250-49d0-888a-0fc47f7957ec","resolution":{"observed_at":"2026-05-16T06:40:42.368628Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-02T23:23:47.218315Z","title":"What is the condition that caused Erika Nordby to spend two hours without a heartbeat before she was revived?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.14080","last_updated":"2026-06-19T12:35:59Z","snapshot_observed_at":"2026-08-20T04:13:07.845832Z","submitted_at":"2026-02-15T10:13:30Z","title":"Empty Shelves or Lost Keys? Recall Is the Bottleneck for Parametric Factuality","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:47.218315Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2602.14080"},"observation_digest":"sha256:a2c283d355b351ae0c2a90b7e9fa73aca58fb53ee69344952dab533a16b8b5db","observation_id":"a297ef69-a840-4ca6-819d-3cb75e057804","resolution":{"observed_at":"2026-08-02T23:23:47.218315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2602.22480","last_updated":"2026-06-02T16:57:10Z","snapshot_observed_at":"2026-08-16T15:01:30.190840Z","submitted_at":"2026-02-25T23:40:22Z","title":"VeRO: A Harness for Agents to Optimize Agents","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T19:01:50.547095Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2602.22480"},"observation_digest":"sha256:eeaad959a3db00e85c5049a62e381350a3e6995cbbcff2b9c5cf2e03e814ea90","observation_id":"7113c071-720d-410b-98c3-0ac1ed7a4add","resolution":{"observed_at":"2026-05-15T19:06:30.922205Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-02T20:45:12.868399Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.22480","last_updated":"2026-06-02T16:57:10Z","snapshot_observed_at":"2026-08-16T15:01:30.190840Z","submitted_at":"2026-02-25T23:40:22Z","title":"VeRO: A Harness for Agents to Optimize Agents","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T20:45:12.868399Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2602.22480"},"observation_digest":"sha256:909914d68bf856e7b5d13407e07c19569d9e8df844b9e921900ff9ea05b1a5f0","observation_id":"386a46fc-88ef-475e-9678-b9d8aa9a06a8","resolution":{"observed_at":"2026-08-02T20:45:12.868399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2603.04751","last_updated":"2026-04-27T08:53:25Z","snapshot_observed_at":"2026-08-17T00:21:27.533456Z","submitted_at":"2026-03-05T02:56:42Z","title":"Evaluating the Search Agent in a Parallel World","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T17:02:10.963839Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2603.04751"},"observation_digest":"sha256:2d5825a00c6d2eedda82b4a6cf3eeab4385e6fc5c2aa7a9983f7e44d069c0bcf","observation_id":"1b68bec0-229f-4a02-9f4f-391effcf86e5","resolution":{"observed_at":"2026-05-15T17:06:19.298161Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2603.16091","last_updated":"2026-05-16T08:55:03Z","snapshot_observed_at":"2026-08-14T03:08:55.822531Z","submitted_at":"2026-03-17T03:27:25Z","title":"CounterRefine: Answer-Conditioned Counterevidence Retrieval for Inference-Time Knowledge Repair in Factual Question Answering","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T10:43:33.300825Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2603.16091"},"observation_digest":"sha256:093d1258ee3814d6417412b1f102f3f1bf2f8439852f558ce1d25260f201551e","observation_id":"32cf9a80-4bcd-4f27-a22d-0d418fa8025e","resolution":{"observed_at":"2026-05-15T10:45:28.268236Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2603.16091","last_updated":"2026-05-16T08:55:03Z","snapshot_observed_at":"2026-08-14T03:08:55.822531Z","submitted_at":"2026-03-17T03:27:25Z","title":"CounterRefine: Answer-Conditioned Counterevidence Retrieval for Inference-Time Knowledge Repair in Factual Question Answering","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T10:38:10.070691Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2603.16091"},"observation_digest":"sha256:c5e89d28c95249688a461b10db3652e2e24b5bff3deee37145d66fd8189643ab","observation_id":"788adcf4-e859-4442-9671-ee9ca90b2319","resolution":{"observed_at":"2026-05-21T10:40:00.640012Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-20T15:10:15.429694Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:1ab5d93b9b0f6f90f6b5c188b5a8979a0c64ec3eb7bf45cef52198c00fbdf562","observation_id":"a2229f91-e9b7-4dba-96af-229625db583b","resolution":{"observed_at":"2026-05-21T09:44:05.701288Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2604.03044","last_updated":"2026-04-08T07:22:54Z","snapshot_observed_at":"2026-08-13T19:50:25.543992Z","submitted_at":"2026-04-03T13:52:38Z","title":"JoyAI-LLM Flash: Advancing Mid-Scale LLMs with Token Efficiency","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-13T19:26:38.134505Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2604.03044"},"observation_digest":"sha256:37d9a896a4f66910f0a513dce563ec608c24cfeabc9484bb04d1f95c75f46330","observation_id":"4b1d43f9-c86c-4653-a431-9f3582fddad2","resolution":{"observed_at":"2026-05-15T06:45:50.345693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2604.03216","last_updated":"2026-04-03T17:44:32Z","snapshot_observed_at":"2026-08-17T12:22:54.414251Z","submitted_at":"2026-04-03T17:44:32Z","title":"BAS: A Decision-Theoretic Approach to Evaluating Large Language Model Confidence","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-13T19:48:13.133733Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2604.03216"},"observation_digest":"sha256:ad97a727d3f9a6cc039db266a54a7b48084c2b9309f6c7f6fd1a0dc0ef297415","observation_id":"add04dd0-fd88-49ac-be44-615bf3e0d692","resolution":{"observed_at":"2026-05-15T06:45:50.345693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2604.05872","last_updated":"2026-04-07T13:29:34Z","snapshot_observed_at":"2026-08-16T00:23:51.856981Z","submitted_at":"2026-04-07T13:29:34Z","title":"Swiss-Bench 003: Evaluating LLM Reliability and Adversarial Security for Swiss Regulatory Contexts","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T19:44:26.931344Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2604.05872"},"observation_digest":"sha256:c1b32ea444fe23e228d9e3955c8219dc67a149778ba0e3e8a1ab51d2bfc46336","observation_id":"6f1f69cb-644f-4225-a192-52cc1e7c0bac","resolution":{"observed_at":"2026-05-15T06:45:50.345693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-07-13T08:50:25.297894Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.06828","last_updated":"2026-05-25T05:49:49Z","snapshot_observed_at":"2026-08-14T11:03:52.110197Z","submitted_at":"2026-04-08T08:44:48Z","title":"A 4.5-s Quasiperiodic Spectral Oscillation in GRB 230307A: Evidence for Free Precession of a Post-Merger Magnetar?","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T08:50:25.297894Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2604.06828"},"observation_digest":"sha256:9beafa4f9c351ae6ebbafd2a20a266943a3f944caf4fcb28c58c40ff71f5e328","observation_id":"229362ad-4062-43b4-8c5e-90a43240ac8c","resolution":{"observed_at":"2026-07-13T08:50:25.297894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2604.06829","last_updated":"2026-04-09T12:10:27Z","snapshot_observed_at":"2026-07-06T22:55:15.791334Z","submitted_at":"2026-04-08T08:47:31Z","title":"WRAP++: Web discoveRy Amplified Pretraining","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T17:23:14.376066Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2604.06829"},"observation_digest":"sha256:cc771f319d3345e6ccbbbe30aeec4cd66654b35e20d42af3565d723873fe6232","observation_id":"5238890d-d710-452f-9bb8-ca9e4d8c3946","resolution":{"observed_at":"2026-05-15T06:45:50.345693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2604.07927","last_updated":"2026-04-28T06:09:15Z","snapshot_observed_at":"2026-08-17T00:58:44.132273Z","submitted_at":"2026-04-09T07:47:31Z","title":"EigentSearch-Q+: Enhancing Deep Research Agents with Structured Reasoning Tools","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T18:36:45.297356Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2604.07927"},"observation_digest":"sha256:0b6db18a4f67d558b77f4e2f10087871a13b87e4ef29e1f8e954191403191424","observation_id":"723a4754-b539-4ee9-bc35-f07de6b59ffe","resolution":{"observed_at":"2026-05-15T06:45:50.345693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2604.08519","last_updated":"2026-04-09T17:55:50Z","snapshot_observed_at":"2026-08-12T23:12:37.728031Z","submitted_at":"2026-04-09T17:55:50Z","title":"Cram Less to Fit More: Training Data Pruning Improves Memorization of Facts","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-10T17:42:31.465077Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2604.08519"},"observation_digest":"sha256:54430d4c28c9ca1830b83fdba9c524ab836f701e408ff5e8f72328c8d75dfcef","observation_id":"2ae13732-9bc1-4e47-80d3-7f75f4dc0e1e","resolution":{"observed_at":"2026-05-15T06:45:50.345693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2604.10401","last_updated":"2026-04-20T21:15:23Z","snapshot_observed_at":"2026-08-11T17:58:35.857496Z","submitted_at":"2026-04-12T01:19:55Z","title":"NameBERT: Scaling Name-Based Nationality Classification with LLM-Augmented Open Academic Data","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T16:39:06.587762Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2604.10401"},"observation_digest":"sha256:1cdd0c8614f5d2ba1246016783b3b79c5f4e240a5da39cc3660ee4869d6c1a41","observation_id":"fde4d85a-3be9-45c8-b692-2c6466ec65b3","resolution":{"observed_at":"2026-05-15T06:45:50.345693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2604.14256","last_updated":"2026-04-15T15:01:36Z","snapshot_observed_at":"2026-08-15T00:53:33.396881Z","submitted_at":"2026-04-15T15:01:36Z","title":"Evaluation of Agents under Simulated AI Marketplace Dynamics","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-10T12:33:04.984953Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2604.14256"},"observation_digest":"sha256:887f49709545209ae85c99dbf8e5d2ff9bad5c24ee3d11f2524ffd4713b890d3","observation_id":"ef92f343-9186-4aa2-9ca9-cc9c782cc1c9","resolution":{"observed_at":"2026-05-15T06:45:50.345693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2604.14324","last_updated":"2026-04-15T18:28:34Z","snapshot_observed_at":"2026-08-11T08:50:43.594110Z","submitted_at":"2026-04-15T18:28:34Z","title":"Purging the Gray Zone: Latent-Geometric Denoising for Precise Knowledge Boundary Awareness","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T13:50:25.128014Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2604.14324"},"observation_digest":"sha256:889e8bc61632480449919d4853e4e8d2e1b596982f59c75db3acfbdfbedeabf7","observation_id":"028e7c5d-9756-45f9-a819-3c3b406f4482","resolution":{"observed_at":"2026-05-15T06:45:50.345693Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2604.15022","last_updated":"2026-04-16T13:51:48Z","snapshot_observed_at":"2026-08-13T09:42:24.415928Z","submitted_at":"2026-04-16T13:51:48Z","title":"Route to Rome Attack: Directing LLM Routers to Expensive Models via Adversarial Suffix Optimization","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-10T10:57:25.591595Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2604.15022"},"observation_digest":"sha256:ede562938b55819180baa9733b65ac812e2ea2823b02d1eda1db4330e39e4747","observation_id":"9482e1b5-5561-4b94-a68c-53a3a6ac47a5","resolution":{"observed_at":"2026-05-15T06:45:50.345693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2604.17112","last_updated":"2026-04-18T19:00:27Z","snapshot_observed_at":"2026-08-17T18:05:17.720999Z","submitted_at":"2026-04-18T19:00:27Z","title":"Complementing Self-Consistency with Cross-Model Disagreement for Uncertainty Quantification","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T06:29:24.974157Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2604.17112"},"observation_digest":"sha256:35ddff56f368fdc7958762e5a92e1513439596a2c3a65be9d0a0e32814051b01","observation_id":"f5489cfc-c2c2-4505-be68-a2ec1ca315ca","resolution":{"observed_at":"2026-05-15T06:45:50.345693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2604.18473","last_updated":"2026-04-20T16:24:41Z","snapshot_observed_at":"2026-08-14T20:51:20.111244Z","submitted_at":"2026-04-20T16:24:41Z","title":"Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-10T05:52:28.822723Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2604.18473"},"observation_digest":"sha256:e61dfa7b7244a2ec81371aee1c8cc8e1123a56e305dd76e568b21b4ef6db7a27","observation_id":"5ee285da-fd08-480d-8e6a-cbff23dd7b43","resolution":{"observed_at":"2026-05-15T06:45:50.345693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2605.07153","last_updated":"2026-05-08T02:40:12Z","snapshot_observed_at":"2026-08-17T01:28:33.294518Z","submitted_at":"2026-05-08T02:40:12Z","title":"Beyond Reasoning: Reinforcement Learning Unlocks Parametric Knowledge in LLMs","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-11T01:26:21.545889Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2605.07153"},"observation_digest":"sha256:cdecce299b2b1b719aa61583a5afe1e4f12d3b34497159df329d700c15910083","observation_id":"5b4f3514-d817-4d72-941f-a328a3f31c3f","resolution":{"observed_at":"2026-05-15T06:45:50.345693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2605.08942","last_updated":"2026-05-09T13:22:47Z","snapshot_observed_at":"2026-08-17T14:03:49.374360Z","submitted_at":"2026-05-09T13:22:47Z","title":"Decomposing and Steering Functional Metacognition in Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T02:57:09.180530Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2605.08942"},"observation_digest":"sha256:bd3b1b6135a0c0a8a42a15e1310f451d1042f11c22e9d320bb79e1991c556229","observation_id":"8e7acf7a-549b-4526-87ad-78e0b6b4aa1a","resolution":{"observed_at":"2026-05-15T06:45:50.345693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2605.10442","last_updated":"2026-05-12T10:07:26Z","snapshot_observed_at":"2026-08-20T12:25:19.347451Z","submitted_at":"2026-05-11T12:12:28Z","title":"StereoTales: A Multilingual Framework for Open-Ended Stereotype Discovery in LLMs","version":1},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-05-12T04:50:17.399580Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2605.10442"},"observation_digest":"sha256:9a475326b1064c095c50f29434d7403f65e971dcf7e4082ee8466ebfac90ede0","observation_id":"a57e9cde-7286-4fc0-ba53-d4e9438e3776","resolution":{"observed_at":"2026-05-15T06:45:50.345693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2605.10442","last_updated":"2026-05-12T10:07:26Z","snapshot_observed_at":"2026-08-20T12:25:19.347451Z","submitted_at":"2026-05-11T12:12:28Z","title":"StereoTales: A Multilingual Framework for Open-Ended Stereotype Discovery in LLMs","version":2},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-05-13T07:20:32.494840Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2605.10442"},"observation_digest":"sha256:fdf89f0e645d0239b75d0283cdac32933f6a918b5e9cf4268d318f3132c5a38e","observation_id":"a6656881-6328-40e3-83a1-43915dcbad09","resolution":{"observed_at":"2026-05-15T06:45:50.345693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2605.10530","last_updated":"2026-05-11T13:14:54Z","snapshot_observed_at":"2026-08-16T10:44:18.075102Z","submitted_at":"2026-05-11T13:14:54Z","title":"Personalized Deep Research: A User-Centric Framework, Dataset, and Hybrid Evaluation for Knowledge Discovery","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T04:55:22.596920Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2605.10530"},"observation_digest":"sha256:07431eb29564dfd163542367786be140ac7f37916256951a517bd99ac9c16846","observation_id":"8b047e32-67c3-40f2-9d40-2476e6d911a7","resolution":{"observed_at":"2026-05-15T06:45:50.345693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2605.15102","last_updated":"2026-05-14T17:20:14Z","snapshot_observed_at":"2026-08-21T10:27:34.348412Z","submitted_at":"2026-05-14T17:20:14Z","title":"Improving Multi-turn Dialogue Consistency with Self-Recall Thinking","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T20:22:11.252657Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2605.15102"},"observation_digest":"sha256:1669c14bc5f395283c587428f2ed0304075fbc1aa724dcf45edd6cc55af1b093","observation_id":"0c08e022-3462-46bc-86c8-7584a815ff6a","resolution":{"observed_at":"2026-06-30T20:25:02.538160Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2605.15206","last_updated":"2026-05-01T14:45:37Z","snapshot_observed_at":"2026-08-17T08:25:36.072817Z","submitted_at":"2026-05-01T14:45:37Z","title":"AgentStop: Terminating Local AI Agents Early to Save Energy in Consumer Devices","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-19T16:36:02.233255Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2605.15206"},"observation_digest":"sha256:10de9f9b10af1b309aae243469eee5e28377f5f017d1b8e6bf513c20e7f59470","observation_id":"33c0abc2-b2b2-4c64-a5b4-055b5769488f","resolution":{"observed_at":"2026-05-19T16:37:39.619062Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:15.256277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.04368/citation-record","integrity":"/paper/2411.04368/integrity","json":"/paper/2411.04368/citation-record.json","paper":"/paper/2411.04368"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.18248","last_updated":"2024-03-20T13:12:48Z","snapshot_observed_at":"2026-08-16T15:28:36.298813Z","submitted_at":"2023-05-29T17:12:03Z","title":"Do Language Models Know When They're Hallucinating References?","version":3},"cited_work":{"arxiv_id":"2305.18248","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.18248","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2305.18248 , year=","venue":null,"work_id":"9eeaa979-72cb-4989-b9c7-8b50900f3647","year":2023},"citing_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-15T06:45:50.219157Z"},"links":{"cited_paper":"/paper/2305.18248","citing_paper":"/paper/2411.04368"},"observation_digest":"sha256:51468c23346af8b1c87bcba334f7730bbf4eb598dba61a3cb8196697b68d9a3e","observation_id":"b073f0d9-5944-412f-9adf-8a89a7b45b32","resolution":{"observed_at":"2026-05-15T06:45:50.241868Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Anthropic","venue":null,"work_id":"613d427d-70ca-468a-a12f-43da8b7df476","year":2024},"citing_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-15T06:45:50.219157Z"},"links":{"citing_paper":"/paper/2411.04368"},"observation_digest":"sha256:6b337160253fa4c92156b66c895461effa9a8a12b25f37f33a36d85a63965271","observation_id":"db243db8-6c9c-4349-a301-7f9cb93a2cbb","resolution":{"observed_at":"2026-05-15T06:45:50.313374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03368","last_updated":"2023-10-25T07:49:37Z","snapshot_observed_at":"2026-08-16T16:17:38.527206Z","submitted_at":"2023-10-05T07:57:09Z","title":"Evaluating Hallucinations in Chinese Large Language Models","version":4},"cited_work":{"arxiv_id":"2310.03368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03368","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluating hallucinations in chinese large language models","venue":null,"work_id":"27f57922-254f-4edb-9365-44ba354e34b2","year":2023},"citing_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-15T06:45:50.219157Z"},"links":{"cited_paper":"/paper/2310.03368","citing_paper":"/paper/2411.04368"},"observation_digest":"sha256:0333fe3d0772e8470124607e05d5f6d52b9d85ec405e63aa16bf9aa10b130310","observation_id":"e7946d0d-d737-409a-9651-ab722df88e72","resolution":{"observed_at":"2026-05-15T06:45:50.302052Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.03551","last_updated":"2017-05-13T21:12:37Z","snapshot_observed_at":"2026-08-13T08:58:47.096400Z","submitted_at":"2017-05-09T21:35:07Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","version":2},"cited_work":{"arxiv_id":"1705.03551","doi":"10.48550/arxiv.1705.03551","metadata_source":"pith","pith_arxiv_id":"1705.03551","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","venue":"cs.CL","work_id":"f20e62ba-6265-4b97-aa8c-ddefaf2f5762","year":2017},"citing_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-15T06:45:50.219157Z"},"links":{"cited_paper":"/paper/1705.03551","citing_paper":"/paper/2411.04368"},"observation_digest":"sha256:3efa2061284f20757b173012320d0daa5afab63ef3ad213202b93dd8cf35c1a5","observation_id":"39e907eb-f1fa-420d-9054-080ae0e0ce06","resolution":{"observed_at":"2026-05-15T06:45:50.309098Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-14T05:42:29.067319Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":"2207.05221","doi":"10.1145/3618260.3649777","metadata_source":"pith","pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Models (Mostly) Know What They Know","venue":"cs.CL","work_id":"8ca58a10-da41-4f70-baae-7e449512e345","year":2022},"citing_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-15T06:45:50.219157Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2411.04368"},"observation_digest":"sha256:0fc5ed95c092bca9c4e1a4d823d8fb35c5e917eedaac194ace95553ca2178df2","observation_id":"6799a419-3a33-45e1-9eb7-41b49cee82ca","resolution":{"observed_at":"2026-05-15T06:45:50.247729Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:53:13.382372+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:53:13.382372+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bde9b5ae-37a1-4bc9-a399-4e90ad18f3fe","year":2024},"citing_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-15T06:45:50.219157Z"},"links":{"citing_paper":"/paper/2411.04368"},"observation_digest":"sha256:d49b77e31e24ad4571c3902c5750d6b5c6296562a361acf8ba1de28b1eedecb9","observation_id":"f1c95610-5e4f-4f56-82b0-251e11647666","resolution":{"observed_at":"2026-05-15T06:45:50.330120Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12941","last_updated":"2025-01-24T19:23:15Z","snapshot_observed_at":"2026-08-19T16:36:17.445569Z","submitted_at":"2024-09-19T17:52:07Z","title":"Fact, Fetch, and Reason: A Unified Evaluation of Retrieval-Augmented Generation","version":3},"cited_work":{"arxiv_id":"2409.12941","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.12941","snapshot_observed_at":"2026-07-03T05:57:41.611759Z","title":"Fact, fetch, and reason: A unified evaluation of retrieval-augmented generation","venue":null,"work_id":"4290e6fd-208d-4ebf-9b27-60cef2eb6f04","year":2024},"citing_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-15T06:45:50.219157Z"},"links":{"cited_paper":"/paper/2409.12941","citing_paper":"/paper/2411.04368"},"observation_digest":"sha256:25e60cb8572084062ff29ddf461028c3f48e4e21cb925d7f34952bef70a23649","observation_id":"ed2ca68b-042e-41d5-bc2f-332a8fd42f93","resolution":{"observed_at":"2026-05-15T06:45:50.254884Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kwiatkowski, J","venue":null,"work_id":"4d86a550-7d92-43d2-98a8-bf0b323f6d99","year":2019},"citing_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-15T06:45:50.219157Z"},"links":{"citing_paper":"/paper/2411.04368"},"observation_digest":"sha256:a9abc5aab34e6d274be9adec8e55777e587b54eab5b81978ce43cdfb32746578","observation_id":"bde3cc3d-94ff-426a-89e5-9b645bf69cef","resolution":{"observed_at":"2026-05-15T06:45:50.339191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11747","last_updated":"2023-10-23T01:49:32Z","snapshot_observed_at":"2026-08-19T06:07:46.029387Z","submitted_at":"2023-05-19T15:36:27Z","title":"HaluEval: A Large-Scale Hallucination Evaluation Benchmark for Large Language Models","version":3},"cited_work":{"arxiv_id":"2305.11747","doi":"10.48550/arxiv.2305.11747","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.11747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2305.11747 (2023)","venue":"arXiv (Cornell University)","work_id":"2cf6bc2d-aed3-4a58-879e-daf0de687940","year":2023},"citing_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-15T06:45:50.219157Z"},"links":{"cited_paper":"/paper/2305.11747","citing_paper":"/paper/2411.04368"},"observation_digest":"sha256:f9a22911251c9bb7290b1abcde9639e41684e030234fe51f0b01f35ef478e548","observation_id":"d3b46f2b-f045-40d8-9e11-be3075ccf31c","resolution":{"observed_at":"2026-05-15T06:45:50.262718Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c76d6685-00c9-4291-8445-9f4e3a62e947","year":2022},"citing_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-15T06:45:50.219157Z"},"links":{"citing_paper":"/paper/2411.04368"},"observation_digest":"sha256:091f660700403c38b9b1b2439f90b936a4ff0ce96514d0d409352001e3a68c88","observation_id":"ac5c9d88-26cb-4779-99f6-4ab53a4d63d8","resolution":{"observed_at":"2026-05-15T06:45:50.317471Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14334","last_updated":"2022-06-13T05:04:53Z","snapshot_observed_at":"2026-08-09T23:45:38.167954Z","submitted_at":"2022-05-28T05:02:31Z","title":"Teaching Models to Express Their Uncertainty in Words","version":2},"cited_work":{"arxiv_id":"2205.14334","doi":"10.1093/jamiaopen/ooaf058","metadata_source":"pith","pith_arxiv_id":"2205.14334","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Teaching Models to Express Their Uncertainty in Words","venue":"cs.CL","work_id":"5dfa654a-4d1b-41c5-a6e0-769ffe4b7741","year":2022},"citing_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-15T06:45:50.219157Z"},"links":{"cited_paper":"/paper/2205.14334","citing_paper":"/paper/2411.04368"},"observation_digest":"sha256:6e6183b10faac75cc1d281cb369de8c5b1808fde78273d76738294ca91349c99","observation_id":"70495176-badf-4cfd-ac03-e572429f0681","resolution":{"observed_at":"2026-05-16T17:36:08.649609Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-10T17:38:07.241875+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T17:38:07.241875+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"be5cd53b-0f46-4204-a7d2-583294c01b25","year":2023},"citing_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-15T06:45:50.219157Z"},"links":{"citing_paper":"/paper/2411.04368"},"observation_digest":"sha256:1f7d27b2ef70e63f840d86801df9b8884620c3906262ad1c0c3bcb8ea0b5d412","observation_id":"ae740448-1b5c-44fa-af53-df06ce47ebbf","resolution":{"observed_at":"2026-05-15T06:45:50.326041Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hello gpt-4o, 2024 a","venue":null,"work_id":"508bebfc-993e-4d1e-b50d-076171e352c3","year":2024},"citing_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-15T06:45:50.219157Z"},"links":{"citing_paper":"/paper/2411.04368"},"observation_digest":"sha256:a0c6570c4946c749d887cb4b33884f8ec41e03c5f5613372933b7b362f33a604","observation_id":"5b06c113-8476-44f4-8286-ce49947e43a6","resolution":{"observed_at":"2026-05-15T06:45:50.334798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openai o1-mini, 2024 b","venue":null,"work_id":"0d416ae4-fd8f-48c5-bdd9-9384e00c1b99","year":2024},"citing_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-15T06:45:50.219157Z"},"links":{"citing_paper":"/paper/2411.04368"},"observation_digest":"sha256:ee798d3cb0eaea6b86042470dc44a8f574938b642312e6b5c3f67bc46a0dd7a7","observation_id":"da15d8a0-8180-4e76-89d1-a37120a204da","resolution":{"observed_at":"2026-05-15T06:45:50.343851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to reason with llms, 2024 c","venue":null,"work_id":"a6409d9a-bb73-4b22-90f6-085455d8ba0a","year":2024},"citing_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-15T06:45:50.219157Z"},"links":{"citing_paper":"/paper/2411.04368"},"observation_digest":"sha256:8d2ae9d7cb180c232e6a7f4ba9d4afaf17531a543c2517d003ff656df3a465da","observation_id":"c6c47803-e762-410b-a0ed-a6e74bc60ae2","resolution":{"observed_at":"2026-05-15T06:45:50.321566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03214","last_updated":"2023-11-22T07:28:19Z","snapshot_observed_at":"2026-08-16T14:54:57.775475Z","submitted_at":"2023-10-05T00:04:12Z","title":"FreshLLMs: Refreshing Large Language Models with Search Engine Augmentation","version":2},"cited_work":{"arxiv_id":"2310.03214","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.03214","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wei, Jason Wei, Chris Tar, Yun-Hsuan Sung, Denny Zhou, Quoc V","venue":null,"work_id":"6f667ea1-a35e-4958-9e12-c4daaff8e3a3","year":2023},"citing_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-15T06:45:50.219157Z"},"links":{"cited_paper":"/paper/2310.03214","citing_paper":"/paper/2411.04368"},"observation_digest":"sha256:adf2dd3bda6b7ac1d27d977df340e57c4faa7a472932e79c8dfc1784a6f6e806","observation_id":"1437c2c2-9997-49b4-80fa-c6512fe92af5","resolution":{"observed_at":"2026-05-15T06:45:50.275719Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-08-16T01:49:22.176843Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":"2203.11171","doi":"10.1101/2025.04.03.646459","metadata_source":"pith","pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","venue":"cs.CL","work_id":"8c6d5a6b-b5cc-4105-9c84-9c34bb9375bb","year":2022},"citing_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-15T06:45:50.219157Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2411.04368"},"observation_digest":"sha256:611b2225fe832737ba1805e5f392064098e6a7288aaaf2eb2bcd174b9e740c13","observation_id":"9470a51c-6d82-44e1-9256-b44614e48517","resolution":{"observed_at":"2026-05-15T06:45:50.282772Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18802","last_updated":"2024-11-07T03:14:38Z","snapshot_observed_at":"2026-08-19T15:09:21.692133Z","submitted_at":"2024-03-27T17:48:55Z","title":"Long-form factuality in large language models","version":4},"cited_work":{"arxiv_id":"2403.18802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.18802","snapshot_observed_at":"2026-06-30T06:44:18.784391Z","title":"Yang, Z., Qi, P., Zhang, S., Bengio, Y ., Cohen, W","venue":null,"work_id":"7729c367-1948-46b8-998b-0d5dc60bdbfc","year":2026},"citing_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-15T06:45:50.219157Z"},"links":{"cited_paper":"/paper/2403.18802","citing_paper":"/paper/2411.04368"},"observation_digest":"sha256:66262aae29bea5f2786f26e8cd0f036908bcfd566cb2c9385d8d05fe557280ec","observation_id":"06b1d0f2-7278-4747-b188-f7c739200a4b","resolution":{"observed_at":"2026-05-15T06:45:50.288896Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00741","last_updated":"2023-11-28T08:06:53Z","snapshot_observed_at":"2026-08-16T14:56:05.367320Z","submitted_at":"2023-10-01T17:37:31Z","title":"FELM: Benchmarking Factuality Evaluation of Large Language Models","version":2},"cited_work":{"arxiv_id":"2310.00741","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00741","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c7245179-22af-48e6-8840-e1777641152e","year":2023},"citing_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-15T06:45:50.219157Z"},"links":{"cited_paper":"/paper/2310.00741","citing_paper":"/paper/2411.04368"},"observation_digest":"sha256:e7c709804dd8c7af5215b321d425e4003e03c014dc9c3e1e1a5639a232b60f34","observation_id":"f67ea904-82ad-45f6-96fe-888ce408dc48","resolution":{"observed_at":"2026-05-15T06:45:50.295212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":11,"verified_fuzzy":5},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 100 inbound Pith citation observations for arXiv:2411.04368."}