{"as_of":"2026-08-14T23:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f94eb872aceeb9fe015eaa54e2a57a5a70b6f8c51c8ce5ef999a64a5513a0384","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:25:29.592100Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.14465/citation-record","integrity":"/paper/2411.14465/integrity","json":"/paper/2411.14465/citation-record.json","paper":"/paper/2411.14465"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T18:25:29.427259Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14465","last_updated":"2024-11-18T13:42:13Z","snapshot_observed_at":"2026-08-12T18:19:42.120826Z","submitted_at":"2024-11-18T13:42:13Z","title":"Testing Uncertainty of Large Language Models for Physics Knowledge and Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T18:25:29.427259Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.14465"},"observation_digest":"sha256:fa52d3dbe42254e636e117320d40283572b0ff28298ad568334580a6490bc5cc","observation_id":"4600111c-2c87-48d9-ad79-84889fd50a87","resolution":{"observed_at":"2026-08-12T18:25:29.427259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:25:30.165663Z","title":"Chatgpt for good? on opportunities and challenges of large language models for education","venue":null,"work_id":"4ed8151e-935c-452f-8ff0-022204ca0e63","year":2023},"citing_paper":{"arxiv_id":"2411.14465","last_updated":"2024-11-18T13:42:13Z","snapshot_observed_at":"2026-08-12T18:19:42.120826Z","submitted_at":"2024-11-18T13:42:13Z","title":"Testing Uncertainty of Large Language Models for Physics Knowledge and Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T18:25:29.435011Z"},"links":{"citing_paper":"/paper/2411.14465"},"observation_digest":"sha256:726a849fbd944afde5eb4df0f00fc14146af24b5bafa9ba090bf858ddc0a4f30","observation_id":"b8684832-095d-4f2d-9fc1-b61bda01eb1b","resolution":{"observed_at":"2026-08-12T18:25:30.173556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13304","last_updated":"2023-06-23T05:43:28Z","snapshot_observed_at":"2026-08-14T11:35:22.482463Z","submitted_at":"2023-06-23T05:43:28Z","title":"ToolQA: A Dataset for LLM Question Answering with External Tools","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13304","snapshot_observed_at":"2026-08-12T18:25:29.443523Z","title":"Toolqa: A dataset for llm question answering with external tools, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14465","last_updated":"2024-11-18T13:42:13Z","snapshot_observed_at":"2026-08-12T18:19:42.120826Z","submitted_at":"2024-11-18T13:42:13Z","title":"Testing Uncertainty of Large Language Models for Physics Knowledge and Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T18:25:29.443523Z"},"links":{"cited_paper":"/paper/2306.13304","citing_paper":"/paper/2411.14465"},"observation_digest":"sha256:1953ef3983ee8a60e9ee3c67278d9a445b70247314e0273e0b7aabb3562fefb2","observation_id":"e74afaba-005e-442f-af42-92dbc6dc0cc8","resolution":{"observed_at":"2026-08-12T18:25:29.443523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05374","last_updated":"2024-03-21T00:21:14Z","snapshot_observed_at":"2026-08-02T17:09:20.540788Z","submitted_at":"2023-08-10T06:43:44Z","title":"Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05374","snapshot_observed_at":"2026-08-12T18:25:29.449303Z","title":"Trustworthy llms: a survey and 6 guideline for evaluating large language models’ alignment, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14465","last_updated":"2024-11-18T13:42:13Z","snapshot_observed_at":"2026-08-12T18:19:42.120826Z","submitted_at":"2024-11-18T13:42:13Z","title":"Testing Uncertainty of Large Language Models for Physics Knowledge and Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T18:25:29.449303Z"},"links":{"cited_paper":"/paper/2308.05374","citing_paper":"/paper/2411.14465"},"observation_digest":"sha256:b37b54f93e0ffcbd57ad74bf10df0ce0301b30359eccd5098e337499ab591a41","observation_id":"5a3dfee9-d56d-4605-a5c6-7816ba5bd52c","resolution":{"observed_at":"2026-08-12T18:25:29.449303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:25:29.456398Z","title":"Detecting hallucinations in large language models using semantic entropy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14465","last_updated":"2024-11-18T13:42:13Z","snapshot_observed_at":"2026-08-12T18:19:42.120826Z","submitted_at":"2024-11-18T13:42:13Z","title":"Testing Uncertainty of Large Language Models for Physics Knowledge and Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T18:25:29.456398Z"},"links":{"citing_paper":"/paper/2411.14465"},"observation_digest":"sha256:a2f856100e3ff7ac58c28b5762decd41f3ef4a24b7ce527d715433918598f519","observation_id":"c5f820b0-d019-4e1b-989f-db6572011f0a","resolution":{"observed_at":"2026-08-12T18:25:29.456398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:25:30.126064Z","title":"Lm-polygraph: Uncertainty estimation for language models,","venue":null,"work_id":"5267e9b1-24ee-47fe-a8a6-7a34f31c9cf9","year":null},"citing_paper":{"arxiv_id":"2411.14465","last_updated":"2024-11-18T13:42:13Z","snapshot_observed_at":"2026-08-12T18:19:42.120826Z","submitted_at":"2024-11-18T13:42:13Z","title":"Testing Uncertainty of Large Language Models for Physics Knowledge and Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T18:25:29.462320Z"},"links":{"citing_paper":"/paper/2411.14465"},"observation_digest":"sha256:a2ec5bedbecff610b6ec86bf13b130a4af540d6da29918478fddbd8d6d13cce1","observation_id":"0a093ec3-68f0-4289-916d-6342f071fd12","resolution":{"observed_at":"2026-08-12T18:25:30.132142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:25:30.101877Z","title":"Aleatoric and epistemic uncertainty in machine learning: an introduction to concepts and methods","venue":null,"work_id":"04db3295-08eb-4e69-a047-f0c341cc2061","year":null},"citing_paper":{"arxiv_id":"2411.14465","last_updated":"2024-11-18T13:42:13Z","snapshot_observed_at":"2026-08-12T18:19:42.120826Z","submitted_at":"2024-11-18T13:42:13Z","title":"Testing Uncertainty of Large Language Models for Physics Knowledge and Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T18:25:29.474172Z"},"links":{"citing_paper":"/paper/2411.14465"},"observation_digest":"sha256:6d445bfdcbeebbade501516b9f8356b7e8e91aec552abf23889a0f7cefb518c9","observation_id":"d0152708-11ae-435b-86e7-19f7de06d2a6","resolution":{"observed_at":"2026-08-12T18:25:30.109603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03342","last_updated":"2022-01-18T23:54:07Z","snapshot_observed_at":"2026-08-14T18:46:51.678035Z","submitted_at":"2021-07-07T16:39:28Z","title":"A Survey of Uncertainty in Deep Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03342","snapshot_observed_at":"2026-08-12T18:25:29.487148Z","title":"A survey of uncertainty in deep neural networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14465","last_updated":"2024-11-18T13:42:13Z","snapshot_observed_at":"2026-08-12T18:19:42.120826Z","submitted_at":"2024-11-18T13:42:13Z","title":"Testing Uncertainty of Large Language Models for Physics Knowledge and Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T18:25:29.487148Z"},"links":{"cited_paper":"/paper/2107.03342","citing_paper":"/paper/2411.14465"},"observation_digest":"sha256:647dba100023bc8462f9ff3995c1f00eeca7b00bb672d19a38d65f7541111b55","observation_id":"cb08ddf2-89ec-42e2-82b8-c532ce921e01","resolution":{"observed_at":"2026-08-12T18:25:29.487148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:25:30.080309Z","title":"Rajendra Acharya, Vladimir Makarenkov, and Saeid Nahavandi","venue":null,"work_id":"468a3e30-5dc9-459f-abfb-336544c94214","year":null},"citing_paper":{"arxiv_id":"2411.14465","last_updated":"2024-11-18T13:42:13Z","snapshot_observed_at":"2026-08-12T18:19:42.120826Z","submitted_at":"2024-11-18T13:42:13Z","title":"Testing Uncertainty of Large Language Models for Physics Knowledge and Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T18:25:29.495352Z"},"links":{"citing_paper":"/paper/2411.14465"},"observation_digest":"sha256:ae9e051e603c3b614d03614a0afcc5da1c0fe626c1b7ff20d344875722425da2","observation_id":"55368e46-ac2c-4210-9050-f37a335fc13c","resolution":{"observed_at":"2026-08-12T18:25:30.089055Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17752","last_updated":"2024-05-23T13:32:25Z","snapshot_observed_at":"2026-08-13T00:44:39.112959Z","submitted_at":"2024-03-26T14:43:48Z","title":"Can multiple-choice questions really be useful in detecting the abilities of LLMs?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17752","snapshot_observed_at":"2026-08-12T18:25:29.502140Z","title":"Can multiple- choice questions really be useful in detecting the abilities of llms?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14465","last_updated":"2024-11-18T13:42:13Z","snapshot_observed_at":"2026-08-12T18:19:42.120826Z","submitted_at":"2024-11-18T13:42:13Z","title":"Testing Uncertainty of Large Language Models for Physics Knowledge and Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T18:25:29.502140Z"},"links":{"cited_paper":"/paper/2403.17752","citing_paper":"/paper/2411.14465"},"observation_digest":"sha256:924febb7f52672fcdf73c802754577423a2145d2943ded4f21c0e21c38920d58","observation_id":"0f1572fb-58d2-4404-b373-e182d292856e","resolution":{"observed_at":"2026-08-12T18:25:29.502140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:25:29.511370Z","title":"Uncertainty in deep learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.14465","last_updated":"2024-11-18T13:42:13Z","snapshot_observed_at":"2026-08-12T18:19:42.120826Z","submitted_at":"2024-11-18T13:42:13Z","title":"Testing Uncertainty of Large Language Models for Physics Knowledge and Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T18:25:29.511370Z"},"links":{"citing_paper":"/paper/2411.14465"},"observation_digest":"sha256:90de161ff47113cbb4532b9ec88b3466327205ecc57083439f395f3f57c41ffe","observation_id":"5562830a-c740-4682-915b-4ab7391ea58b","resolution":{"observed_at":"2026-08-12T18:25:29.511370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:25:30.041982Z","title":"Buczek, C","venue":null,"work_id":"2c60a240-77c8-4376-b769-49f4b9e804fa","year":2024},"citing_paper":{"arxiv_id":"2411.14465","last_updated":"2024-11-18T13:42:13Z","snapshot_observed_at":"2026-08-12T18:19:42.120826Z","submitted_at":"2024-11-18T13:42:13Z","title":"Testing Uncertainty of Large Language Models for Physics Knowledge and Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T18:25:29.525883Z"},"links":{"citing_paper":"/paper/2411.14465"},"observation_digest":"sha256:a25c49767af0d22cd55b34d5f254b9e2ba99b66d237a709d2ab6623ef86a1db4","observation_id":"b24be09f-1e13-47bc-917a-a05e59f803fd","resolution":{"observed_at":"2026-08-12T18:25:30.048043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11641","last_updated":"2019-11-26T15:31:46Z","snapshot_observed_at":"2026-08-08T00:48:01.603669Z","submitted_at":"2019-11-26T15:31:46Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11641","snapshot_observed_at":"2026-08-12T18:25:29.531613Z","title":"Piqa: Reasoning about physical commonsense in natural language, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14465","last_updated":"2024-11-18T13:42:13Z","snapshot_observed_at":"2026-08-12T18:19:42.120826Z","submitted_at":"2024-11-18T13:42:13Z","title":"Testing Uncertainty of Large Language Models for Physics Knowledge and Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T18:25:29.531613Z"},"links":{"cited_paper":"/paper/1911.11641","citing_paper":"/paper/2411.14465"},"observation_digest":"sha256:ad7dc0b7c18bba929d04ae82243d0c9a9ca035ba10167d3e267b825300580cb0","observation_id":"51ba95fc-5791-4edd-adbe-c4e44a1295db","resolution":{"observed_at":"2026-08-12T18:25:29.531613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:25:29.537212Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14465","last_updated":"2024-11-18T13:42:13Z","snapshot_observed_at":"2026-08-12T18:19:42.120826Z","submitted_at":"2024-11-18T13:42:13Z","title":"Testing Uncertainty of Large Language Models for Physics Knowledge and Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T18:25:29.537212Z"},"links":{"citing_paper":"/paper/2411.14465"},"observation_digest":"sha256:9185967ea664ca1c7b9728e0a5c0842a4d1660976fdd8da64b54a68459a3c417","observation_id":"2f229fae-ca00-4d93-89b6-5c01fb91b707","resolution":{"observed_at":"2026-08-12T18:25:29.537212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:25:30.019827Z","title":"Prompting","venue":null,"work_id":"4e5b787f-afa5-4c21-8f04-beb254d90620","year":2024},"citing_paper":{"arxiv_id":"2411.14465","last_updated":"2024-11-18T13:42:13Z","snapshot_observed_at":"2026-08-12T18:19:42.120826Z","submitted_at":"2024-11-18T13:42:13Z","title":"Testing Uncertainty of Large Language Models for Physics Knowledge and Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T18:25:29.543668Z"},"links":{"citing_paper":"/paper/2411.14465"},"observation_digest":"sha256:2311642194008040ed872e7f00e50fb2c96b48807953853d402552042c7f733c","observation_id":"228bc58e-3045-40f0-9e7c-fc018498873a","resolution":{"observed_at":"2026-08-12T18:25:30.025601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:25:29.549933Z","title":"Alice in wonderland: Simple tasks showing complete reasoning breakdown in state-of-the-art large language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14465","last_updated":"2024-11-18T13:42:13Z","snapshot_observed_at":"2026-08-12T18:19:42.120826Z","submitted_at":"2024-11-18T13:42:13Z","title":"Testing Uncertainty of Large Language Models for Physics Knowledge and Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T18:25:29.549933Z"},"links":{"citing_paper":"/paper/2411.14465"},"observation_digest":"sha256:0aaa4b97012f689ddf8ad87cf4d6d536db0b082e95ddf91dcac15f0f86d03d63","observation_id":"45dba3bd-8f38-42e2-bbbf-e59f682a8e63","resolution":{"observed_at":"2026-08-12T18:25:29.549933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01809","last_updated":"2024-07-15T12:21:56Z","snapshot_observed_at":"2026-08-13T10:20:33.868670Z","submitted_at":"2023-09-04T20:54:11Z","title":"Are Emergent Abilities in Large Language Models just In-Context Learning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01809","snapshot_observed_at":"2026-08-12T18:25:29.561980Z","title":"Are emergent abilities in large language models just in-context learning?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14465","last_updated":"2024-11-18T13:42:13Z","snapshot_observed_at":"2026-08-12T18:19:42.120826Z","submitted_at":"2024-11-18T13:42:13Z","title":"Testing Uncertainty of Large Language Models for Physics Knowledge and Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T18:25:29.561980Z"},"links":{"cited_paper":"/paper/2309.01809","citing_paper":"/paper/2411.14465"},"observation_digest":"sha256:a4266406cb65853f132938d8b1cab79587a0476e810cd46631931d4682c12e75","observation_id":"6cd8421b-53f3-4299-9ba9-97e1eb58384c","resolution":{"observed_at":"2026-08-12T18:25:29.561980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08865","last_updated":"2024-04-13T01:13:59Z","snapshot_observed_at":"2026-08-13T00:30:57.518365Z","submitted_at":"2024-04-13T01:13:59Z","title":"LLM In-Context Recall is Prompt Dependent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08865","snapshot_observed_at":"2026-08-12T18:25:29.568054Z","title":"Llm in-context recall is prompt dependent, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14465","last_updated":"2024-11-18T13:42:13Z","snapshot_observed_at":"2026-08-12T18:19:42.120826Z","submitted_at":"2024-11-18T13:42:13Z","title":"Testing Uncertainty of Large Language Models for Physics Knowledge and Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T18:25:29.568054Z"},"links":{"cited_paper":"/paper/2404.08865","citing_paper":"/paper/2411.14465"},"observation_digest":"sha256:146901a84be37cdae86bd5e530af1caacbb2b3a299d84cf519127d15dfa82281","observation_id":"526268c7-56b3-4c38-a805-2ffa798b59cd","resolution":{"observed_at":"2026-08-12T18:25:29.568054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:25:29.988578Z","title":null,"venue":null,"work_id":"5a3fcf5b-1cf6-49d5-bafb-753aa89efeb2","year":null},"citing_paper":{"arxiv_id":"2411.14465","last_updated":"2024-11-18T13:42:13Z","snapshot_observed_at":"2026-08-12T18:19:42.120826Z","submitted_at":"2024-11-18T13:42:13Z","title":"Testing Uncertainty of Large Language Models for Physics Knowledge and Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T18:25:29.574454Z"},"links":{"citing_paper":"/paper/2411.14465"},"observation_digest":"sha256:eaa503783a8970770c19fa90e81288e55cedf784061456138e122ce0662f00e9","observation_id":"f2131052-7fe3-4295-b7af-2172cfd784f0","resolution":{"observed_at":"2026-08-12T18:25:29.993903Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:25:29.964574Z","title":null,"venue":null,"work_id":"0358f41d-1fc7-432a-a85a-404d6c0787c6","year":null},"citing_paper":{"arxiv_id":"2411.14465","last_updated":"2024-11-18T13:42:13Z","snapshot_observed_at":"2026-08-12T18:19:42.120826Z","submitted_at":"2024-11-18T13:42:13Z","title":"Testing Uncertainty of Large Language Models for Physics Knowledge and Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T18:25:29.581044Z"},"links":{"citing_paper":"/paper/2411.14465"},"observation_digest":"sha256:61d54f61891f30dd3d08fd8aadd2c7c2581f5332f1364f429f6ba7f256e14ea9","observation_id":"e37c8974-fa8c-4a9c-927f-4e1ce95d282c","resolution":{"observed_at":"2026-08-12T18:25:29.970332Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:25:29.943000Z","title":null,"venue":null,"work_id":"26cb72bc-6d3d-4c22-9f8f-2c1440826870","year":null},"citing_paper":{"arxiv_id":"2411.14465","last_updated":"2024-11-18T13:42:13Z","snapshot_observed_at":"2026-08-12T18:19:42.120826Z","submitted_at":"2024-11-18T13:42:13Z","title":"Testing Uncertainty of Large Language Models for Physics Knowledge and Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T18:25:29.586616Z"},"links":{"citing_paper":"/paper/2411.14465"},"observation_digest":"sha256:0be6beef5b75140879f5b222198f2633fa72872072ad30a1ec52a1475a6b5ea2","observation_id":"ef411b11-6058-4fee-abd4-08a08efa2a65","resolution":{"observed_at":"2026-08-12T18:25:29.950135Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:25:29.917482Z","title":"When the model consistently produces correct responses, both the entropy and the error rate are zero (accuracy equals 1)","venue":null,"work_id":"c9105a49-633c-4069-afc3-2cdd794daeb7","year":null},"citing_paper":{"arxiv_id":"2411.14465","last_updated":"2024-11-18T13:42:13Z","snapshot_observed_at":"2026-08-12T18:19:42.120826Z","submitted_at":"2024-11-18T13:42:13Z","title":"Testing Uncertainty of Large Language Models for Physics Knowledge and Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T18:25:29.592100Z"},"links":{"citing_paper":"/paper/2411.14465"},"observation_digest":"sha256:82beb577126b775a127780baaeaab3aa099845fca08a448566ecef14b8559669","observation_id":"11861b5f-6de1-4df9-94ec-33a0df4f60ff","resolution":{"observed_at":"2026-08-12T18:25:29.927134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:25:29.479789Z","title":"doi: 10.1007/s10994-021-05946-3","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14465","last_updated":"2024-11-18T13:42:13Z","snapshot_observed_at":"2026-08-12T18:19:42.120826Z","submitted_at":"2024-11-18T13:42:13Z","title":"Testing Uncertainty of Large Language Models for Physics Knowledge and Reasoning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-12T18:25:29.479789Z"},"links":{"citing_paper":"/paper/2411.14465"},"observation_digest":"sha256:e7e6057a74c60873899e48a73ae3fd1608a9fe2c98404961a00a315f426c9a80","observation_id":"4cf10c30-beb8-46e3-ab84-32c22263ed20","resolution":{"observed_at":"2026-08-12T18:25:29.479789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07383","last_updated":"2023-11-13T15:08:59Z","snapshot_observed_at":"2026-08-14T00:21:09.764905Z","submitted_at":"2023-11-13T15:08:59Z","title":"LM-Polygraph: Uncertainty Estimation for Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07383","snapshot_observed_at":"2026-08-12T18:25:29.467967Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14465","last_updated":"2024-11-18T13:42:13Z","snapshot_observed_at":"2026-08-12T18:19:42.120826Z","submitted_at":"2024-11-18T13:42:13Z","title":"Testing Uncertainty of Large Language Models for Physics Knowledge and Reasoning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T18:25:29.467967Z"},"links":{"cited_paper":"/paper/2311.07383","citing_paper":"/paper/2411.14465"},"observation_digest":"sha256:7e0176a1edfb9a631578cf9d9c786c1976f60c46c293df3134e9b7357bfcdbb4","observation_id":"05736c71-da27-4540-a449-a669ca186508","resolution":{"observed_at":"2026-08-12T18:25:29.467967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02061","last_updated":"2025-03-05T01:58:08Z","snapshot_observed_at":"2026-08-13T23:05:20.614745Z","submitted_at":"2024-06-04T07:43:33Z","title":"Alice in Wonderland: Simple Tasks Showing Complete Reasoning Breakdown in State-Of-the-Art Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02061","snapshot_observed_at":"2026-08-12T18:25:29.555794Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14465","last_updated":"2024-11-18T13:42:13Z","snapshot_observed_at":"2026-08-12T18:19:42.120826Z","submitted_at":"2024-11-18T13:42:13Z","title":"Testing Uncertainty of Large Language Models for Physics Knowledge and Reasoning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T18:25:29.555794Z"},"links":{"cited_paper":"/paper/2406.02061","citing_paper":"/paper/2411.14465"},"observation_digest":"sha256:f9285792567479960c99848e38262e9b4d008d0e4eec9708130c55abeede4ccd","observation_id":"7f8a9791-4b1a-4a39-be91-b2d4d9667c7a","resolution":{"observed_at":"2026-08-12T18:25:29.555794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.14465","last_updated":"2024-11-18T13:42:13Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T18:19:42.120826Z","submitted_at":"2024-11-18T13:42:13Z","title":"Testing Uncertainty of Large Language Models for Physics Knowledge and Reasoning"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2411.14465."}