{"as_of":"2026-08-08T07:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5771b03b858130e4b5a2112292d30606fb783f2745094b3b9d984494c523e2e6","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:22:26.217604Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.24823/citation-record","integrity":"/paper/2505.24823/integrity","json":"/paper/2505.24823/citation-record.json","paper":"/paper/2505.24823"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.10833","last_updated":"2024-09-28T23:58:10Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T08:03:24Z","title":"A Comprehensive Survey of Scientific Large Language Models and Their Applications in Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10833","snapshot_observed_at":"2026-08-07T12:22:22.263718Z","title":"A comprehensive survey of scientific large language models and their applications in scientific discovery, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:22.263718Z"},"links":{"cited_paper":"/paper/2406.10833","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:d302f71aa8c149b826d5e50470be6f4e32ba274261b7c0d0458aa75c20a4d4c6","observation_id":"b5a48d0e-96b2-47ab-837b-9a9a873b4ed1","resolution":{"observed_at":"2026-08-07T12:22:22.263718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:22.403429Z","title":"Romera-Paredes, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:22.403429Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:9bd50cd88f730669b2426c5f8b44e6056797c30bf6ac3d2e0f82d21d81aa3557","observation_id":"808a5c32-b05e-48b9-99ca-4c0c0033234a","resolution":{"observed_at":"2026-08-07T12:22:22.403429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06292","last_updated":"2024-09-01T00:41:18Z","snapshot_observed_at":"2026-07-06T18:59:43.564435Z","submitted_at":"2024-08-12T16:58:11Z","title":"The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06292","snapshot_observed_at":"2026-08-07T12:22:22.541012Z","title":"The ai scientist: Towards fully automated open-ended scientific discovery, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:22.541012Z"},"links":{"cited_paper":"/paper/2408.06292","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:6a2f19771041d6ea5fb5d6e49e241fe0dd9dbd529fe380e8bd85ffdb5ff935a2","observation_id":"fe59b0df-1003-4619-bb2e-5994d0365be5","resolution":{"observed_at":"2026-08-07T12:22:22.541012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:28.450072Z","title":"Llm-sr: Scientific equation discovery via programming with large language models,","venue":null,"work_id":"67909387-8480-4a67-9ac2-63fd34904ec5","year":null},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:22.670967Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:6e1a70e158ae507798104428ac48f9ba7272b508a6d5f6ded46f68b30896fb15","observation_id":"df50c6f1-8be3-4d9d-915d-7c18ab264605","resolution":{"observed_at":"2026-08-07T12:22:28.507274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:22.854654Z","title":"Brenner, and Eun-Ah Kim","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:22.854654Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:51db5b0bc4424e295bae097ab5ab4707eb3b9e65689325d11f1c3deb01ba4f03","observation_id":"a364e9d4-33f0-4d5c-93a0-a456a9d46440","resolution":{"observed_at":"2026-08-07T12:22:22.854654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06512","last_updated":"2025-07-25T12:50:50Z","snapshot_observed_at":"2026-08-07T17:19:14.809711Z","submitted_at":"2025-03-09T08:34:51Z","title":"LLM-Feynman: Leveraging Large Language Models for Universal Scientific Formula and Theory Discovery","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06512","snapshot_observed_at":"2026-08-07T12:22:22.956783Z","title":"Llm-feynman: Leveraging large language models for universal scientific formula and theory discovery","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:22.956783Z"},"links":{"cited_paper":"/paper/2503.06512","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:6dbb9158c8dc0ca6f1ef86351174dc933c20e1ee4649a2cb9b720b3003f65490","observation_id":"51298dbc-c492-4a51-8376-bb4d517b523d","resolution":{"observed_at":"2026-08-07T12:22:22.956783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:23.042992Z","title":"Large physics models: Towards a collaborative approach with large language models and foundation models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:23.042992Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:2f81d215b401a172db88308afe7f3b724fcf5c0f20898b38c3eb9c82c06fd062","observation_id":"32b624ba-dac3-4396-a211-711b3a7bd2a1","resolution":{"observed_at":"2026-08-07T12:22:23.042992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01911","last_updated":"2025-08-18T08:28:27Z","snapshot_observed_at":"2026-08-07T16:14:03.023833Z","submitted_at":"2025-04-02T17:13:16Z","title":"Advancing AI-Scientist Understanding: Multi-Agent LLMs with Interpretable Physics Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01911","snapshot_observed_at":"2026-08-07T12:22:23.142195Z","title":"Advancing ai-scientist understanding: Making llm think like a physicist with interpretable reasoning.arXiv preprint arXiv:2504.01911, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:23.142195Z"},"links":{"cited_paper":"/paper/2504.01911","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:bf7c813ae6545ca88f05623702a4475a55280096a8aa9fb277f92c4587872a32","observation_id":"c4563436-9104-4f8f-87b4-a07a5a2783fb","resolution":{"observed_at":"2026-08-07T12:22:23.142195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-02T07:15:58.798604Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-07T12:22:23.253023Z","title":"Alex Hofer, Jan Humplik, Atil Iscen, Mithun George Jacob, Deepali Jain, Ryan Julian, Dmitry Kalash- nikov, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:23.253023Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:fc187dd6727f21334332f1d7673eb8e8f7af474921adf1320227acd57ec09557","observation_id":"0b2493fa-4321-4818-a7ef-0128d76ea2ca","resolution":{"observed_at":"2026-08-07T12:22:23.253023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15815","last_updated":"2025-02-19T19:00:00Z","snapshot_observed_at":"2026-08-07T23:28:55.289287Z","submitted_at":"2025-02-19T19:00:00Z","title":"Theoretical Physics Benchmark (TPBench) -- a Dataset and Study of AI Reasoning Capabilities in Theoretical Physics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15815","snapshot_observed_at":"2026-08-07T12:22:23.366842Z","title":"Theoretical physics benchmark (tpbench)–a dataset and study of ai reasoning capabilities in theoretical physics","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:23.366842Z"},"links":{"cited_paper":"/paper/2502.15815","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:66e2b53bc43dc412b755a494d48224846ae453b68bfecbcebf02978aa7f4fb98","observation_id":"396fc029-6d63-4220-a6ad-614e4ce1b101","resolution":{"observed_at":"2026-08-07T12:22:23.366842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-07T04:27:23.738927Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16419","snapshot_observed_at":"2026-08-07T12:22:23.478351Z","title":"Stop overthinking: A survey on efficient reasoning for large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:23.478351Z"},"links":{"cited_paper":"/paper/2503.16419","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:61b6cbf561108a840cd16dd2bf78e22b727403f390dbee884cdb3397355ada9e","observation_id":"3f783fd1-951f-41cb-9688-782fa1291086","resolution":{"observed_at":"2026-08-07T12:22:23.478351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:28.264393Z","title":"Expert and novice performance in solving physics problems","venue":null,"work_id":"f8954274-7b75-45dd-825b-dbac8e0fc057","year":1980},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:23.556910Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:09221ca66017995a354b686c29425570dcac6628b20411d169089f2ced91c580","observation_id":"803b530e-0457-400d-a200-728c2ce4442f","resolution":{"observed_at":"2026-08-07T12:22:28.365459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:23.661672Z","title":null,"venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:23.661672Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:ccb891a2dea2dd52ecd9c5e67948af72bdfe5e81fb239cfb63077c059c671afb","observation_id":"9371a1df-69bf-44c3-85d2-988571c33163","resolution":{"observed_at":"2026-08-07T12:22:23.661672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:23.740680Z","title":"Cognitive load during problem solving: Effects on learning","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:23.740680Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:cdde22137fb7f41d3485511caae130f83b7dfe419cc9ace8acb3d83c849ad546","observation_id":"f7c2d1ae-54f7-48bf-9368-62c51f1b0030","resolution":{"observed_at":"2026-08-07T12:22:23.740680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T12:22:23.833827Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:23.833827Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:c3c28c8990e278cbfa25d3b562df879a6aeef80af1b324b9713891c92f16dd03","observation_id":"4b35877a-f8ac-416f-aebc-eba31f4ffe22","resolution":{"observed_at":"2026-08-07T12:22:23.833827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T12:22:23.924503Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:23.924503Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:3ea82af873509c1eaae0e986857bed95c5c0f97b02b4767cb21f195ab8ddeb53","observation_id":"521599b2-9065-4a7f-931a-2bbcfdfd0ee4","resolution":{"observed_at":"2026-08-07T12:22:23.924503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13214","last_updated":"2022-07-25T04:05:29Z","snapshot_observed_at":"2026-08-02T20:16:21.986025Z","submitted_at":"2021-10-25T18:52:26Z","title":"IconQA: A New Benchmark for Abstract Diagram Understanding and Visual Language Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.13214","snapshot_observed_at":"2026-08-07T12:22:23.996077Z","title":"Iconqa: A new benchmark for abstract diagram understanding and visual language reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:23.996077Z"},"links":{"cited_paper":"/paper/2110.13214","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:94cb1df833263bdfc28581ef25b35ca570c0e6a0dae4f0d5c70b322e2cde615f","observation_id":"dbb57740-cea8-471f-bcbf-fc7a73709532","resolution":{"observed_at":"2026-08-07T12:22:23.996077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:24.060193Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:24.060193Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:0ab8a647b69a56133078bfd53d86e37d8f65707c494a5c7bc026eb5fd162444e","observation_id":"f4e69425-a990-4618-bc0a-e1b6462b638a","resolution":{"observed_at":"2026-08-07T12:22:24.060193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-08-07T12:51:50.861720Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-08-07T12:22:24.129251Z","title":"Agieval: A human-centric benchmark for evaluating foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:24.129251Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:9ad19c35b0e32fc61e93fd19f0e9e2bd774c4da77bd435e89b7c1ec7182de9c0","observation_id":"cdf12970-07b3-43f0-bc47-85ff7762fa00","resolution":{"observed_at":"2026-08-07T12:22:24.129251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:24.207587Z","title":"Have LLMs advanced enough? a chal- lenging problem solving benchmark for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:24.207587Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:727651f27efc4bee7adfd2980ab42ea7046511c424a155dd7eb89e453913738c","observation_id":"79cc130c-bbb1-43d2-b840-5dcaa3d9d231","resolution":{"observed_at":"2026-08-07T12:22:24.207587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10635","last_updated":"2024-06-28T08:24:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-20T07:01:57Z","title":"SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10635","snapshot_observed_at":"2026-08-07T12:22:24.297967Z","title":"Scibench: Evaluating college-level scientific problem-solving abilities of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:24.297967Z"},"links":{"cited_paper":"/paper/2307.10635","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:14fb3fffaf7f888f568b7ca44a10e0cc72801d31d2683d120b495eb1e9034edf","observation_id":"02dda92c-2780-45b9-8f2c-1f865cb1b5ae","resolution":{"observed_at":"2026-08-07T12:22:24.297967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:24.372229Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:24.372229Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:a70505d4e9c95d351b5f1e8277fa937ec48139cbc1cce7e2f68d5fd303b16080","observation_id":"0c387862-5d82-4e16-9e86-65313924be74","resolution":{"observed_at":"2026-08-07T12:22:24.372229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:28.059161Z","title":"Scieval: A multi-level large language model evaluation benchmark for scientific research","venue":null,"work_id":"c9412459-29ac-495d-bcfd-af531feddcfd","year":2024},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:24.440236Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:925a738d9201fcb0bd22eb38970030ec8c77bc0c42497efaa93bef670ca8e5ab","observation_id":"a869ab84-d082-48b6-ba44-90cd9788c3f8","resolution":{"observed_at":"2026-08-07T12:22:28.130295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12524","last_updated":"2023-12-06T03:02:45Z","snapshot_observed_at":"2026-07-06T15:30:18.137347Z","submitted_at":"2023-05-21T17:51:35Z","title":"TheoremQA: A Theorem-driven Question Answering dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12524","snapshot_observed_at":"2026-08-07T12:22:24.562397Z","title":"Theoremqa: A theorem-driven question answering dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:24.562397Z"},"links":{"cited_paper":"/paper/2305.12524","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:45b28e25023c47bf3054cf9283b53c800261f5b2b698ad3ff4eba7131efa555f","observation_id":"5a431d61-daf8-4a7e-897a-e5c964430a73","resolution":{"observed_at":"2026-08-07T12:22:24.562397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-07T12:22:24.630990Z","title":"Humanity’s last exam","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:24.630990Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:51d1f792fc455b2af4744c8efbd4a624c6398a3fd9565f2db62e4730d1058061","observation_id":"af06dde0-a12c-42a3-ade6-77517c781a61","resolution":{"observed_at":"2026-08-07T12:22:24.630990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T12:22:24.704748Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:24.704748Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:79d1e2471acf7cbac0d2d71eb4ae58e2dc9b17f9a88df75bda58a855421b7e7f","observation_id":"4a96a0a4-9d2a-495f-b9bc-2f049d547835","resolution":{"observed_at":"2026-08-07T12:22:24.704748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:24.776896Z","title":"Olympicarena: Benchmarking multi-discipline cognitive reasoning for superintelligent ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:24.776896Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:61682c75cdc950c90d7c9fccf68533684665b8e7bcb454410caa5a3dd20bdfab","observation_id":"180c217d-8b14-420f-b85d-f8106afa1290","resolution":{"observed_at":"2026-08-07T12:22:24.776896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08182","last_updated":"2023-09-20T07:08:53Z","snapshot_observed_at":"2026-07-06T16:18:49.258642Z","submitted_at":"2023-09-15T06:13:06Z","title":"Using Large Language Model to Solve and Explain Physics Word Problems Approaching Human Level","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08182","snapshot_observed_at":"2026-08-07T12:22:24.850334Z","title":"Using large language model to solve and explain physics word problems approaching human level","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:24.850334Z"},"links":{"cited_paper":"/paper/2309.08182","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:23971bb0497a6c6245b633dbda70280c3ea76ae831dc47348717601e8a751612","observation_id":"9b4783e0-6f33-4c67-a1ba-a05baec08497","resolution":{"observed_at":"2026-08-07T12:22:24.850334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00334","last_updated":"2025-06-03T07:13:03Z","snapshot_observed_at":"2026-07-06T20:29:26.524162Z","submitted_at":"2025-02-01T06:42:02Z","title":"UGPhysics: A Comprehensive Benchmark for Undergraduate Physics Reasoning with Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00334","snapshot_observed_at":"2026-08-07T12:22:24.926698Z","title":"Ugphysics: A comprehensive benchmark for undergraduate physics reasoning with large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:24.926698Z"},"links":{"cited_paper":"/paper/2502.00334","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:d8209f5d821bdf0b4604891b9e7808573aab7a90e4de4f8895dd768958012d12","observation_id":"03c59c30-0f57-4c2b-9221-927d494fe54b","resolution":{"observed_at":"2026-08-07T12:22:24.926698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-08-07T16:00:09.967849Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-07T12:22:25.013730Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:25.013730Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:627a7cb81c10ef4a20100b4f14f9f79bdea523cb3e4f179f2ffe4fd3983a99b3","observation_id":"b1401a96-4fdf-4fce-8ad7-6f18ae4f77ba","resolution":{"observed_at":"2026-08-07T12:22:25.013730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12054","last_updated":"2025-05-26T13:42:06Z","snapshot_observed_at":"2026-08-07T18:43:21.185505Z","submitted_at":"2025-02-17T17:24:14Z","title":"PhysReason: A Comprehensive Benchmark towards Physics-Based Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12054","snapshot_observed_at":"2026-08-07T12:22:25.112064Z","title":"Physreason: A comprehensive benchmark towards physics-based reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:25.112064Z"},"links":{"cited_paper":"/paper/2502.12054","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:fb37842e9b0bdc2794f213495c38ee2cee554393876a0ccb3df39d950e2ccd1e","observation_id":"aa447c21-1001-482c-9c3f-e2f2bc2942c1","resolution":{"observed_at":"2026-08-07T12:22:25.112064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13517","last_updated":"2025-05-13T06:16:23Z","snapshot_observed_at":"2026-08-07T17:03:14.189166Z","submitted_at":"2025-03-14T17:53:03Z","title":"CURIE: Evaluating LLMs On Multitask Scientific Long Context Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13517","snapshot_observed_at":"2026-08-07T12:22:25.206982Z","title":"Curie: Evalu- ating llms on multitask scientific long context understanding and reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:25.206982Z"},"links":{"cited_paper":"/paper/2503.13517","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:12f2dee21a072db30743d109ae619e674f3af77b7e6f6a35657d1582c423aa73","observation_id":"9993ea64-1444-49b2-b6e0-7d4512665de9","resolution":{"observed_at":"2026-08-07T12:22:25.206982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:25.273400Z","title":"Mm-phyqa: Multimodal physics question-answering with multi-image cot prompting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:25.273400Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:7def6161b440519dd6a2c6c09005e2fee858f1d23b798151ffb9c24765eb46b4","observation_id":"18e58079-ba3c-4c38-ab28-ba13d822cc40","resolution":{"observed_at":"2026-08-07T12:22:25.273400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06260","last_updated":"2025-04-08T17:59:39Z","snapshot_observed_at":"2026-08-07T16:07:25.844827Z","submitted_at":"2025-04-08T17:59:39Z","title":"FEABench: Evaluating Language Models on Multiphysics Reasoning Ability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06260","snapshot_observed_at":"2026-08-07T12:22:25.362149Z","title":"Feabench: Evaluating language models on multiphysics reasoning ability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:25.362149Z"},"links":{"cited_paper":"/paper/2504.06260","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:04350e1488010bddc92c3fd94d45284fed8edd156e17435ef2b2239572064d75","observation_id":"6da479d7-7839-4893-9e43-1d28264fe77c","resolution":{"observed_at":"2026-08-07T12:22:25.362149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:27.828575Z","title":"Learning to reason with llms, September 2024","venue":null,"work_id":"2eb8a384-3af0-412b-9377-00481d3b89d1","year":2024},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:25.433618Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:7cb40ad3ced46c6e4d655acb990d097a7ab0cf15f0390714d176aab156dabc97","observation_id":"7a961bc9-1382-43b1-9101-ff2fc5c1d320","resolution":{"observed_at":"2026-08-07T12:22:27.886863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T12:22:25.520633Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:25.520633Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:4e153895de05f327f625364d56a2bfd3b4dcf02918a1a04af79adaf5ff96359c","observation_id":"f3766474-28fc-4d52-aaee-35044a14fcff","resolution":{"observed_at":"2026-08-07T12:22:25.520633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T12:22:25.610427Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:25.610427Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:8fb4989c16b7c4cde026e9b9a1de4d828762349a2f4a4a2ae70f7175b94129b5","observation_id":"82d86910-6508-4c19-a1ed-f374995122c0","resolution":{"observed_at":"2026-08-07T12:22:25.610427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:27.627013Z","title":"Claude 3.7 sonnet and extended thinking mode","venue":null,"work_id":"1d31ced2-98a8-49ad-979c-8c75c9dce9a9","year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:25.698133Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:380bc16550686c04ed1bdfff1341d32f3f20dca135915d4d90ce1f030d1eecb8","observation_id":"df088cbf-23f6-4b89-ad03-62d780ba7c78","resolution":{"observed_at":"2026-08-07T12:22:27.712882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:27.453672Z","title":"Qwq: Reflect deeply on the boundaries of the unknown, November 2024","venue":null,"work_id":"183c22ab-6543-4256-acc5-1e3fef6fff8c","year":2024},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:25.762655Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:793af61579672a378c7b140dbd1b3990760442edc19f01986c6c30bc533a201b","observation_id":"9c98da01-6cb7-4932-8275-2d57c4e85b04","resolution":{"observed_at":"2026-08-07T12:22:27.536957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:27.265261Z","title":"Openai o3 and o4-mini system card","venue":null,"work_id":"9329e775-ff13-45b1-83e5-b1cbe71fdb2a","year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:25.833242Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:ab85788dd62ce44045914ab3701377e4ec42457c6c4df10846ceb63fbf4bc453","observation_id":"610037b8-ea61-4d33-9e03-36693ba95cde","resolution":{"observed_at":"2026-08-07T12:22:27.353683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:27.141932Z","title":"URL https://blog.google/technology/ google-deepmind/gemini-model-thinking-updates-march-2025/","venue":null,"work_id":"85e66c3b-7d8e-4795-a1aa-cc34d2b35410","year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:25.907140Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:551323f83cf8cd47bac82a5006fd3379dc647644ce92139cfbe48db39c69e3c9","observation_id":"bc3d9c65-2030-4145-a99d-14949198f77d","resolution":{"observed_at":"2026-08-07T12:22:27.190613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:25.980401Z","title":"Introducing gpt-4.1 in the api, April 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:25.980401Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:2f45b49e16215d8ceda83620d342597036a747fe1c1f476734626b70caafbade","observation_id":"0c3101cb-d4ed-4803-9e0f-7821cf0c4c4f","resolution":{"observed_at":"2026-08-07T12:22:25.980401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:26.962328Z","title":"Claude 3.7 sonnet and claude code, February 2025","venue":null,"work_id":"d6f5ac19-ffd1-43c2-851d-147fbccd5a4c","year":2025},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:26.052171Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:e11402fc78ed538527ee84a7c35b2392f99c2365e36e4f23896052ac1bfd70de","observation_id":"41e85d35-4d36-4afa-9448-d6f018c2cc8d","resolution":{"observed_at":"2026-08-07T12:22:27.046469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:22:26.127078Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:26.127078Z"},"links":{"citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:f803e7508f09c37b994c02e874b7e0c512d6d33f5ad61ffa770ba29ed54b55ac","observation_id":"2d41297a-7b22-48f6-824a-25225da34672","resolution":{"observed_at":"2026-08-07T12:22:26.127078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T12:22:26.217604Z","title":"Zero-shot","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:26.217604Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:9d26586651f3dd003b5bb2071f02f6fc5cff60f1e78bbd5435cfa534f80b67f8","observation_id":"56ffc97e-5c6e-4606-9adb-ba5a36adf4f6","resolution":{"observed_at":"2026-08-07T12:22:26.217604Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18400","last_updated":"2025-03-20T16:37:17Z","snapshot_observed_at":"2026-07-06T18:06:49.190172Z","submitted_at":"2024-04-29T03:30:06Z","title":"LLM-SR: Scientific Equation Discovery via Programming with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18400","snapshot_observed_at":"2026-08-07T12:22:22.780339Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:22.780339Z"},"links":{"cited_paper":"/paper/2404.18400","citing_paper":"/paper/2505.24823"},"observation_digest":"sha256:62d214dfc2933cbbfc36a3502bf0ac368c1818a4075495178d84c9f8cfaf7442","observation_id":"0e7d5fea-6140-40d0-9f66-44aae2f38c47","resolution":{"observed_at":"2026-08-07T12:22:22.780339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.24823","last_updated":"2025-05-30T17:25:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T12:10:52.463962Z","submitted_at":"2025-05-30T17:25:20Z","title":"PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2505.24823."}