{"as_of":"2026-08-23T15:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2d2be3f88062de45af20cb7a44d02141ca0e0d1ab959a931da08fa5f4ff2fac6","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T20:58:34.564196Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.08270/citation-record","integrity":"/paper/2509.08270/integrity","json":"/paper/2509.08270/citation-record.json","paper":"/paper/2509.08270"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:39.889438Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"6b7313dd-5b4f-44fd-a9c9-bb331d8d5015","year":2022},"citing_paper":{"arxiv_id":"2509.08270","last_updated":"2025-09-10T04:15:01Z","snapshot_observed_at":"2026-08-14T16:35:12.428468Z","submitted_at":"2025-09-10T04:15:01Z","title":"Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:32.228497Z"},"links":{"citing_paper":"/paper/2509.08270"},"observation_digest":"sha256:4abb5fbe84c21fcd5050f550aa75ca7e40e4864e7eb884cdd0f7f11af92eac08","observation_id":"a919164d-d87d-44bd-845f-800b766b4de9","resolution":{"observed_at":"2026-08-04T20:58:40.015509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:39.579090Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"e3596a34-bab4-43c5-9a2d-123b0ad8300c","year":2019},"citing_paper":{"arxiv_id":"2509.08270","last_updated":"2025-09-10T04:15:01Z","snapshot_observed_at":"2026-08-14T16:35:12.428468Z","submitted_at":"2025-09-10T04:15:01Z","title":"Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:32.318689Z"},"links":{"citing_paper":"/paper/2509.08270"},"observation_digest":"sha256:1005a4e906479e1d9ab215f0d8707183a25c554a548693ddf1ae8d615344ea28","observation_id":"b2020f27-e0fc-40fa-ae50-86b8a54b45f6","resolution":{"observed_at":"2026-08-04T20:58:39.678327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:39.241199Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"a6fd3f3c-d411-4687-852b-563674120d5b","year":2015},"citing_paper":{"arxiv_id":"2509.08270","last_updated":"2025-09-10T04:15:01Z","snapshot_observed_at":"2026-08-14T16:35:12.428468Z","submitted_at":"2025-09-10T04:15:01Z","title":"Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:32.432981Z"},"links":{"citing_paper":"/paper/2509.08270"},"observation_digest":"sha256:ec2a544c16949359e1d2ceee8ebd270f05e8ed41137865be2781e9348f33fa40","observation_id":"aa6152b0-6786-4d9f-88fe-d14e16c690f0","resolution":{"observed_at":"2026-08-04T20:58:39.369301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:38.861364Z","title":"Phyre: A new benchmark for physical reasoning","venue":null,"work_id":"f86c3d20-e5e6-4a90-ae1b-34d2f4db957f","year":2019},"citing_paper":{"arxiv_id":"2509.08270","last_updated":"2025-09-10T04:15:01Z","snapshot_observed_at":"2026-08-14T16:35:12.428468Z","submitted_at":"2025-09-10T04:15:01Z","title":"Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:32.506855Z"},"links":{"citing_paper":"/paper/2509.08270"},"observation_digest":"sha256:5962f831f86305e1f5f999babdc5131d430136256c3998fa15244aedcb5ea3f9","observation_id":"1cbb1d13-365d-4068-be35-5226e324960e","resolution":{"observed_at":"2026-08-04T20:58:38.992192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:38.545724Z","title":"Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared D","venue":null,"work_id":"7fa0e068-aba9-457e-869d-0be8745bf0ad","year":2020},"citing_paper":{"arxiv_id":"2509.08270","last_updated":"2025-09-10T04:15:01Z","snapshot_observed_at":"2026-08-14T16:35:12.428468Z","submitted_at":"2025-09-10T04:15:01Z","title":"Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:32.598914Z"},"links":{"citing_paper":"/paper/2509.08270"},"observation_digest":"sha256:e8d6979f10aee601152561292e692d99dc331332b5acd49af2ffcc445f3ff06b","observation_id":"b4246a39-eb68-4527-a67d-0a6b64c8ba6c","resolution":{"observed_at":"2026-08-04T20:58:38.670472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:38.351111Z","title":"Patil, Peter Clark, and Wen tau Yih","venue":null,"work_id":"149c3d08-df7b-4e88-8e71-920982d7af60","year":2020},"citing_paper":{"arxiv_id":"2509.08270","last_updated":"2025-09-10T04:15:01Z","snapshot_observed_at":"2026-08-14T16:35:12.428468Z","submitted_at":"2025-09-10T04:15:01Z","title":"Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:32.696044Z"},"links":{"citing_paper":"/paper/2509.08270"},"observation_digest":"sha256:3d926b83396759cbc58ba4445be3186123ce850c8ad300ed28f93050b5382273","observation_id":"b41b0920-12b6-4376-a9b9-9d9e616e445a","resolution":{"observed_at":"2026-08-04T20:58:38.452080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-04T20:58:32.782839Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge.arXiv preprint arXiv:1803.05457, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.08270","last_updated":"2025-09-10T04:15:01Z","snapshot_observed_at":"2026-08-14T16:35:12.428468Z","submitted_at":"2025-09-10T04:15:01Z","title":"Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:32.782839Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2509.08270"},"observation_digest":"sha256:9ec32bde03179f1b1a10d386d731fb0a3d7848f0c88f1759b7ea7f1f46e0d043","observation_id":"8d5db976-eb74-4c7a-be1b-5f0bd70cf17d","resolution":{"observed_at":"2026-08-04T20:58:32.782839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:38.140876Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":"01576675-37bc-451e-97ec-1713a65a111d","year":2021},"citing_paper":{"arxiv_id":"2509.08270","last_updated":"2025-09-10T04:15:01Z","snapshot_observed_at":"2026-08-14T16:35:12.428468Z","submitted_at":"2025-09-10T04:15:01Z","title":"Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:32.895078Z"},"links":{"citing_paper":"/paper/2509.08270"},"observation_digest":"sha256:5d446dbcc0ee046620fbdeb721edca59d29181480cddf2dcb549fdf9a60f7ff3","observation_id":"b9b26cd4-26f3-4ea1-916f-b3d17118d50f","resolution":{"observed_at":"2026-08-04T20:58:38.206663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07918","last_updated":"2022-12-15T15:52:18Z","snapshot_observed_at":"2026-08-16T16:08:23.463097Z","submitted_at":"2022-12-15T15:52:18Z","title":"Construction of a Surrogate Model: Multivariate Time Series Prediction with a Hybrid Model","version":1},"cited_work":{"arxiv_id":"2212.07918","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.07918","snapshot_observed_at":"2026-08-04T20:58:35.033288Z","title":"Construction of a Surrogate Model: Multivariate Time Series Prediction with a Hybrid Model","venue":"stat.ML","work_id":"989603c1-905a-4cef-86f5-7db3bb748856","year":2022},"citing_paper":{"arxiv_id":"2509.08270","last_updated":"2025-09-10T04:15:01Z","snapshot_observed_at":"2026-08-14T16:35:12.428468Z","submitted_at":"2025-09-10T04:15:01Z","title":"Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:32.956056Z"},"links":{"cited_paper":"/paper/2212.07918","citing_paper":"/paper/2509.08270"},"observation_digest":"sha256:48cd3282919cc0d3a18900d9978c406f0b15a78e33774660b857c8d4f862ce2d","observation_id":"005e84d0-f5e9-4bc4-a55b-a8f97d7ee731","resolution":{"observed_at":"2026-08-04T20:58:35.119599Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:37.893205Z","title":null,"venue":null,"work_id":"3b26f05b-6d45-414e-9424-57b167618e81","year":2019},"citing_paper":{"arxiv_id":"2509.08270","last_updated":"2025-09-10T04:15:01Z","snapshot_observed_at":"2026-08-14T16:35:12.428468Z","submitted_at":"2025-09-10T04:15:01Z","title":"Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:33.013610Z"},"links":{"citing_paper":"/paper/2509.08270"},"observation_digest":"sha256:54f36319604741c9e040c5235ac498e822ed1dce5b99c8be4da992aa22cd2c4a","observation_id":"4abad966-84ef-437d-ae28-0dc8b896779e","resolution":{"observed_at":"2026-08-04T20:58:38.006689Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:37.741788Z","title":"Measuring coding challenge competence of language models","venue":null,"work_id":"8be4830a-0f9a-448c-bd43-1a7a3b91a39a","year":2021},"citing_paper":{"arxiv_id":"2509.08270","last_updated":"2025-09-10T04:15:01Z","snapshot_observed_at":"2026-08-14T16:35:12.428468Z","submitted_at":"2025-09-10T04:15:01Z","title":"Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:33.091972Z"},"links":{"citing_paper":"/paper/2509.08270"},"observation_digest":"sha256:fdc9a90b407cc2ece2dc6af775d76dd568cf9b9726c5bcd9e01590f4ee03851f","observation_id":"d52e6d40-6bfc-41c2-8d0a-50565de44a89","resolution":{"observed_at":"2026-08-04T20:58:37.816210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-04T20:58:33.194108Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2509.08270","last_updated":"2025-09-10T04:15:01Z","snapshot_observed_at":"2026-08-14T16:35:12.428468Z","submitted_at":"2025-09-10T04:15:01Z","title":"Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:33.194108Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2509.08270"},"observation_digest":"sha256:a7b4c4bbf131d12697f35f464b35396018345679d1438d9f9568e01a3a323927","observation_id":"bb8ec7f3-661b-44af-8291-489dbbd997ad","resolution":{"observed_at":"2026-08-04T20:58:33.194108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:37.556262Z","title":"Procedural generation of physics problems for visual reasoning.IEEE Transactions on Visualization and Computer Graphics, 26(1):234–244, 2020","venue":null,"work_id":"fc3313e3-a515-4a1c-9a76-0d08116d8517","year":2020},"citing_paper":{"arxiv_id":"2509.08270","last_updated":"2025-09-10T04:15:01Z","snapshot_observed_at":"2026-08-14T16:35:12.428468Z","submitted_at":"2025-09-10T04:15:01Z","title":"Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:33.286245Z"},"links":{"citing_paper":"/paper/2509.08270"},"observation_digest":"sha256:8f5764b534d73f35beff51a2c3580deeefe4d1ba5e81683ba39c615a4f85572d","observation_id":"ab935133-f3d8-476c-8c1f-487e04f704eb","resolution":{"observed_at":"2026-08-04T20:58:37.604500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:37.306942Z","title":"BLIP-2: Bootstrapped language–image pre-training with frozen image encoders and large language models","venue":null,"work_id":"2e5b6f4e-8bda-45dd-9448-0bc278880b11","year":2023},"citing_paper":{"arxiv_id":"2509.08270","last_updated":"2025-09-10T04:15:01Z","snapshot_observed_at":"2026-08-14T16:35:12.428468Z","submitted_at":"2025-09-10T04:15:01Z","title":"Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:33.376322Z"},"links":{"citing_paper":"/paper/2509.08270"},"observation_digest":"sha256:cf60ac78429791151f056d4ebd2b465173c73be20b28444df937d0ca5402b40a","observation_id":"46b7beb5-6ee1-4a6c-995c-e592ec989bef","resolution":{"observed_at":"2026-08-04T20:58:37.412272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:37.107151Z","title":"Lee, and Tamara L","venue":null,"work_id":"2caa7ba4-e270-44ea-b48a-bf9cd6ab4df9","year":2019},"citing_paper":{"arxiv_id":"2509.08270","last_updated":"2025-09-10T04:15:01Z","snapshot_observed_at":"2026-08-14T16:35:12.428468Z","submitted_at":"2025-09-10T04:15:01Z","title":"Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:33.430010Z"},"links":{"citing_paper":"/paper/2509.08270"},"observation_digest":"sha256:6bd80f1c14d47f1a13dc21b7988b8a16c35f135d1d77060408e1d0d23df63599","observation_id":"918a2682-236b-4246-8176-ca67e772d88f","resolution":{"observed_at":"2026-08-04T20:58:37.174142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:36.889060Z","title":"Few-shot prompting for physics word problems with large language models","venue":null,"work_id":"d2b16505-be3b-4890-bb14-b0c9531c1870","year":2021},"citing_paper":{"arxiv_id":"2509.08270","last_updated":"2025-09-10T04:15:01Z","snapshot_observed_at":"2026-08-14T16:35:12.428468Z","submitted_at":"2025-09-10T04:15:01Z","title":"Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:33.502444Z"},"links":{"citing_paper":"/paper/2509.08270"},"observation_digest":"sha256:9c0f257999de39ac22552fcbefd4ff572e823c207fddfe4c8932fde667771565","observation_id":"f6721ae9-46e8-41a4-bf8e-3ff8b0908260","resolution":{"observed_at":"2026-08-04T20:58:36.946313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:36.651473Z","title":"Scienceqa: A large-scale multimodal dataset for scientific question answering","venue":null,"work_id":"b275bf1d-3325-4c46-97f3-5eaedc41b365","year":2021},"citing_paper":{"arxiv_id":"2509.08270","last_updated":"2025-09-10T04:15:01Z","snapshot_observed_at":"2026-08-14T16:35:12.428468Z","submitted_at":"2025-09-10T04:15:01Z","title":"Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:33.591312Z"},"links":{"citing_paper":"/paper/2509.08270"},"observation_digest":"sha256:7ce2ff109ad36c4744edd4701e17e5f7eeb6959e3a78410c2534389fb3e3ef23","observation_id":"b941ff2d-c4d6-4716-9ebc-81f9d806f00d","resolution":{"observed_at":"2026-08-04T20:58:36.728305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:36.496290Z","title":"Mathvista: A benchmark for visualizing and reasoning about mathematical expressions","venue":null,"work_id":"62a0ee63-0729-4d17-97cd-5234980676f6","year":2023},"citing_paper":{"arxiv_id":"2509.08270","last_updated":"2025-09-10T04:15:01Z","snapshot_observed_at":"2026-08-14T16:35:12.428468Z","submitted_at":"2025-09-10T04:15:01Z","title":"Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:33.641615Z"},"links":{"citing_paper":"/paper/2509.08270"},"observation_digest":"sha256:c03cdfed8274f4b031db01ff8cdb973aafdbc2534f9bd79557304866174eb43a","observation_id":"3cf08a2f-9bce-4a8c-991e-1cb335bca5a3","resolution":{"observed_at":"2026-08-04T20:58:36.556529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:36.237505Z","title":"Analyzing common failure modes in large language models.Transactions of the Association for Computational Lin- guistics, 11:612–633, 2023","venue":null,"work_id":"9a9cb742-b2c0-4df6-8b13-b807a81f6c4c","year":2023},"citing_paper":{"arxiv_id":"2509.08270","last_updated":"2025-09-10T04:15:01Z","snapshot_observed_at":"2026-08-14T16:35:12.428468Z","submitted_at":"2025-09-10T04:15:01Z","title":"Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:33.724164Z"},"links":{"citing_paper":"/paper/2509.08270"},"observation_digest":"sha256:9aa3086f3b246e58c82ec35579c965213b9673bea1139d265bdafd359f294c06","observation_id":"22cc50fd-5182-4f77-a47c-6c72db6475ba","resolution":{"observed_at":"2026-08-04T20:58:36.335221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:36.088174Z","title":"Adaptive numerical integration for physics-based simu- lations.Journal of Computational Physics, 435:110260, 2021","venue":null,"work_id":"11d1da06-f43d-4a93-ab34-828f3a5fd7be","year":2021},"citing_paper":{"arxiv_id":"2509.08270","last_updated":"2025-09-10T04:15:01Z","snapshot_observed_at":"2026-08-14T16:35:12.428468Z","submitted_at":"2025-09-10T04:15:01Z","title":"Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:33.769419Z"},"links":{"citing_paper":"/paper/2509.08270"},"observation_digest":"sha256:58c596c61d33746ecfc01aa7ea672c4c30bc2414bfbe943116d263425086eb77","observation_id":"241a2288-0a65-4b01-bab3-7a82d8422cce","resolution":{"observed_at":"2026-08-04T20:58:36.146695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:35.985032Z","title":"Physion: Learning to predict physical interactions through video simulation","venue":null,"work_id":"abcd2709-1a21-418d-bfb4-842902dc7d26","year":2021},"citing_paper":{"arxiv_id":"2509.08270","last_updated":"2025-09-10T04:15:01Z","snapshot_observed_at":"2026-08-14T16:35:12.428468Z","submitted_at":"2025-09-10T04:15:01Z","title":"Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:33.825014Z"},"links":{"citing_paper":"/paper/2509.08270"},"observation_digest":"sha256:4bf506dbdf91e4d7622e8f21d8d43f4c81a350edcbf7a1d45f14db7d21405e7e","observation_id":"a9b27762-7779-4c56-be2a-214b9e56eda9","resolution":{"observed_at":"2026-08-04T20:58:36.039538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:35.872265Z","title":"Physical interaction question answering (piqa): A test of physical commonsense modeling","venue":null,"work_id":"15044417-775d-479c-8285-00dfe14e7249","year":2021},"citing_paper":{"arxiv_id":"2509.08270","last_updated":"2025-09-10T04:15:01Z","snapshot_observed_at":"2026-08-14T16:35:12.428468Z","submitted_at":"2025-09-10T04:15:01Z","title":"Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:33.917450Z"},"links":{"citing_paper":"/paper/2509.08270"},"observation_digest":"sha256:769e8ee0e52131b48af8fe4b12c5c5a2b3a513be311ae4d6e59294145ce22b6a","observation_id":"19f93100-543a-4394-9548-cb7f91a50322","resolution":{"observed_at":"2026-08-04T20:58:35.896695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:35.759144Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models","venue":null,"work_id":"1964211e-f9ee-4882-b461-19d14cbe470c","year":2022},"citing_paper":{"arxiv_id":"2509.08270","last_updated":"2025-09-10T04:15:01Z","snapshot_observed_at":"2026-08-14T16:35:12.428468Z","submitted_at":"2025-09-10T04:15:01Z","title":"Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:33.993416Z"},"links":{"citing_paper":"/paper/2509.08270"},"observation_digest":"sha256:ccb619c03f12dfc9b683d6d4514adf69cc437fd24394b4f7d5c5b0ab002eae25","observation_id":"94df43ec-7a9c-45f6-978b-cad41efa83e1","resolution":{"observed_at":"2026-08-04T20:58:35.790847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-17T00:14:01.413100Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-04T20:58:34.051204Z","title":"Emergent abilities of large language models.arXiv preprint arXiv:2206.07682, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08270","last_updated":"2025-09-10T04:15:01Z","snapshot_observed_at":"2026-08-14T16:35:12.428468Z","submitted_at":"2025-09-10T04:15:01Z","title":"Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:34.051204Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2509.08270"},"observation_digest":"sha256:12c2fd5f3a3433fb3db18d0958964f6379bde37e37ed131afc6e10831835e060","observation_id":"5ee4405e-c1fa-4fce-889a-2ce71fb29c0f","resolution":{"observed_at":"2026-08-04T20:58:34.051204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04070","last_updated":"2022-12-08T04:42:59Z","snapshot_observed_at":"2026-08-16T16:10:08.989844Z","submitted_at":"2022-12-08T04:42:59Z","title":"A Comprehensive Survey on Multi-hop Machine Reading Comprehension Datasets and Metrics","version":1},"cited_work":{"arxiv_id":"2212.04070","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.04070","snapshot_observed_at":"2026-08-04T20:58:34.760440Z","title":"A Comprehensive Survey on Multi-hop Machine Reading Comprehension Datasets and Metrics","venue":"cs.CL","work_id":"d7915cd1-94cc-4261-bde0-1a022dcbd41c","year":2022},"citing_paper":{"arxiv_id":"2509.08270","last_updated":"2025-09-10T04:15:01Z","snapshot_observed_at":"2026-08-14T16:35:12.428468Z","submitted_at":"2025-09-10T04:15:01Z","title":"Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:34.173167Z"},"links":{"cited_paper":"/paper/2212.04070","citing_paper":"/paper/2509.08270"},"observation_digest":"sha256:5d5351d85d75591b5b9e94c6fd28757e5ecff256a98e7c536304f462e97b2176","observation_id":"6cc90d26-9645-4021-9b2c-4c277e271d6a","resolution":{"observed_at":"2026-08-04T20:58:34.844659Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-08-17T13:10:52.611064Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-04T20:58:34.283178Z","title":"Mmmu: A massive multi-discipline multi- modal understanding benchmark","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08270","last_updated":"2025-09-10T04:15:01Z","snapshot_observed_at":"2026-08-14T16:35:12.428468Z","submitted_at":"2025-09-10T04:15:01Z","title":"Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:34.283178Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2509.08270"},"observation_digest":"sha256:c3e3f05f5e2f744908d33b21418c6a1d50076552ac006210cb49d2a3c0770262","observation_id":"494d9954-6943-4481-91f7-e18006b01fdb","resolution":{"observed_at":"2026-08-04T20:58:34.283178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:35.580895Z","title":"Llama-adapter: Efficient fine-tuning of language models with zero-init attention","venue":null,"work_id":"d50f3770-e612-43fe-a137-a8b434228554","year":2023},"citing_paper":{"arxiv_id":"2509.08270","last_updated":"2025-09-10T04:15:01Z","snapshot_observed_at":"2026-08-14T16:35:12.428468Z","submitted_at":"2025-09-10T04:15:01Z","title":"Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:34.415057Z"},"links":{"citing_paper":"/paper/2509.08270"},"observation_digest":"sha256:e9ed56297059a2ecdd24e55d896c25f07266ee68c257ed4bd708dad1014ebac9","observation_id":"963377d4-efb1-4d99-b1e3-44c35332ead9","resolution":{"observed_at":"2026-08-04T20:58:35.668974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:35.313275Z","title":"The cater dataset: A diagnostic dataset for compositional actions and temporal reasoning","venue":null,"work_id":"db6df424-63e8-47e9-969e-35404c45644a","year":2020},"citing_paper":{"arxiv_id":"2509.08270","last_updated":"2025-09-10T04:15:01Z","snapshot_observed_at":"2026-08-14T16:35:12.428468Z","submitted_at":"2025-09-10T04:15:01Z","title":"Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:34.564196Z"},"links":{"citing_paper":"/paper/2509.08270"},"observation_digest":"sha256:cea28d4ec7060f3e6d476175c8f7627f35f18dc3dd30ec1cd016c6761b453b3f","observation_id":"46da5d6d-8ee8-4bf8-8fcc-00cb4b906218","resolution":{"observed_at":"2026-08-04T20:58:35.418730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.08270","last_updated":"2025-09-10T04:15:01Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T16:35:12.428468Z","submitted_at":"2025-09-10T04:15:01Z","title":"Interpretable Physics Reasoning and Performance Taxonomy in Vision-Language Models"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2509.08270."}