{"as_of":"2026-08-08T20:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:764ce42947337ca82e825408c06193f726aea6539e3aba2ef28b37bc1387908f","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T04:05:23.901739Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.06033/citation-record","integrity":"/paper/2602.06033/integrity","json":"/paper/2602.06033/citation-record.json","paper":"/paper/2602.06033"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:05:23.844368Z","title":"We first test whether the model has learned some generalizable understanding after all, that would lead to faster supervised fine-tuning (see Section A.9.1)","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2602.06033","last_updated":"2026-06-01T10:27:00Z","snapshot_observed_at":"2026-08-06T16:39:19.204607Z","submitted_at":"2026-02-05T18:59:20Z","title":"Can Vision Language Models Learn Intuitive Physics from Interaction?","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T04:05:23.844368Z"},"links":{"citing_paper":"/paper/2602.06033"},"observation_digest":"sha256:f64138dfadb30a148b921648c9abec91466281b0ca019e6e562092ef1e4e7c54","observation_id":"de36aef6-58c6-4783-8e19-ad35954b42ab","resolution":{"observed_at":"2026-08-03T04:05:23.844368Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-03T04:05:22.952149Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06033","last_updated":"2026-06-01T10:27:00Z","snapshot_observed_at":"2026-08-06T16:39:19.204607Z","submitted_at":"2026-02-05T18:59:20Z","title":"Can Vision Language Models Learn Intuitive Physics from Interaction?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T04:05:22.952149Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2602.06033"},"observation_digest":"sha256:33320da158611bec1d23d486f2ec4316871c78d5f5fd18c34a6f4b244e95909e","observation_id":"11546a4d-d2d2-45b3-a8c8-a13b4238754a","resolution":{"observed_at":"2026-08-03T04:05:22.952149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-03T04:05:23.059639Z","title":"S., and Lin, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06033","last_updated":"2026-06-01T10:27:00Z","snapshot_observed_at":"2026-08-06T16:39:19.204607Z","submitted_at":"2026-02-05T18:59:20Z","title":"Can Vision Language Models Learn Intuitive Physics from Interaction?","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T04:05:23.059639Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2602.06033"},"observation_digest":"sha256:3d6a5261852196760538612443c4c8131939fa8bcf8e50e4a5a1e882d99828ef","observation_id":"19f17a9f-c427-4bd9-b402-2335aec74c8c","resolution":{"observed_at":"2026-08-03T04:05:23.059639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:05:23.322558Z","title":"and Spaulding, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06033","last_updated":"2026-06-01T10:27:00Z","snapshot_observed_at":"2026-08-06T16:39:19.204607Z","submitted_at":"2026-02-05T18:59:20Z","title":"Can Vision Language Models Learn Intuitive Physics from Interaction?","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T04:05:23.322558Z"},"links":{"citing_paper":"/paper/2602.06033"},"observation_digest":"sha256:006c52d7707eb77377235933a461e57f3194dd1512d40b0a1df4302392eb537e","observation_id":"f44ce531-5420-4c85-99ff-1a53da3929a3","resolution":{"observed_at":"2026-08-03T04:05:23.322558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-03T04:05:23.485367Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06033","last_updated":"2026-06-01T10:27:00Z","snapshot_observed_at":"2026-08-06T16:39:19.204607Z","submitted_at":"2026-02-05T18:59:20Z","title":"Can Vision Language Models Learn Intuitive Physics from Interaction?","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T04:05:23.485367Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2602.06033"},"observation_digest":"sha256:b6cceb2ea6c1616035777d92bd30b0f93212b44601ca93037934f456c74c563e","observation_id":"6e3b19d4-11de-485d-b364-bd303fc147f4","resolution":{"observed_at":"2026-08-03T04:05:23.485367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-03T04:05:23.539057Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06033","last_updated":"2026-06-01T10:27:00Z","snapshot_observed_at":"2026-08-06T16:39:19.204607Z","submitted_at":"2026-02-05T18:59:20Z","title":"Can Vision Language Models Learn Intuitive Physics from Interaction?","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T04:05:23.539057Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2602.06033"},"observation_digest":"sha256:42431f596d5fa57305c09b78f6e60be863c82aed9e6a9dee794846f5dc2037cb","observation_id":"5ef2ce40-ca5d-4bb1-b83f-544cb60fbdbd","resolution":{"observed_at":"2026-08-03T04:05:23.539057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-03T04:05:23.617650Z","title":"Group sequence policy optimization.arXiv preprint arXiv:2507.18071,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06033","last_updated":"2026-06-01T10:27:00Z","snapshot_observed_at":"2026-08-06T16:39:19.204607Z","submitted_at":"2026-02-05T18:59:20Z","title":"Can Vision Language Models Learn Intuitive Physics from Interaction?","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T04:05:23.617650Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2602.06033"},"observation_digest":"sha256:0ca1f89aefdf46cec3df1d08dce11fe1d4ba29a0536c1c44104f2edcb350ce3d","observation_id":"b65e2e12-075a-49e8-94a1-0273c7fc510f","resolution":{"observed_at":"2026-08-03T04:05:23.617650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:05:23.770965Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2602.06033","last_updated":"2026-06-01T10:27:00Z","snapshot_observed_at":"2026-08-06T16:39:19.204607Z","submitted_at":"2026-02-05T18:59:20Z","title":"Can Vision Language Models Learn Intuitive Physics from Interaction?","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T04:05:23.770965Z"},"links":{"citing_paper":"/paper/2602.06033"},"observation_digest":"sha256:7150072dd0ee1cc2b97d7dac486004c1564c7ebf9c0a2653c938baf4271b4dcf","observation_id":"e2045bc2-afc4-45eb-992b-11641f7ea944","resolution":{"observed_at":"2026-08-03T04:05:23.770965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:05:23.901739Z","title":"All ablations learn to perform well on the task they are trained on (shown in the second row)","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2602.06033","last_updated":"2026-06-01T10:27:00Z","snapshot_observed_at":"2026-08-06T16:39:19.204607Z","submitted_at":"2026-02-05T18:59:20Z","title":"Can Vision Language Models Learn Intuitive Physics from Interaction?","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T04:05:23.901739Z"},"links":{"citing_paper":"/paper/2602.06033"},"observation_digest":"sha256:5c00ba93d705536c3939b5e790e7e140db466551ab5d0c198c899b12be1c563c","observation_id":"5a37e23f-2412-4db6-b5db-3b6671c4bab1","resolution":{"observed_at":"2026-08-03T04:05:23.901739Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:05:23.722770Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2602.06033","last_updated":"2026-06-01T10:27:00Z","snapshot_observed_at":"2026-08-06T16:39:19.204607Z","submitted_at":"2026-02-05T18:59:20Z","title":"Can Vision Language Models Learn Intuitive Physics from Interaction?","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T04:05:23.722770Z"},"links":{"citing_paper":"/paper/2602.06033"},"observation_digest":"sha256:73611796bd11f4cac1fb27b83cc450bed3742d366298b588a7b9cede87de364f","observation_id":"ded32ca3-3c69-4fa9-88e7-9601b6eb3e82","resolution":{"observed_at":"2026-08-03T04:05:23.722770Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:05:23.676312Z","title":"You can think about the problem for as long as you’d like","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2602.06033","last_updated":"2026-06-01T10:27:00Z","snapshot_observed_at":"2026-08-06T16:39:19.204607Z","submitted_at":"2026-02-05T18:59:20Z","title":"Can Vision Language Models Learn Intuitive Physics from Interaction?","version":2},"reference_index":600,"source":"pdf_text","source_observed_at":"2026-08-03T04:05:23.676312Z"},"links":{"citing_paper":"/paper/2602.06033"},"observation_digest":"sha256:5a0e1caa39041392e8842e9df86d2052c3d9963871045fa66ac13734f5556708","observation_id":"52200104-7a65-417a-afcf-39bc0167d42f","resolution":{"observed_at":"2026-08-03T04:05:23.676312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09038","last_updated":"2025-02-27T15:10:51Z","snapshot_observed_at":"2026-08-02T17:18:33.867969Z","submitted_at":"2025-01-14T20:59:37Z","title":"Do generative video models understand physical principles?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09038","snapshot_observed_at":"2026-08-03T04:05:23.159709Z","title":"Do generative video models learn physical principles from watching videos?arXiv preprint arXiv:2501.09038,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06033","last_updated":"2026-06-01T10:27:00Z","snapshot_observed_at":"2026-08-06T16:39:19.204607Z","submitted_at":"2026-02-05T18:59:20Z","title":"Can Vision Language Models Learn Intuitive Physics from Interaction?","version":2},"reference_index":1945,"source":"pdf_text","source_observed_at":"2026-08-03T04:05:23.159709Z"},"links":{"cited_paper":"/paper/2501.09038","citing_paper":"/paper/2602.06033"},"observation_digest":"sha256:ba8000ea9a8eea7d1365ad62a3b587ce0547ff1dba1fe741b99e00c31e740f19","observation_id":"2de74268-a430-4cb7-a59c-1131244d045f","resolution":{"observed_at":"2026-08-03T04:05:23.159709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:05:23.403051Z","title":"On the general- ization of sft: A reinforcement learning perspective with reward rectification.arXiv preprint arXiv:2508.05629,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06033","last_updated":"2026-06-01T10:27:00Z","snapshot_observed_at":"2026-08-06T16:39:19.204607Z","submitted_at":"2026-02-05T18:59:20Z","title":"Can Vision Language Models Learn Intuitive Physics from Interaction?","version":2},"reference_index":1991,"source":"pdf_text","source_observed_at":"2026-08-03T04:05:23.403051Z"},"links":{"citing_paper":"/paper/2602.06033"},"observation_digest":"sha256:1664f4f7119afa49611d7b36e672a7603eaf153d677d59592ccb875aad228fc6","observation_id":"7a6d3eaf-132b-44ec-90b4-7521e9a89fda","resolution":{"observed_at":"2026-08-03T04:05:23.403051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:05:22.481052Z","title":"H., and Krishnan, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06033","last_updated":"2026-06-01T10:27:00Z","snapshot_observed_at":"2026-08-06T16:39:19.204607Z","submitted_at":"2026-02-05T18:59:20Z","title":"Can Vision Language Models Learn Intuitive Physics from Interaction?","version":2},"reference_index":1995,"source":"pdf_text","source_observed_at":"2026-08-03T04:05:22.481052Z"},"links":{"citing_paper":"/paper/2602.06033"},"observation_digest":"sha256:fe0c5f046edba02d62cf1db21fe8b4a6084556d9a25da195c67b706d450133d1","observation_id":"92c5f367-802a-4afe-9fcd-faf0239002bf","resolution":{"observed_at":"2026-08-03T04:05:22.481052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05718","last_updated":"2022-05-11T18:14:33Z","snapshot_observed_at":"2026-07-06T13:09:03.269759Z","submitted_at":"2022-05-11T18:14:33Z","title":"Structured, flexible, and robust: benchmarking and improving large language models towards more human-like behavior in out-of-distribution reasoning tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05718","snapshot_observed_at":"2026-08-03T04:05:22.674062Z","title":"M., Wong, C., Feng, J., Wei, M., and Tenenbaum, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06033","last_updated":"2026-06-01T10:27:00Z","snapshot_observed_at":"2026-08-06T16:39:19.204607Z","submitted_at":"2026-02-05T18:59:20Z","title":"Can Vision Language Models Learn Intuitive Physics from Interaction?","version":2},"reference_index":1998,"source":"pdf_text","source_observed_at":"2026-08-03T04:05:22.674062Z"},"links":{"cited_paper":"/paper/2205.05718","citing_paper":"/paper/2602.06033"},"observation_digest":"sha256:611293bed250b7082490c86e32592e7bf852bbad4750bda58ed65dde842ee19e","observation_id":"ccbdacab-88e3-4cba-8791-902cd3ed25a7","resolution":{"observed_at":"2026-08-03T04:05:22.674062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-03T04:05:23.240978Z","title":"M., Akata, E., Bethge, M., and Schulz, E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06033","last_updated":"2026-06-01T10:27:00Z","snapshot_observed_at":"2026-08-06T16:39:19.204607Z","submitted_at":"2026-02-05T18:59:20Z","title":"Can Vision Language Models Learn Intuitive Physics from Interaction?","version":2},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-03T04:05:23.240978Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2602.06033"},"observation_digest":"sha256:6643116f0ea2b58719f3680554e78753ae3fd09b4b783dd9d7814a271aee55d1","observation_id":"8bebd1df-3403-412d-911e-6c3b731a0697","resolution":{"observed_at":"2026-08-03T04:05:23.240978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20268","last_updated":"2025-04-28T11:50:42Z","snapshot_observed_at":"2026-08-02T00:37:02.590933Z","submitted_at":"2024-10-26T20:39:41Z","title":"Centaur: a foundation model of human cognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20268","snapshot_observed_at":"2026-08-03T04:05:22.520856Z","title":"K., ´Eltet˝o, N., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06033","last_updated":"2026-06-01T10:27:00Z","snapshot_observed_at":"2026-08-06T16:39:19.204607Z","submitted_at":"2026-02-05T18:59:20Z","title":"Can Vision Language Models Learn Intuitive Physics from Interaction?","version":2},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-03T04:05:22.520856Z"},"links":{"cited_paper":"/paper/2410.20268","citing_paper":"/paper/2602.06033"},"observation_digest":"sha256:b6bf882b6e6d64e1c8927e85a5d7ad62c1adce6f6e38f2c3674e7aeed814ecaa","observation_id":"7c75f07e-cd54-41cc-bf89-84bd587d048a","resolution":{"observed_at":"2026-08-03T04:05:22.520856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-03T04:05:23.006057Z","title":"Offline rein- forcement learning: Tutorial, review, and perspectives on open problems.arXiv preprint arXiv:2005.01643,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2602.06033","last_updated":"2026-06-01T10:27:00Z","snapshot_observed_at":"2026-08-06T16:39:19.204607Z","submitted_at":"2026-02-05T18:59:20Z","title":"Can Vision Language Models Learn Intuitive Physics from Interaction?","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-03T04:05:23.006057Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2602.06033"},"observation_digest":"sha256:2ae0fe53774eb13457893470381abd570efc8e407cd52537b0df599de87d5138","observation_id":"ee16f694-368e-4cf0-927c-23755537ff15","resolution":{"observed_at":"2026-08-03T04:05:23.006057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-03T04:05:22.588795Z","title":"V ., Levine, S., and Ma, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06033","last_updated":"2026-06-01T10:27:00Z","snapshot_observed_at":"2026-08-06T16:39:19.204607Z","submitted_at":"2026-02-05T18:59:20Z","title":"Can Vision Language Models Learn Intuitive Physics from Interaction?","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T04:05:22.588795Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2602.06033"},"observation_digest":"sha256:8ea36874178ac48c5c7fcbe6f3613b9331592691d6c6ab697b07938e979fdeb6","observation_id":"a04e0816-dc25-412c-8fa3-20fc265f8999","resolution":{"observed_at":"2026-08-03T04:05:22.588795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.04954","last_updated":"2021-12-28T17:03:21Z","snapshot_observed_at":"2026-08-06T18:18:46.317619Z","submitted_at":"2020-07-09T17:33:27Z","title":"ThreeDWorld: A Platform for Interactive Multi-Modal Physical Simulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.04954","snapshot_observed_at":"2026-08-03T04:05:22.730793Z","title":"Threedworld: A platform for inter- active multi-modal physical simulation.arXiv preprint arXiv:2007.04954,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2602.06033","last_updated":"2026-06-01T10:27:00Z","snapshot_observed_at":"2026-08-06T16:39:19.204607Z","submitted_at":"2026-02-05T18:59:20Z","title":"Can Vision Language Models Learn Intuitive Physics from Interaction?","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T04:05:22.730793Z"},"links":{"cited_paper":"/paper/2007.04954","citing_paper":"/paper/2602.06033"},"observation_digest":"sha256:c3ab9f7d6620dc60ae8f43beed08bf8497772e624a0d71b3051d372e0cab6949","observation_id":"0a3c529b-1040-4b19-b11f-d526fdc74746","resolution":{"observed_at":"2026-08-03T04:05:22.730793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14608","last_updated":"2024-09-16T02:54:50Z","snapshot_observed_at":"2026-08-04T09:07:42.158421Z","submitted_at":"2024-03-21T17:55:50Z","title":"Parameter-Efficient Fine-Tuning for Large Models: A Comprehensive Survey","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14608","snapshot_observed_at":"2026-08-03T04:05:22.773568Z","title":"Han, Z., Gao, C., Liu, J., Zhang, J., and Zhang, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06033","last_updated":"2026-06-01T10:27:00Z","snapshot_observed_at":"2026-08-06T16:39:19.204607Z","submitted_at":"2026-02-05T18:59:20Z","title":"Can Vision Language Models Learn Intuitive Physics from Interaction?","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T04:05:22.773568Z"},"links":{"cited_paper":"/paper/2403.14608","citing_paper":"/paper/2602.06033"},"observation_digest":"sha256:13b351e3a83fec3f9d84335a088af5fc38aea0ff4e02c9f634d4a0eb96ffe527","observation_id":"2a7f194c-81ea-4160-8949-bc6924cf5d98","resolution":{"observed_at":"2026-08-03T04:05:22.773568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-03T04:05:22.827674Z","title":"J., Shen, Y ., Wallis, P., Allen-Zhu, Z., Li, Y ., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06033","last_updated":"2026-06-01T10:27:00Z","snapshot_observed_at":"2026-08-06T16:39:19.204607Z","submitted_at":"2026-02-05T18:59:20Z","title":"Can Vision Language Models Learn Intuitive Physics from Interaction?","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T04:05:22.827674Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2602.06033"},"observation_digest":"sha256:9b0e8bff4f43261f2a90b743a6dfcb9ee6781eeb03ac8ba17ebdcc0319f64266","observation_id":"074aab02-21a8-41fd-a2cc-ddfcd6bc3637","resolution":{"observed_at":"2026-08-03T04:05:22.827674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23242","last_updated":"2025-01-03T11:29:35Z","snapshot_observed_at":"2026-08-06T08:06:24.801229Z","submitted_at":"2024-10-30T17:28:28Z","title":"A little less conversation, a little more action, please: Investigating the physical common-sense of LLMs in a 3D embodied environment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23242","snapshot_observed_at":"2026-08-03T04:05:23.109468Z","title":"G., Slater, B., Teˇsi´c, M., Prunty, J., V oudouris, K., and Cheke, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06033","last_updated":"2026-06-01T10:27:00Z","snapshot_observed_at":"2026-08-06T16:39:19.204607Z","submitted_at":"2026-02-05T18:59:20Z","title":"Can Vision Language Models Learn Intuitive Physics from Interaction?","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T04:05:23.109468Z"},"links":{"cited_paper":"/paper/2410.23242","citing_paper":"/paper/2602.06033"},"observation_digest":"sha256:0778a4b47a98b617e74423348930f254b6e6dc05d689ca89737fcbb00633ea29","observation_id":"8b0baa7e-f21c-4e54-8c8d-d618e64fc365","resolution":{"observed_at":"2026-08-03T04:05:23.109468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.06033","last_updated":"2026-06-01T10:27:00Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T16:39:19.204607Z","submitted_at":"2026-02-05T18:59:20Z","title":"Can Vision Language Models Learn Intuitive Physics from Interaction?"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2602.06033."}