{"as_of":"2026-08-05T02:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:607e58970405a127d654f18d59d6e87de129ea4a1b2c55c60e7909fe40588cb3","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T06:14:26.824489Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.20576/citation-record","integrity":"/paper/2605.20576/integrity","json":"/paper/2605.20576/citation-record.json","paper":"/paper/2605.20576"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The claude 3 model family: Opus, son- net, haiku.https : / / assets","venue":null,"work_id":"b315a6fb-f230-4499-92ab-da544831e7ab","year":2024},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:6d95bd29cc116e65135a15a6ea0f06a07635fa03cc0d1c405c6d53ac21b8de54","observation_id":"04a7bb31-628b-4627-adee-a04bb7a444b3","resolution":{"observed_at":"2026-05-21T06:14:41.087736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vqa: Visual question answering","venue":null,"work_id":"40b7f112-cb2d-49d4-a86a-1beda78b1ffa","year":2015},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:300db5dd31152493220a6d3f8440247c132506a8924a14c42f222f85a2872ce2","observation_id":"0d86b9aa-efb2-4563-89bf-892cd0eb09db","resolution":{"observed_at":"2026-05-21T06:14:41.085524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vivit: A video vi- sion transformer","venue":null,"work_id":"5712630c-c537-4e36-8759-fe9e27375d24","year":2021},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:6c685f41bd706bd9b13a1687f4d50c75cb40e6c7a946d6398380d3639efda2c6","observation_id":"b9be8504-3c06-403b-8d89-0fbd82a72387","resolution":{"observed_at":"2026-05-21T06:14:41.091847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vid2param: Modeling of dynamics parameters from video","venue":null,"work_id":"aeca1a29-9474-4c42-8246-3f4a3fa7e18a","year":2019},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:46fdda3f399b351a5201ac92aaf773ba6bde6abf3928c12ac994d574e6f5a306","observation_id":"88b76c1b-37fd-4e32-b086-ab5bbf3fc00d","resolution":{"observed_at":"2026-05-21T06:14:41.163323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.04293","last_updated":"2022-03-01T10:02:21Z","snapshot_observed_at":"2026-08-04T22:05:13.238910Z","submitted_at":"2020-12-08T09:11:32Z","title":"CRAFT: A Benchmark for Causal Reasoning About Forces and inTeractions","version":3},"cited_work":{"arxiv_id":"2012.04293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.04293","snapshot_observed_at":"2026-07-08T03:14:31.630520Z","title":"Craft: A benchmark for causal reasoning about forces and interactions.arXiv preprint arXiv:2012.04293","venue":"cs.AI","work_id":"372796bd-4641-47cd-a8c9-4872c0697f61","year":2020},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"cited_paper":"/paper/2012.04293","citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:f14b57857b88aa44e03b976addc85147e5d80e24226f453103bf661c08ba8089","observation_id":"c864b04d-b2bf-493d-b345-1164ca3a62e6","resolution":{"observed_at":"2026-05-21T06:14:40.970016Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:0c9e4954e3371ea1e7cd060e5d75b9aa7d92bdb7273f6ac8d39cf1fa9913c669","observation_id":"2bf8236e-9e76-44ec-9085-6f229add1f0a","resolution":{"observed_at":"2026-05-21T06:14:41.001215Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12000","last_updated":"2020-04-07T12:48:26Z","snapshot_observed_at":"2026-08-02T22:54:21.229562Z","submitted_at":"2019-09-26T09:34:48Z","title":"CoPhy: Counterfactual Learning of Physical Dynamics","version":2},"cited_work":{"arxiv_id":"1909.12000","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1909.12000","snapshot_observed_at":"2026-07-04T00:29:15.546899Z","title":"Cophy: Counterfactual learning of phys- ical dynamics","venue":null,"work_id":"06369e64-377e-4d0c-a614-536c7b180480","year":1909},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"cited_paper":"/paper/1909.12000","citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:967a9ba031bbd19b73d0399d710b87fc247e94e38d5ddf55e85e7a34d1cfecd8","observation_id":"f9b86a8c-8223-43fb-a9d2-dc30163aec65","resolution":{"observed_at":"2026-05-21T06:14:40.947897Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interaction networks for learning about objects, relations and physics.Advances in neural in- formation processing systems, 29","venue":null,"work_id":"0bd28ebd-f195-45be-ae03-ebb7be8bf0e2","year":2016},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:1cdf3f75cf86256398ab06fdf269c52b5cd6440cdf38aa98036457c40b1bd6d2","observation_id":"ba3d5c7b-affe-44a4-b51e-9e19210a8eab","resolution":{"observed_at":"2026-05-21T06:14:41.170137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Detikz- ify: Synthesizing graphics programs for scientific figures and sketches with tikz.Advances in Neural Information Process- ing Systems, 37:85074–85108","venue":null,"work_id":"082c4ec3-f4a2-4989-849d-2033f99803c2","year":2024},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:2187118c9046d5569eb2ac75871888c2c4c69d6369d32086f5efa02ea1b7e645","observation_id":"cc6a1d96-4857-4c60-afb9-a9eb4d3cf24a","resolution":{"observed_at":"2026-05-21T06:14:41.122397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11509","last_updated":"2025-08-14T08:52:03Z","snapshot_observed_at":"2026-07-06T20:52:45.934843Z","submitted_at":"2025-03-14T15:29:58Z","title":"TikZero: Zero-Shot Text-Guided Graphics Program Synthesis","version":3},"cited_work":{"arxiv_id":"2503.11509","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.11509","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tikzero: Zero-shot text-guided graphics program synthesis","venue":null,"work_id":"e1cdd7e2-a566-46f2-a464-7eed558d067c","year":2025},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"cited_paper":"/paper/2503.11509","citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:5a8cf92cb89e84c6dce026e1efe1f589b8c56e7fd2df34f6e7d3df248ebadf98","observation_id":"0942bf82-4206-439e-ac12-5fc334af0dec","resolution":{"observed_at":"2026-05-21T06:14:41.029711Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chat- garment: Garment estimation, generation and editing via large language models","venue":null,"work_id":"f5a1701f-43e7-47b1-a6b9-e8087804f3fa","year":2025},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:e599843190126df95eaa7ce5f873c0d229a3966dff2aa5f92965efd732de81b5","observation_id":"d6562a23-d711-4126-9243-f1b38674075a","resolution":{"observed_at":"2026-05-21T06:14:41.154608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":"ad493af5-f66f-48ec-8bc8-d5f7169a0d2c","year":1952},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:4e0dee48a2c38de7e6a48340c691043cb58ceced08b9750bbaee86ce32d581d2","observation_id":"3d2c57b7-b61f-4a41-87cf-bea98e87aac1","resolution":{"observed_at":"2026-05-21T06:14:41.158747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Go-with-the-flow: Motion- controllable video diffusion models using real-time warped noise","venue":null,"work_id":"e8303746-744e-4ee6-a745-37a861366b8c","year":2025},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:cd3d7003504170ad5cdf248bf6846d86eb23ecda8b7f460eba9dfe30f918077f","observation_id":"18f2b076-4b74-434f-bf97-274b71632c42","resolution":{"observed_at":"2026-05-21T06:14:41.150201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11893","last_updated":"2019-11-27T00:34:38Z","snapshot_observed_at":"2026-08-01T06:13:56.142425Z","submitted_at":"2019-11-27T00:34:38Z","title":"Visual Physics: Discovering Physical Laws from Videos","version":1},"cited_work":{"arxiv_id":"1911.11893","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1911.11893","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual physics: Discovering physical laws from videos","venue":null,"work_id":"1a0a75d9-3fd3-4280-b50b-357ce603c024","year":1911},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"cited_paper":"/paper/1911.11893","citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:f6fde521d4047bc95b80eaec0c11a1a40fcc777d967997bc7a3e4a5deca4b558","observation_id":"46a5906b-bbf9-4a1a-9959-fcbdc748851d","resolution":{"observed_at":"2026-05-21T06:14:41.012916Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.05208","last_updated":"2025-09-05T16:10:53Z","snapshot_observed_at":"2026-07-06T22:24:38.247543Z","submitted_at":"2025-09-05T16:10:53Z","title":"Symbolic Graphics Programming with Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.05208","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.05208","snapshot_observed_at":"2026-06-28T23:42:49.532049Z","title":"Symbolic graphics programming with large language models","venue":null,"work_id":"1f4f8743-16da-46fb-9219-62eaf02558d9","year":2025},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"cited_paper":"/paper/2509.05208","citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:914d6dcf2ace40bce062632d3733171d22691a5b60e4bbcdb5f8568ba9360161","observation_id":"86d2ee17-1358-4e80-a270-0c55bc629226","resolution":{"observed_at":"2026-05-21T06:14:40.951882Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":"ff6bd5b1-245b-4a05-a2b1-e1977e8e6539","year":2024},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:424644ea122444dbc21766535782a191d437258894fb26e73598da72ef0917b0","observation_id":"95e95efb-463e-40a4-bd78-9775e669abc2","resolution":{"observed_at":"2026-05-21T06:14:41.108853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16411","last_updated":"2025-01-29T03:52:39Z","snapshot_observed_at":"2026-08-02T23:35:21.038166Z","submitted_at":"2025-01-27T18:59:58Z","title":"PhysBench: Benchmarking and Enhancing Vision-Language Models for Physical World Understanding","version":2},"cited_work":{"arxiv_id":"2501.16411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.16411","snapshot_observed_at":"2026-07-09T18:06:25.898385Z","title":"PhysBench: Benchmarking and enhancing vision-language models for physical world understanding","venue":"cs.CV","work_id":"3a5e1663-11b8-43aa-8e78-33ab23326881","year":2025},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"cited_paper":"/paper/2501.16411","citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:6f48c661734d2d71256302cf586727ccfd851bd3c1ef8fc597dede80e3f44fe0","observation_id":"e87495d2-7025-455f-9942-efeb2ac24e45","resolution":{"observed_at":"2026-05-21T06:14:40.989000Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models.arXiv e-prints, pages arXiv–2409","venue":null,"work_id":"d2c6ef6a-1f30-4840-a356-d0bb8e239c52","year":2024},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:2cbb6dfabb55aae3ed950ca38a523385663243a9ccad0f726696f59d443c64f9","observation_id":"e06bcd8e-dd7f-47fb-81d9-02a8f2e4827d","resolution":{"observed_at":"2026-05-21T06:14:41.096669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamic visual reasoning by learning differentiable physics models from video and lan- guage.Advances in Neural Information Processing Systems, 34:887–899","venue":null,"work_id":"4243d2de-c0ba-463d-a160-eafe787107d1","year":2021},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:33590fcd9d0ba58db782d3436fe4c4a5471def8ddf7d895f1ab8fab0dc769f43","observation_id":"926f975c-ebcf-49f8-bfd0-bf6056e99c6c","resolution":{"observed_at":"2026-05-21T06:14:41.174336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unsupervised intuitive physics from visual ob- servations","venue":null,"work_id":"4cfe130a-7abf-4f40-a1ee-65f1f907b170","year":2018},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:3ba16f2b2a2305831c10b2601bdcb6fa1f5e04aaa09805c92f4b78cd4471c9c9","observation_id":"cc2fb2ea-0b0a-444b-a29e-a70defa7dc53","resolution":{"observed_at":"2026-05-21T06:14:41.106452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13281","last_updated":"2021-06-24T19:09:12Z","snapshot_observed_at":"2026-07-06T11:22:55.799017Z","submitted_at":"2021-06-24T19:09:12Z","title":"Brax -- A Differentiable Physics Engine for Large Scale Rigid Body Simulation","version":1},"cited_work":{"arxiv_id":"2106.13281","doi":"10.48550/arxiv.2106.13281","metadata_source":"pith","pith_arxiv_id":"2106.13281","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Brax–a differentiable physics engine for large scale rigid body simulation","venue":"cs.RO","work_id":"0ec42bc1-d52a-4486-a223-298fabbf8504","year":2021},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"cited_paper":"/paper/2106.13281","citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:2bddec1d8a66e4fd2ce90dbf65a8b436ae4b89dcd5b60369705e0fc2fbfe918a","observation_id":"1806cd10-93ec-4aad-9d49-531dcdadac54","resolution":{"observed_at":"2026-05-21T06:14:40.938465Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-03T14:38:10.488566+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T14:38:10.488566+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Geometric-averaged preference optimization for soft pref- erence labels.Advances in Neural Information Processing Systems, 37:57076–57114","venue":null,"work_id":"2f53389f-7c5a-4a28-a137-0c810c19fb3b","year":2024},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:66efec35b439e2a4ec69a3ea8e0c6cc78eb518e863e87c39db572d493681b8e2","observation_id":"0a3b2c5c-36a7-4703-a160-feee1d2a9f67","resolution":{"observed_at":"2026-05-21T06:14:41.101943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning physics from video: Unsupervised physical parameter estimation for continuous dynamical systems","venue":null,"work_id":"7b9ae407-1607-4d8e-8631-6246b226a29b","year":2025},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:8e2ad6ca186ca1cdf23fd7ae903c2b15e5a2877fe08f5a5a28805bea1849ab2e","observation_id":"19b3e421-ad7f-40ce-9edd-3bb4143a4df9","resolution":{"observed_at":"2026-05-21T06:14:41.131128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blendergym: Benchmarking foundational model systems for graphics editing","venue":null,"work_id":"48b1c97d-18ea-4cbb-a25b-a52d8eb75a82","year":2025},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:41b05e5c883ad356462a8a738a19e84d67e3498123431270e9f97d55e4893eb1","observation_id":"d5401893-a269-43e2-b399-427229955a18","resolution":{"observed_at":"2026-05-21T06:14:41.124764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adapting arbi- trary normal mutation distributions in evolution strategies: The covariance matrix adaptation","venue":null,"work_id":"1432ee18-a890-41cd-91f0-1abcc64632c0","year":1996},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:f782fd2aa0635212aa37183322380f4227b1cada4c91373990c88ce381b05418","observation_id":"06fedaca-0572-49c9-a6ad-c4a08cebfdfc","resolution":{"observed_at":"2026-05-21T06:14:41.152487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning articulated rigid body dynamics simulations from video","venue":null,"work_id":"4e4bf479-e97e-4dfa-ad6e-c13c9ffc5008","year":2022},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:1021fe2e32a023030863aadbaea2a0972ba140cdac4ffeab7ad82a8ef131a0f0","observation_id":"8449cf03-2117-4382-a8ba-7cf8d564a089","resolution":{"observed_at":"2026-05-21T06:14:41.117710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00935","last_updated":"2020-02-14T06:21:07Z","snapshot_observed_at":"2026-08-04T18:08:10.197355Z","submitted_at":"2019-10-01T05:00:26Z","title":"DiffTaichi: Differentiable Programming for Physical Simulation","version":3},"cited_work":{"arxiv_id":"1910.00935","doi":"10.48550/arxiv.1910.00935","metadata_source":"arxiv_reference","pith_arxiv_id":"1910.00935","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Difftaichi: Differentiable programming for physical simulation","venue":"arXiv (Cornell University)","work_id":"06509811-3543-4663-b998-31dd83e8aa20","year":1910},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"cited_paper":"/paper/1910.00935","citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:c98174c3c8bc3246b00a43dc18518a02e760939b97bfa8e07e60879d4f668fa8","observation_id":"a971e5f7-2899-4222-b7bc-cebf7dc5b627","resolution":{"observed_at":"2026-05-21T06:14:41.009266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-03T14:38:10.975022+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T14:38:10.975022+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03311","last_updated":"2021-04-07T17:59:23Z","snapshot_observed_at":"2026-07-06T10:57:21.385661Z","submitted_at":"2021-04-07T17:59:23Z","title":"PlasticineLab: A Soft-Body Manipulation Benchmark with Differentiable Physics","version":1},"cited_work":{"arxiv_id":"2104.03311","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.03311","snapshot_observed_at":"2026-07-01T07:55:30.572047Z","title":"Plasticinelab: A soft-body manipulation benchmark with differentiable physics","venue":null,"work_id":"ec2ba4ea-f5a6-4a0d-bd9a-397ed0f15fe8","year":2021},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"cited_paper":"/paper/2104.03311","citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:47f10b437138d6e309a3fd355c7e4c64531da2377e08493d438ccbcfbdea6d27","observation_id":"7be47215-f259-42d5-b952-9ff2fba237ec","resolution":{"observed_at":"2026-05-21T06:14:41.026529Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.02646","last_updated":"2021-04-06T16:32:01Z","snapshot_observed_at":"2026-07-06T10:56:57.973956Z","submitted_at":"2021-04-06T16:32:01Z","title":"gradSim: Differentiable simulation for system identification and visuomotor control","version":1},"cited_work":{"arxiv_id":"2104.02646","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.02646","snapshot_observed_at":"2026-07-04T17:39:59.952784Z","title":"gradsim: Differentiable simulation for sys- tem identification and visuomotor control","venue":null,"work_id":"a9707785-ef6a-472f-8a11-8a130af870da","year":2021},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"cited_paper":"/paper/2104.02646","citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:5017c1bbd662c6bc2a55333f4664c5c5fe0adfd202eb0c450ed25e1aa6d6be85","observation_id":"09fa7265-a05f-4efc-b0da-29eff3a955b2","resolution":{"observed_at":"2026-05-21T06:14:40.960559Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Intu- itive physics: Current research and controversies.Trends in cognitive sciences, 21(10):749–759","venue":null,"work_id":"8e653369-3edc-4447-a76b-e77717051abc","year":2017},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:c941135ad85f8af16afea53161ca26df8584091cb8b6aa775b6ea86c0b2d1fa1","observation_id":"305399fe-1d03-4225-906b-d7a9bf385ad8","resolution":{"observed_at":"2026-05-21T06:14:41.165482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15228","last_updated":"2024-08-24T03:51:44Z","snapshot_observed_at":"2026-07-06T18:04:30.291363Z","submitted_at":"2024-04-23T16:59:02Z","title":"Re-Thinking Inverse Graphics With Large Language Models","version":2},"cited_work":{"arxiv_id":"2404.15228","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.15228","snapshot_observed_at":"2026-07-01T22:46:19.373597Z","title":"Re-thinking inverse graphics with large language models","venue":null,"work_id":"fbbf79f5-6802-45de-9972-2ca105b9e799","year":2024},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"cited_paper":"/paper/2404.15228","citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:d1cef3e5cebab5a4044f324c346d44641d71a03da646e545d3fe2fe4640dbe2c","observation_id":"4fb8e351-43b8-41f6-adc8-05fc549aca91","resolution":{"observed_at":"2026-05-21T06:14:41.016416Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reconstruct- ing animals and the wild","venue":null,"work_id":"47fbf982-5c2b-448a-9a1b-7fe0e822f907","year":null},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:5dcaae6e91d4ab8ff92b76a3bc1924d0b5ea5cdf161aa9021dcf58894712dcac","observation_id":"87e18064-c7f6-4a0a-bde2-58bf1808a255","resolution":{"observed_at":"2026-05-21T06:14:41.089745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13882","last_updated":"2025-06-02T15:59:31Z","snapshot_observed_at":"2026-07-06T19:35:30.732080Z","submitted_at":"2024-10-03T19:42:16Z","title":"Articulate-Anything: Automatic Modeling of Articulated Objects via a Vision-Language Foundation Model","version":4},"cited_work":{"arxiv_id":"2410.13882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13882","snapshot_observed_at":"2026-07-04T17:29:59.803552Z","title":"Articulate-anything: Automatic modeling of articulated objects via a vision-language foundation model","venue":null,"work_id":"15ce96b2-75d4-497b-892e-2f2fdb53d294","year":2024},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"cited_paper":"/paper/2410.13882","citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:e00463c88a4d7896cbc9c6592c60f26da25b2705ce3885ce406359b43b1b726b","observation_id":"304a1a86-c4e2-4237-b60c-f2bcdaffde10","resolution":{"observed_at":"2026-05-21T06:14:41.023077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:53:32.175571Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916","venue":null,"work_id":"a778ff6a-f7fb-434e-bacd-489db651bc50","year":2023},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:1a3470a79a0ce2169a5de6771b7ac31115b6bf7cdfc5566172cc222a72d61356","observation_id":"ea75994b-7c04-4f69-9a45-02897864fb57","resolution":{"observed_at":"2026-05-21T06:14:41.143931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"7589a6a0-833c-4a37-81ba-14f4c8f6b220","year":2024},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:5d700484e454bbcb247d553486917fbf565e086a73fb035a078bd4678d10b592","observation_id":"b2febb15-6531-4170-b9a9-8facf2ac6f78","resolution":{"observed_at":"2026-05-21T06:14:41.098842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"885eb2bb-df12-4555-87c1-88550be3f725","year":2021},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:26e4a5cde590e7f5ca994c923154973ee2c45e5360f0c86dbe918c222871635e","observation_id":"9b1e84b9-0d71-4861-8367-324048a87a85","resolution":{"observed_at":"2026-05-21T06:14:41.134198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uniphy: Learning a unified constitutive model for inverse physics simulation","venue":null,"work_id":"e51b1a5a-5035-4689-be25-4a6685646853","year":2025},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:d6f244be08fab4112b7dbf48a1190d14b2bb635d37086516061e99b9e3fb5d0c","observation_id":"2f7f615c-1a6d-4d36-92c6-6fe452bc9096","resolution":{"observed_at":"2026-05-21T06:14:41.111162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neu- physics: Editable neural geometry and physics from monoc- ular videos.Advances in Neural Information Processing Sys- tems, 35:12841–12854","venue":null,"work_id":"a1391016-ed39-4145-a76a-ccb03ae91613","year":2022},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:5eb9d13074a1a6acb0b9a494737222cd139726b7089fedada93e1bc927187559","observation_id":"66a43451-5182-4aae-ac3f-2dc309ebf6a1","resolution":{"observed_at":"2026-05-21T06:14:41.104208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00730","last_updated":"2020-05-14T00:24:13Z","snapshot_observed_at":"2026-07-06T09:17:02.233694Z","submitted_at":"2020-05-02T07:03:06Z","title":"ESPRIT: Explaining Solutions to Physical Reasoning Tasks","version":2},"cited_work":{"arxiv_id":"2005.00730","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2005.00730","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Riochet, R., Castro, M","venue":null,"work_id":"1fad2a71-3826-403b-b5c1-f08e19f4089b","year":2005},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"cited_paper":"/paper/2005.00730","citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:346ce66676a7510dc59ed84a68cb804357d6a6d96db2f6b0f8e193d071b9b1b6","observation_id":"3344b351-53b4-4c68-9749-9a498c037bb7","resolution":{"observed_at":"2026-05-21T06:14:40.965845Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":"2408.00714","doi":"10.1038/s41598-025-97590-3","metadata_source":"pith","pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 2: Segment Anything in Images and Videos","venue":"cs.CV","work_id":"acc13f66-d814-44f9-9688-375688bf2d4a","year":2024},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:7c1ae40ac759ba8243875e9a3e116b3a21dbe36ffb20ee7f9804cbec5da9e381","observation_id":"0efd2579-7bf3-494f-907a-56922a508dc4","resolution":{"observed_at":"2026-05-21T06:14:40.983526Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Intphys 2019: A benchmark for visual intuitive physics understanding.IEEE Transactions on Pattern Anal- ysis and Machine Intelligence, 44(9):5016–5025","venue":null,"work_id":"bfb25e8d-a5bf-4e16-8d3e-609357af60c3","year":2019},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:a398c0440a076283793ddef8641c2018ecbbb89cf0a47df47f120763c7e9f28f","observation_id":"91fa324f-2c11-4b37-a88d-ac6ad2460ff4","resolution":{"observed_at":"2026-05-21T06:14:41.113286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Starvector: Gener- ating scalable vector graphics code from images and text","venue":null,"work_id":"a7710143-df0a-47e5-b2a2-85f2b6dc4a8e","year":2025},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:19b031238ad366546d2d73fa221d88b285a9845071c6b8c4f5fe5e9933c83b2f","observation_id":"3660ddc4-2f93-4c67-be54-77d0690cfed1","resolution":{"observed_at":"2026-05-21T06:14:41.148185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.08002","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aligning text, images, and 3d structure token-by-token","venue":null,"work_id":"1842ebcc-fab4-4c9c-bdb5-3f1d5ed2623a","year":2025},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:7e3541f368f0a6417f775af162031b8df3fe0e898f5b197ccc51dda7cc200cf1","observation_id":"bca6b8be-df9c-4411-8801-9bce2f36e704","resolution":{"observed_at":"2026-05-21T06:14:41.019629Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00747","last_updated":"2024-10-04T00:31:48Z","snapshot_observed_at":"2026-07-06T18:08:21.770341Z","submitted_at":"2024-04-30T19:48:55Z","title":"Soft Preference Optimization: Aligning Language Models to Expert Distributions","version":4},"cited_work":{"arxiv_id":"2405.00747","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00747","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Soft preference opti- mization: Aligning language models to expert distributions","venue":null,"work_id":"18efcb5d-0ce5-465b-bd0d-19a4e2280739","year":2024},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"cited_paper":"/paper/2405.00747","citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:f0296187c18eab40228ad2f27e2b309bc3090e512060c0ac2620d3ef5f7e21f6","observation_id":"fb7f33ec-78c5-4dc7-b28e-a93741353f7f","resolution":{"observed_at":"2026-05-21T06:14:41.004822Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Preference rank- ing optimization for human alignment","venue":null,"work_id":"53768457-a48e-4c4f-bd41-5af1e963bd98","year":2024},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:c520b49999f6475a8d2a5ee96ba2933d3727392833c51290be887de9fa5ef3a5","observation_id":"47fbb044-0257-42da-9352-d697ef7c2f00","resolution":{"observed_at":"2026-05-21T06:14:41.136207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01105","last_updated":"2025-08-13T17:32:12Z","snapshot_observed_at":"2026-07-06T20:30:02.903743Z","submitted_at":"2025-02-03T06:49:58Z","title":"LayerTracer: Cognitive-Aligned Layered SVG Synthesis via Diffusion Transformer","version":3},"cited_work":{"arxiv_id":"2502.01105","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01105","snapshot_observed_at":"2026-07-01T21:16:14.742757Z","title":"Layer- tracer: Cognitive-aligned layered svg synthesis via diffusion transformer","venue":null,"work_id":"82354d89-1e17-43af-a789-9fb06fd0d6d5","year":2025},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"cited_paper":"/paper/2502.01105","citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:b101d36b994b4e8b6ba0d683e6dacfa9045860e676e06a7400077ace81e3d658","observation_id":"1e4d4f28-6052-4448-a6bd-83a934725606","resolution":{"observed_at":"2026-05-21T06:14:40.979913Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dif- fcloud: Real-to-sim from point clouds with differentiable simulation and rendering of deformable objects","venue":null,"work_id":"7dcd04ef-a19f-48b3-82e0-7b367a19fdc7","year":2022},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:0dd46fde26bedcfb1f0fdf2cf5217aca10c433c17b4cf4f425621ff16e487875","observation_id":"b113c877-3e8c-4fd2-9b71-dd03860a56f3","resolution":{"observed_at":"2026-05-21T06:14:41.172049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.01237","last_updated":"2025-08-02T07:22:51Z","snapshot_observed_at":"2026-08-04T23:44:22.739045Z","submitted_at":"2025-08-02T07:22:51Z","title":"SketchAgent: Generating Structured Diagrams from Hand-Drawn Sketches","version":1},"cited_work":{"arxiv_id":"2508.01237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.01237","snapshot_observed_at":"2026-06-29T12:53:26.622418Z","title":"Sketchagent: Generating structured diagrams from hand- drawn sketches","venue":null,"work_id":"c64af291-59cb-47d6-a556-653e69b61ed7","year":2025},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"cited_paper":"/paper/2508.01237","citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:922f085941af4c2e107e77dc3fb0785141c129a6b8eda15193e869379636e357","observation_id":"179f89df-ec9a-40d6-b2ce-bcb2fdd86394","resolution":{"observed_at":"2026-05-21T06:14:40.956200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":"fd73079f-5812-44e8-9392-5a74d5a4d748","year":2020},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:a53b455b50bdb76c4e1324f5c07309a6c4e2e4f0251d53deabe7d7a03b3c813c","observation_id":"56d76a00-9b69-46b3-befa-18eaa4fae329","resolution":{"observed_at":"2026-05-21T06:14:41.115531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":"322d3e54-a5de-42c3-881f-7558cda88000","year":2012},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:5a20bd377cbbbbcb5e368ccff0ec7a20ebfbf535d1abd766567d35d7a6d915ac","observation_id":"84006038-474b-423c-9f60-253c04258879","resolution":{"observed_at":"2026-05-21T06:14:41.167399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual interaction networks: Learning a physics simulator from video.Advances in neural information processing systems, 30","venue":null,"work_id":"f29acf7f-d4a7-402f-b672-93faf48629cb","year":2017},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:5b037d7fa341a1ea83bad8faa9a6c017760a94e0856d4960fc369ebfbbd14766","observation_id":"8543450f-6452-4472-ba56-b27b824bd87f","resolution":{"observed_at":"2026-05-21T06:14:41.161227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2508.02324","doi":"10.48550/arxiv.2508.02324","metadata_source":"pith","pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-Image Technical Report","venue":"cs.CV","work_id":"d06d7ecc-7579-4f89-a60b-4278a0f3c562","year":2025},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:09980b109671e1936d5bc7a8e0858ed6f176b4aaa88432741b10ebe0e984ce29","observation_id":"28636707-999b-4a6d-bc58-332e785b5de7","resolution":{"observed_at":"2026-05-21T06:14:40.942499Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Galileo: Perceiving physical object prop- erties by integrating a physics engine with deep learning","venue":null,"work_id":"11d96a56-6f94-41b8-beaf-8045c3f5f80c","year":2015},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:6817370eb5409180a66c0b186db4ef4ca7b65e310d736ff6bda9aabef533b0de","observation_id":"339387d5-d9b8-46d7-93c0-d271e495af81","resolution":{"observed_at":"2026-05-21T06:14:41.140983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to see physics via visual de- animation.NeurIPS, 30","venue":null,"work_id":"d3c9cba8-4c12-4395-a457-51659b5c4dd6","year":2017},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:891eb713aaf8fd513c508bb58db32a11633c756cb3056b906b1f4bebe40a7e13","observation_id":"a3299537-e97b-48f8-baad-d7dc8b171642","resolution":{"observed_at":"2026-05-21T06:14:41.146027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chat2svg: Vec- tor graphics generation with large language models and im- age diffusion models","venue":null,"work_id":"2c63bd29-4423-4872-b45e-8557533a20a9","year":null},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:b0aeeec1ce390486809eaa626ab0d061c299aec3e911f98c9498c75cc4a39bac","observation_id":"56ee1e6b-389a-42eb-8451-2f86f6e9297f","resolution":{"observed_at":"2026-05-21T06:14:41.094023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Svgdreamer: Text guided svg gener- ation with diffusion model","venue":null,"work_id":"62774d3f-c787-4334-ac32-bf697863b2bd","year":2024},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:920b76f50ab9446d7f3ca7c6a6f82219128bade276a1e4c564ae394d591ee991","observation_id":"e104f4a1-b891-4dc4-a9de-b8a3c416345d","resolution":{"observed_at":"2026-05-21T06:14:41.138649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Svgdreamer++: Advancing editability and diversity in text-guided svg generation.IEEE Transac- tions on Pattern Analysis and Machine Intelligence","venue":null,"work_id":"9da2c1ab-bfdf-4132-851b-d3e4190a9c45","year":2025},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:612e28d93867ee9ff15151867e8034d22543589dec701369f5efcd79e3d71344","observation_id":"555196fc-cb3e-4c69-8dac-10f9efeb4304","resolution":{"observed_at":"2026-05-21T06:14:41.126807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ppr: Physically plausible re- construction from monocular videos","venue":null,"work_id":"1f17c0c8-b8e4-4f5a-8898-f7b09986673b","year":2023},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:7139c518ba6904febbccea2ca9fc1fea6f07361603c75e5d97846ede8bf3811d","observation_id":"232f5628-a4d0-4cbe-a34e-a32eeafaa4b2","resolution":{"observed_at":"2026-05-21T06:14:41.120071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01442","last_updated":"2020-03-08T00:09:07Z","snapshot_observed_at":"2026-07-06T08:26:38.349660Z","submitted_at":"2019-10-03T13:16:36Z","title":"CLEVRER: CoLlision Events for Video REpresentation and Reasoning","version":2},"cited_work":{"arxiv_id":"1910.01442","doi":"10.48550/arxiv.1910.01442","metadata_source":"pith","pith_arxiv_id":"1910.01442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CLEVRER: CoLlision Events for Video REpresentation and Reasoning","venue":"cs.CV","work_id":"595fdbf7-89d5-4593-8f57-24e8b469a43c","year":2019},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"cited_paper":"/paper/1910.01442","citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:8728b360c0ea7ba897a7e84a93b3e80acf11b22d80b75a729e27c28f30d9e34c","observation_id":"4d5bd342-fcff-402f-bd8c-ee1b1a718558","resolution":{"observed_at":"2026-05-21T06:14:40.993360Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T20:53:53.698369+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T20:53:53.698369+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The scene language: Representing scenes with programs, words, and embeddings","venue":null,"work_id":"9b880b5a-3375-4f7f-ae2b-bc6eb4154aef","year":2025},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:e9fb44b66bd5bb62b1eb48adf85a1859569bee3c25695b68d7a6013874f96037","observation_id":"58f40693-fb43-4a8c-8423-1c38ced5b334","resolution":{"observed_at":"2026-05-21T06:14:41.156772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Di-pcg: Diffusion-based efficient inverse pro- cedural content generation for high-quality 3d asset creation","venue":null,"work_id":"4ed96686-d771-4d1c-a03a-035d6f1d6d17","year":2025},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:d1b4d4e7f34535643364432b89f1f5d772da4dc1b0f5d2dc607ebf099a7a55a2","observation_id":"664db44f-4d7f-4fee-9b3e-86cbf2e69440","resolution":{"observed_at":"2026-05-21T06:14:41.129048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01454","last_updated":"2024-04-23T09:08:11Z","snapshot_observed_at":"2026-07-06T17:11:00.741753Z","submitted_at":"2024-01-02T22:35:33Z","title":"A Survey on Autonomous Driving Datasets: Statistics, Annotation Quality, and a Future Outlook","version":2},"cited_work":{"arxiv_id":"2401.01454","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.01454","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Genesis: A generative and universal physics engine for robotics and beyond","venue":null,"work_id":"eecf5ed9-a35c-49eb-9cbc-8b54d72b4455","year":2024},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"cited_paper":"/paper/2401.01454","citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:f7598b3df14688e6818499fcf005480b3b1176cb57b6f28f6b0731ebf573eb87","observation_id":"4fded656-d08a-4ca2-8d2e-fc6a6db33c93","resolution":{"observed_at":"2026-05-21T06:14:40.997477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-21T06:14:26.824489Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2605.20576"},"observation_digest":"sha256:94aae3d29da88dc69917384762ffb3724680e84021d75bfbd6d6c40049e6fdd9","observation_id":"323ad2ef-faf4-450d-8129-6076ed7835f0","resolution":{"observed_at":"2026-05-21T06:14:40.974939Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.20576","last_updated":"2026-05-20T00:23:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T21:02:37.103727Z","submitted_at":"2026-05-20T00:23:56Z","title":"$\\Delta$ynamics: Language-Based Representation for Inferring Rigid-Body Dynamics From Videos"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":21,"verified_fuzzy":40},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2605.20576."}