{"as_of":"2026-08-10T23:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4a74d6d697d95cb5677d1d91d7d9a02a0a6a578647ab9c4d3f83cead5f47ae74","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:22:26.851204Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:50:32.142169Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T20:28:15.942007Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"cited_work":{"arxiv_id":"2505.22050","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22050","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rein- forced reasoning for embodied planning","venue":null,"work_id":"1c644f10-1816-4319-a9f0-19b4c1885fff","year":2025},"citing_paper":{"arxiv_id":"2508.13073","last_updated":"2025-09-01T08:10:01Z","snapshot_observed_at":"2026-08-07T15:40:31.068428Z","submitted_at":"2025-08-18T16:45:48Z","title":"Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey","version":2},"reference_index":150,"source":"pdf_text","source_observed_at":"2026-05-17T20:28:15.818016Z"},"links":{"cited_paper":"/paper/2505.22050","citing_paper":"/paper/2508.13073"},"observation_digest":"sha256:08a50a52011230a979db3bfeff08ff6aad911f78dbd2ebc7588711c4f9eac7f8","observation_id":"dc9d4a05-26d6-4f64-b7e6-b01053167dd8","resolution":{"observed_at":"2026-05-17T20:28:15.947442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22050","snapshot_observed_at":"2026-08-05T04:50:32.142169Z","title":"Reinforced reasoning for embodied planning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.05946","last_updated":"2025-09-07T06:46:03Z","snapshot_observed_at":"2026-08-07T19:21:09.227690Z","submitted_at":"2025-09-07T06:46:03Z","title":"Large Language Models for Next-Generation Wireless Network Management: A Survey and Tutorial","version":1},"reference_index":168,"source":"pdf_text","source_observed_at":"2026-08-05T04:50:32.142169Z"},"links":{"cited_paper":"/paper/2505.22050","citing_paper":"/paper/2509.05946"},"observation_digest":"sha256:f77a9eadf2cd7ab2da4069bf9979406014625fd5dc0486826547d367521c3b4c","observation_id":"8355abd1-3ad3-4a41-b036-c0dc8ba2d1d3","resolution":{"observed_at":"2026-08-05T04:50:32.142169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22050","snapshot_observed_at":"2026-08-04T09:33:41.474386Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-08T23:57:30.634515Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:41.474386Z"},"links":{"cited_paper":"/paper/2505.22050","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:813aee2fc73460fd1d8bb7ee6fac35e995a76a0b98cfbeadb1b1194ce5d2b581","observation_id":"228d765b-1279-480a-b96e-82f25ef54e93","resolution":{"observed_at":"2026-08-04T09:33:41.474386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"cited_work":{"arxiv_id":"2505.22050","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22050","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rein- forced reasoning for embodied planning","venue":null,"work_id":"1c644f10-1816-4319-a9f0-19b4c1885fff","year":2025},"citing_paper":{"arxiv_id":"2604.07774","last_updated":"2026-04-09T04:01:27Z","snapshot_observed_at":"2026-07-06T22:57:00.904627Z","submitted_at":"2026-04-09T04:01:27Z","title":"RoboAgent: Chaining Basic Capabilities for Embodied Task Planning","version":1},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-05-10T18:15:08.727921Z"},"links":{"cited_paper":"/paper/2505.22050","citing_paper":"/paper/2604.07774"},"observation_digest":"sha256:0c6cd4c01e5c5d7ad0fc9ffedfadd89774baf658d2ea077889a37a7bb2367bf2","observation_id":"d0aefcf2-b090-463b-a156-431113c66b6c","resolution":{"observed_at":"2026-05-11T05:15:57.247031Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"cited_work":{"arxiv_id":"2505.22050","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22050","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rein- forced reasoning for embodied planning","venue":null,"work_id":"1c644f10-1816-4319-a9f0-19b4c1885fff","year":2025},"citing_paper":{"arxiv_id":"2605.00347","last_updated":"2026-05-01T02:05:56Z","snapshot_observed_at":"2026-07-06T23:13:47.082550Z","submitted_at":"2026-05-01T02:05:56Z","title":"Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-09T20:22:58.061772Z"},"links":{"cited_paper":"/paper/2505.22050","citing_paper":"/paper/2605.00347"},"observation_digest":"sha256:b870b49b24ab55e99396eefc162fd81784cbc59e356f97242da5f513f5fefb58","observation_id":"29bc1a9f-64c8-42e9-b5c6-1f94a5eab6b9","resolution":{"observed_at":"2026-05-11T15:16:09.217964Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"cited_work":{"arxiv_id":"2505.22050","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22050","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rein- forced reasoning for embodied planning","venue":null,"work_id":"1c644f10-1816-4319-a9f0-19b4c1885fff","year":2025},"citing_paper":{"arxiv_id":"2605.13775","last_updated":"2026-05-13T16:54:36Z","snapshot_observed_at":"2026-07-06T23:25:16.229144Z","submitted_at":"2026-05-13T16:54:36Z","title":"RoboEvolve: Co-Evolving Planner-Simulator for Robotic Manipulation with Limited Data","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-14T17:54:50.325820Z"},"links":{"cited_paper":"/paper/2505.22050","citing_paper":"/paper/2605.13775"},"observation_digest":"sha256:52145c6647a446402922a6fa083651f68f41411dbce0de4b39d61c8b6dc4ffa3","observation_id":"d7ee1b53-19af-41f1-91ac-da99f4e9d0b8","resolution":{"observed_at":"2026-05-14T17:57:33.219109Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22050/citation-record","integrity":"/paper/2505.22050/integrity","json":"/paper/2505.22050/citation-record.json","paper":"/paper/2505.22050"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:31.002580Z","title":"URL: https://openai.com/index/ gpt-4o-mini-advancing-cost-efficient-intelligence/","venue":null,"work_id":"00ed51ca-e955-4594-8b7d-0cc436a00402","year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:20.697606Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:f45e6bc547c7b492f339c11bb109982864e9487f2016c68a6fc8dec2e4a0ec37","observation_id":"24e9227a-ffd2-414c-8a7c-fc9cb3a023e7","resolution":{"observed_at":"2026-08-07T13:22:31.068071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:30.840660Z","title":"URL: https://openai.com/index/hello-gpt-4o/","venue":null,"work_id":"453b78f9-1579-4dbe-9edc-f9175a2b9f87","year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:20.785954Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:668c702b79c144d8f9aff7b775c82067f48021574acaa97271c07ddb63bb4b43","observation_id":"65f69c35-873e-4102-b65b-9e0a69ef96ee","resolution":{"observed_at":"2026-08-07T13:22:30.915929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:30.637938Z","title":"URL: https://www.anthropic.com/news/ claude-3-5-sonnet","venue":null,"work_id":"259b35cb-f168-44ef-af69-9ae807f9e8f9","year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:20.861921Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:295a9649696805e1b68d64597e6d8ab0e41224e859f69eb6484d8499ac1185cc","observation_id":"3b59e599-9cd7-4bf1-9ca2-cdcc395a60a3","resolution":{"observed_at":"2026-08-07T13:22:30.704191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:30.419459Z","title":"URL: https://blog","venue":null,"work_id":"492b02d9-c0e6-4946-abcb-4f89c165405d","year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:20.971449Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:f15a3dfe2dda102388bf19a2056d0bc569dc0d9fb6c7207303c2fd7b3c0faa49","observation_id":"3eb58784-d7ba-4e28-ad95-8d9006b35e7f","resolution":{"observed_at":"2026-08-07T13:22:30.537405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:30.172611Z","title":"URL: https://ai.meta.com/blog/ llama-3-2-connect-2024-vision-edge-mobile-devices/","venue":null,"work_id":"1d4b1e15-ad54-4fc4-a315-a5e40d6d475f","year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:21.081823Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:d47463e9183c673cbd2cd5ed3c0e6917c384172422abc63e47b656bbbc40bd09","observation_id":"94ffbd43-4381-4b69-acce-c470cc9f74ba","resolution":{"observed_at":"2026-08-07T13:22:30.286481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-07T13:22:21.227527Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:21.227527Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:32a86f254a04ca00d3fead2f74f7fa7389138602b12333da3b5522e6218b83f1","observation_id":"6d72c2fe-222c-4599-935a-6740ea66b12a","resolution":{"observed_at":"2026-08-07T13:22:21.227527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T13:22:21.376588Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:21.376588Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:2f4d5cb48b7782c01097f4810fca8ac2d9f638d78a5e0a53a9c8becf8494ffaa","observation_id":"1466b7fc-2907-4e6d-a50a-285ceff2fbb6","resolution":{"observed_at":"2026-08-07T13:22:21.376588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15649","last_updated":"2024-09-13T09:36:18Z","snapshot_observed_at":"2026-08-07T22:16:39.249340Z","submitted_at":"2023-11-27T09:20:23Z","title":"RoboGPT: an intelligent agent of making embodied long-term decisions for daily instruction tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15649","snapshot_observed_at":"2026-08-07T13:22:21.473781Z","title":"RoboGPT: an intelligent agent of making embodied long- term decisions for daily instruction tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:21.473781Z"},"links":{"cited_paper":"/paper/2311.15649","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:791dd467674b7ea8a2515a24f4086d3517a228220e5134e6b85c339e702bb460","observation_id":"15d6ded9-411f-4a3c-8807-c8451aa847fe","resolution":{"observed_at":"2026-08-07T13:22:21.473781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T13:22:21.610900Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:21.610900Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:4e8c392480dc27909bc673c7918db1be7d42809b896aa4a3ab10099e757f400f","observation_id":"ab1fe195-2f7d-4b5c-bb0e-a44cd8a1818e","resolution":{"observed_at":"2026-08-07T13:22:21.610900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-07T13:22:21.739893Z","title":"Process reinforcement through implicit rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:21.739893Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:5f9004f53e41bfa251b783fd71d0d1d80b4b25935c136080af7885b4f4ac0245","observation_id":"7eaaf131-0b02-4d53-bea1-345e82ad6be2","resolution":{"observed_at":"2026-08-07T13:22:21.739893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:29.947703Z","title":"A survey of embodied ai: From simulators to research tasks","venue":null,"work_id":"7be6bdd6-de9c-485c-a8c8-b438e98ee2a1","year":2022},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:21.894396Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:fa13903360730353a9ed63fe6de5222e042df5da110213e52714b665578f6fa5","observation_id":"ba721db9-318d-48eb-bfe2-050a9a589979","resolution":{"observed_at":"2026-08-07T13:22:30.065537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:29.755922Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":"3c168db3-84c5-45e8-be47-e7e8cad4d0c1","year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:22.008668Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:84d6a7abaa3e5291d4fddecb3f3deb583ec56ca9bcf25fa07d26aa1d6dbaf8e8","observation_id":"144e999e-c563-48ce-84b8-313f1e88c37d","resolution":{"observed_at":"2026-08-07T13:22:29.814108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:29.554208Z","title":"What can vlms do for zero-shot embodied task planning? In ICML 2024 Workshop on LLMs and Cognition, 2024","venue":null,"work_id":"d4fd95bf-da89-498d-88df-9d146aa3200d","year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:22.096292Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:ede5fe03272a18ca4681569cb55d6d11b16308225d3ced7492f3572679ef921f","observation_id":"521e9aaa-7842-462c-aa30-ced4c358632e","resolution":{"observed_at":"2026-08-07T13:22:29.618245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T13:22:22.190695Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:22.190695Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:1d1796cd888046bd0182c90cb4f04e848f369386f67e08e2cad321863c5e57b9","observation_id":"486f722f-2e98-4710-994c-fcb43486f642","resolution":{"observed_at":"2026-08-07T13:22:22.190695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:22.314432Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:22.314432Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:50d1b9aef94008b0a1caf2a3cee0a54c90c0ae5d06658f8bb0b99ed86cf68c10","observation_id":"b35a1a89-f812-4f18-8a4e-ba084039e568","resolution":{"observed_at":"2026-08-07T13:22:22.314432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-07-31T12:28:37.704994Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-07T13:22:22.439915Z","title":"Open- rlhf: An easy-to-use, scalable and high-performance rlhf framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:22.439915Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:f2daa6329235defd65956573fc828bd4e45043a5a9770c808f1ff529d3a5f7c4","observation_id":"f5814911-feb8-457b-8a69-998ae1b6c810","resolution":{"observed_at":"2026-08-07T13:22:22.439915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17842","last_updated":"2023-12-24T03:48:40Z","snapshot_observed_at":"2026-08-07T02:37:30.672574Z","submitted_at":"2023-11-29T17:46:25Z","title":"Look Before You Leap: Unveiling the Power of GPT-4V in Robotic Vision-Language Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17842","snapshot_observed_at":"2026-08-07T13:22:22.543422Z","title":"Look before you leap: Un- veiling the power of GPT-4v in robotic vision-language planning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:22.543422Z"},"links":{"cited_paper":"/paper/2311.17842","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:e5b5a71bc7aee02d0b3b9bf66a2c3aade9b22c033290f4a288b4e50ebd5a3ec5","observation_id":"306cb825-6fc5-49d0-b7ac-c2cf156d7404","resolution":{"observed_at":"2026-08-07T13:22:22.543422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-07T13:22:22.647159Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:22.647159Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:1836f736c87e25e9e4f6a5c2fba6a6a96984a78c42dde7c97a7d1c3f632c8dfd","observation_id":"953bad54-af75-45d8-a8f4-18ea783b6597","resolution":{"observed_at":"2026-08-07T13:22:22.647159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21257","last_updated":"2025-03-25T05:46:03Z","snapshot_observed_at":"2026-08-07T17:39:03.240589Z","submitted_at":"2025-02-28T17:30:39Z","title":"RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21257","snapshot_observed_at":"2026-08-07T13:22:22.795873Z","title":"RoboBrain: A unified brain model for robotic manipulation from abstract to concrete","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:22.795873Z"},"links":{"cited_paper":"/paper/2502.21257","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:0d61ae9af1710d8f76e56f9a1db8c93aa6bb1e59b7e344833b00241fd8e0a849","observation_id":"0e8cbed3-1426-4168-89c8-6ca6e30aecaa","resolution":{"observed_at":"2026-08-07T13:22:22.795873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07241","last_updated":"2024-03-13T02:34:31Z","snapshot_observed_at":"2026-07-06T16:06:02.777393Z","submitted_at":"2023-08-14T16:23:21Z","title":"Context-Aware Planning and Environment-Aware Memory for Instruction Following Embodied Agents","version":4},"cited_work":{"arxiv_id":"2308.07241","doi":"10.48550/arxiv.2308.07241","metadata_source":"pith","pith_arxiv_id":"2308.07241","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Context-Aware Planning and Environment-Aware Memory for Instruction Following Embodied Agents","venue":"cs.RO","work_id":"4dc297ed-016c-47c4-90f7-2c580f8a3ee5","year":2023},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:22.902090Z"},"links":{"cited_paper":"/paper/2308.07241","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:a646c034191a6235b2b6a06cc37f8af994b8cb2661ea089c96279d9d705f4162","observation_id":"fb0633e3-f0b5-4c7c-8c62-12fad8a46a5a","resolution":{"observed_at":"2026-08-07T13:22:27.092321Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:29.386863Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":"93afe8b0-aa6c-400a-82eb-9f6b7b8cd216","year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:23.000783Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:16e038676f439604f099d13ef97660268c2e43a1336f13e25311ec9f43da2e6d","observation_id":"015d696c-6ac0-4202-80c8-9d98520e52c0","resolution":{"observed_at":"2026-08-07T13:22:29.432336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05474","last_updated":"2022-08-26T17:12:17Z","snapshot_observed_at":"2026-07-06T06:14:28.435222Z","submitted_at":"2017-12-14T23:17:24Z","title":"AI2-THOR: An Interactive 3D Environment for Visual AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05474","snapshot_observed_at":"2026-08-07T13:22:23.067075Z","title":"Ai2-thor: An interactive 3d environment for visual ai","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:23.067075Z"},"links":{"cited_paper":"/paper/1712.05474","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:2937f57a243370cd2654821b8c7af8c7cb07b3a44a5b530bcc953a8472443337","observation_id":"59e6988c-2cf4-4ed4-b91d-b3763ddf060e","resolution":{"observed_at":"2026-08-07T13:22:23.067075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T13:22:23.131565Z","title":"Videochat-r1: Enhancing spatio-temporal percep- tion via reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:23.131565Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:4680ff04f2c21373569441eac77debea7a327460c51c85a313d9b15ec6ce17fb","observation_id":"0a9a00ae-3fd0-46c2-be4e-a04520f0240e","resolution":{"observed_at":"2026-08-07T13:22:23.131565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:23.205810Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:23.205810Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:fab5588b00c3276a1372d2c87ae68964b2af1d276880ef5a1e34575393bbde4c","observation_id":"cd364a8c-639e-4932-8fb5-0d90a571eece","resolution":{"observed_at":"2026-08-07T13:22:23.205810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T13:22:23.320295Z","title":"Visual-rft: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:23.320295Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:5dfb7d580f97bdb4e3e5dc431b9aeffba7f8268ccda1638506c326d8dc7f31e8","observation_id":"068979f8-27f0-45ce-abe9-af07d4cc13f9","resolution":{"observed_at":"2026-08-07T13:22:23.320295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14093","snapshot_observed_at":"2026-08-07T13:22:23.425995Z","title":"A survey on vision-language-action models for embodied ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:23.425995Z"},"links":{"cited_paper":"/paper/2405.14093","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:0358ced0fe00aa248e39340cb586640ef7f7e427a1b100cc03c91043ba7a17d1","observation_id":"75ed4314-1218-4b26-9220-0e431c3a42f3","resolution":{"observed_at":"2026-08-07T13:22:23.425995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-09T01:06:58.674891Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-07T13:22:23.503690Z","title":"Mm-eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:23.503690Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:42c1e8914d59775ac7a9042e399b62cf50b7d3196887e45aae1cfa8fc2734503","observation_id":"594ba930-4cde-4303-9a9a-16a9b0917d39","resolution":{"observed_at":"2026-08-07T13:22:23.503690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:29.177292Z","title":"Composi- tional chain-of-thought prompting for large multimodal models","venue":null,"work_id":"933964d6-635f-440c-9036-96ca17ca17cb","year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:23.564040Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:54507fb2be2df440b645dc0fd6245ed37efc5658155146e5f1ae61865d9ccc2c","observation_id":"c4064ed7-2bcd-4381-970d-e4a9ac66cc24","resolution":{"observed_at":"2026-08-07T13:22:29.284038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:29.038156Z","title":"Kam-cot: Knowledge augmented multimodal chain-of-thoughts reasoning","venue":null,"work_id":"4706e53b-ed8c-447c-9694-6f6eb8d6e704","year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:23.666632Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:a98dc9e32114e9125bf7e65c899515c86c55f84ebb1b64aba74954303e772a2a","observation_id":"e6233108-f2b8-4000-acc6-16e29d635747","resolution":{"observed_at":"2026-08-07T13:22:29.088642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15021","last_updated":"2023-09-13T23:46:22Z","snapshot_observed_at":"2026-08-09T16:10:12.411367Z","submitted_at":"2023-05-24T11:04:30Z","title":"EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15021","snapshot_observed_at":"2026-08-07T13:22:23.750410Z","title":"EmbodiedGPT: Vision-language pre-training via embodied chain of thought","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:23.750410Z"},"links":{"cited_paper":"/paper/2305.15021","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:fdc0e039230d700f3b3d82986499dd3ed3f78e1ea76713b21d06be415c67795c","observation_id":"a379916d-3750-496e-bd5e-d1b9bb0b6812","resolution":{"observed_at":"2026-08-07T13:22:23.750410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:23.820276Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:23.820276Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:88bad740b85bb91f61a23c52f3e1b16e9cd0c63f915685e051a4835ec0bae42c","observation_id":"2893fc7d-e8dd-4666-bbd9-bb90b0675797","resolution":{"observed_at":"2026-08-07T13:22:23.820276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:23.927663Z","title":"Reasoning with large language models, a survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:23.927663Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:f1cbc1720f64cf2d191a60a6347976b7890b3a278e97f48390e7bea2aabd3e93","observation_id":"b6b71b1c-ea92-4cd9-9494-f9eafb0d7505","resolution":{"observed_at":"2026-08-07T13:22:23.927663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:24.070429Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:24.070429Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:da2d6b372235872d2750ff30fc342ddc5ea076aec03de83b40109ed2a9b83187","observation_id":"d138363b-8b9b-4f20-9d31-e6b264d3761b","resolution":{"observed_at":"2026-08-07T13:22:24.070429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:28.889984Z","title":"Say- Plan: Grounding large language models using 3d scene graphs for scalable robot task planning","venue":null,"work_id":"2b8c4382-6c1e-4ffc-a2f2-459b2ed0150d","year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:24.159911Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:856e5d9c5f97b421a8847869e081feb06d07d34d9c1e26332a60218cdf02ae3a","observation_id":"2ae79c2a-828f-4a90-8707-f0c4835ee5d8","resolution":{"observed_at":"2026-08-07T13:22:28.955807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:24.234147Z","title":"Habitat: A platform for embodied ai research","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:24.234147Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:64075604ae6251a25858a8d4c9038c582cbd045970397a9bcbda3f73b0bdd5ef","observation_id":"2673d062-04d3-4f5a-b57a-7fce5fcb0cac","resolution":{"observed_at":"2026-08-07T13:22:24.234147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T13:22:24.317114Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:24.317114Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:e7402139ff49fb4d7fb4089c579ed05f8fca48ea08dea622c6b5947d2ff29a90","observation_id":"d065253d-040a-4b08-a27e-ec1e2567bcfe","resolution":{"observed_at":"2026-08-07T13:22:24.317114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T13:22:24.441874Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:24.441874Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:c6ced0928ed48f6cf5fca233ca1b7436225a27fd1b3fca938353879d143a2375","observation_id":"82715e8d-d392-48f3-ab1c-027a5694d301","resolution":{"observed_at":"2026-08-07T13:22:24.441874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-07T13:22:24.515252Z","title":"Hi robot: Open- ended instruction following with hierarchical vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:24.515252Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:0cbfef755ff4853c80833496429db04b90880ef5808df1ae59830e62f84a2b40","observation_id":"695f2968-25c7-4f31-8cea-ac6239232391","resolution":{"observed_at":"2026-08-07T13:22:24.515252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15190","last_updated":"2025-03-26T07:42:56Z","snapshot_observed_at":"2026-07-06T18:04:30.291363Z","submitted_at":"2024-04-21T08:10:20Z","title":"Socratic Planner: Self-QA-Based Zero-Shot Planning for Embodied Instruction Following","version":2},"cited_work":{"arxiv_id":"2404.15190","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.15190","snapshot_observed_at":"2026-08-07T13:22:27.678443Z","title":"Socratic Planner: Self-QA-Based Zero-Shot Planning for Embodied Instruction Following","venue":"cs.AI","work_id":"0a99cad9-ac59-4472-a6c3-29bdf6efc439","year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:24.564479Z"},"links":{"cited_paper":"/paper/2404.15190","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:e1c99bb19505c0f566b05093dac3008e6825dbf5a8faab7100c3891b09cf2d21","observation_id":"ccb339cc-995d-455f-be9d-1b86e9eb32e4","resolution":{"observed_at":"2026-08-07T13:22:27.751720Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:28.663740Z","title":"Alfred: A benchmark for interpreting grounded instructions for everyday tasks","venue":null,"work_id":"7325c373-53a2-4767-9756-2856c63d6dc4","year":2020},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:24.632852Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:8345f819b7e9b6d03f9f66e8d08088bb8a1d425d052c229446ab818e971e07fa","observation_id":"e46ce3b6-0470-4a02-a8e7-14900943e03c","resolution":{"observed_at":"2026-08-07T13:22:28.729821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:24.721896Z","title":"Tenenbaum, Leslie Kaelbling, and Michael Katz","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:24.721896Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:ed91804b6c2c04af97218a5aec791e9addd6d4c79e4936713bf4d09c4a92e5d7","observation_id":"9082b7a0-ca47-426e-8226-73f21312d533","resolution":{"observed_at":"2026-08-07T13:22:24.721896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11302","last_updated":"2022-09-22T20:29:49Z","snapshot_observed_at":"2026-08-06T05:32:03.407339Z","submitted_at":"2022-09-22T20:29:49Z","title":"ProgPrompt: Generating Situated Robot Task Plans using Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11302","snapshot_observed_at":"2026-08-07T13:22:24.847360Z","title":"ProgPrompt: Generating situated robot task plans using large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:24.847360Z"},"links":{"cited_paper":"/paper/2209.11302","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:6b59fd0013799bbcc3d7ae79a35bfc4ade1cf6d2698c7a10eaf9b1e72fffb5e5","observation_id":"6c45aed3-41bc-4ada-bbe9-090799f28ba2","resolution":{"observed_at":"2026-08-07T13:22:24.847360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02502","last_updated":"2024-07-10T17:36:25Z","snapshot_observed_at":"2026-08-10T16:51:29.888256Z","submitted_at":"2024-03-04T21:50:29Z","title":"Trial and Error: Exploration-Based Trajectory Optimization for LLM Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02502","snapshot_observed_at":"2026-08-07T13:22:24.912504Z","title":"Trial and error: Exploration-based trajectory optimization for llm agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:24.912504Z"},"links":{"cited_paper":"/paper/2403.02502","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:6d435e8e855f37657ce7282253ed45ed22208f681358703e501f6035a9698a20","observation_id":"5083a2e4-4759-4062-869c-bc31d46e0826","resolution":{"observed_at":"2026-08-07T13:22:24.912504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:25.024255Z","title":"Reason-rft: Reinforcement fine-tuning for visual reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:25.024255Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:c6a1620f67fe7f9e3d1973b5996c75ed118ea85db3101d342be616e048b2961a","observation_id":"276bf8bd-f071-4bbf-b57f-362978007a35","resolution":{"observed_at":"2026-08-07T13:22:25.024255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-10T17:28:59.378726Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T13:22:25.118215Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:25.118215Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:9c7996fbacb9bd93a5729fa1ac866b1da2353ec5fa93f9554720292275979b9e","observation_id":"5a330e41-731c-4acf-98b7-a7e1e58d8eb7","resolution":{"observed_at":"2026-08-07T13:22:25.118215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10480","last_updated":"2025-03-13T15:49:56Z","snapshot_observed_at":"2026-08-07T17:06:43.087953Z","submitted_at":"2025-03-13T15:49:56Z","title":"World Modeling Makes a Better Planner: Dual Preference Optimization for Embodied Task Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10480","snapshot_observed_at":"2026-08-07T13:22:25.221513Z","title":"World modeling makes a better planner: Dual preference optimization for embodied task planning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:25.221513Z"},"links":{"cited_paper":"/paper/2503.10480","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:5dceaef04ee7b9a3568fb819fa917a157d18d3ef37c6d37d1839950a5911cd81","observation_id":"1ef661ec-05e2-4e3e-be61-65c46d171ec2","resolution":{"observed_at":"2026-08-07T13:22:25.221513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12605","snapshot_observed_at":"2026-08-07T13:22:25.297429Z","title":"Multimodal chain-of-thought reasoning: A comprehensive survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:25.297429Z"},"links":{"cited_paper":"/paper/2503.12605","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:b303f4866f4c77dffc00563e29225c8f2edc55b6562424e065a63345fcd379c0","observation_id":"ea7a803f-cf6c-450e-8f42-ca62b9577c92","resolution":{"observed_at":"2026-08-07T13:22:25.297429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06805","last_updated":"2024-01-18T07:31:47Z","snapshot_observed_at":"2026-07-06T17:14:57.853205Z","submitted_at":"2024-01-10T15:29:21Z","title":"Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06805","snapshot_observed_at":"2026-08-07T13:22:25.358034Z","title":"Exploring the reasoning abilities of multimodal large language models (mllms): A comprehensive survey on emerging trends in multimodal reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:25.358034Z"},"links":{"cited_paper":"/paper/2401.06805","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:9e8b3d03b9143672edc574b28dbed1471330ab364de82c7ea69e291722b0106f","observation_id":"41ebaff6-6b3f-4a3f-b640-c6982e3f7ce5","resolution":{"observed_at":"2026-08-07T13:22:25.358034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-08-10T06:52:44.809057Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-07T13:22:25.429370Z","title":"Ragen: Understanding self-evolution in llm agents via multi-turn reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:25.429370Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:619225715cf51b9cdd8ad193ad60352872b39eeb2cde0cccecfd5f60ad16637c","observation_id":"fc5ff3e5-e4fe-45b7-9a14-d9e94a21e443","resolution":{"observed_at":"2026-08-07T13:22:25.429370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:25.565706Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:25.565706Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:4d1b0aed76b2d6207db1b8039d16ee88d0181a8af96972b645297d80618132bf","observation_id":"15fc3c6d-8b35-4c25-836b-2832a0b31c7f","resolution":{"observed_at":"2026-08-07T13:22:25.565706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01848","last_updated":"2023-07-04T17:58:25Z","snapshot_observed_at":"2026-08-06T10:55:32.798065Z","submitted_at":"2023-07-04T17:58:25Z","title":"Embodied Task Planning with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01848","snapshot_observed_at":"2026-08-07T13:22:25.663807Z","title":"Embodied task planning with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:25.663807Z"},"links":{"cited_paper":"/paper/2307.01848","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:b59866a619447aaa445e58a11f14749285ba60679ec4b040a2a41a9184a6deff","observation_id":"5a3083d7-dbd6-4f84-9679-685ec544d6eb","resolution":{"observed_at":"2026-08-07T13:22:25.663807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:25.727513Z","title":"The rise and potential of large language model based agents: A survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:25.727513Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:5f7e8c13697395856bad158abac9b2fe3246abe297f0041fb162738a1d7f5375","observation_id":"4b9d0635-0905-4b8f-a6d7-e53cb7270b75","resolution":{"observed_at":"2026-08-07T13:22:25.727513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02385","last_updated":"2024-02-04T07:55:01Z","snapshot_observed_at":"2026-08-04T15:45:08.679135Z","submitted_at":"2024-02-04T07:55:01Z","title":"A Survey on Robotics with Foundation Models: toward Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02385","snapshot_observed_at":"2026-08-07T13:22:25.853615Z","title":"A survey on robotics with foundation models: toward embodied ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:25.853615Z"},"links":{"cited_paper":"/paper/2402.02385","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:c29b164d1bfb2cbb605417fc9aa05641a7793c64268c7afe7d54611542e3b06f","observation_id":"cf71a2cf-9922-41d1-8c85-ac16f9273565","resolution":{"observed_at":"2026-08-07T13:22:25.853615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-07T13:22:25.974006Z","title":"Em- bodiedbench: Comprehensive benchmarking multi-modal large language models for vision-driven embodied agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:25.974006Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:b707ca3ab2b2f35f3627023f92caa07ff5d9c4b84f6c27e6d963eb796e5798f9","observation_id":"33ed233e-2815-4edb-9741-68178e0e3971","resolution":{"observed_at":"2026-08-07T13:22:25.974006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-07T13:22:26.046698Z","title":"Limo: Less is more for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:26.046698Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:f38fe903f67b393cd93b5e9dc883627b5d88bbbf7b2a37fcc2dda1a647014049","observation_id":"b0ed911a-61c7-49ab-87f3-87547d71b64f","resolution":{"observed_at":"2026-08-07T13:22:26.046698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:28.500611Z","title":"Robotic control via embodied chain-of-thought reasoning","venue":null,"work_id":"f2eb23d8-177e-41df-9167-dfb7e6be512b","year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:26.135876Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:8ad57d4cbc1c917fdb329113e449c67d3c38385305ca76fd9019b0606f6247e6","observation_id":"d3d90c58-7546-4690-99e6-d95fd96565d2","resolution":{"observed_at":"2026-08-07T13:22:28.569347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05273","last_updated":"2025-02-03T04:07:37Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-09-12T09:18:09Z","title":"HiRT: Enhancing Robotic Control with Hierarchical Robot Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05273","snapshot_observed_at":"2026-08-07T13:22:26.186961Z","title":"Hirt: Enhancing robotic control with hierarchical robot transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:26.186961Z"},"links":{"cited_paper":"/paper/2410.05273","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:f6c8cf24436b5568664ed682efec6307a54054ccd67394420895ffd521f905f0","observation_id":"7b573dbf-8950-48cd-911b-78c2857b79dd","resolution":{"observed_at":"2026-08-07T13:22:26.186961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:26.234405Z","title":"Vision-language models for vision tasks: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:26.234405Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:b218444237ad9fd4e693dd25cc78f8f6e34c16fabf5a0f2fdd1bd20e8801e6b5","observation_id":"e896157e-17c9-47f5-bca2-da733487fbde","resolution":{"observed_at":"2026-08-07T13:22:26.234405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-07T13:22:26.330503Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:26.330503Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:0f1bdb0422be088603c726834933c5dcd62c2943cef09944cdf926d6b1b41c3c","observation_id":"2401c5a6-982c-49ee-81e2-e35b5de658ad","resolution":{"observed_at":"2026-08-07T13:22:26.330503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21696","last_updated":"2025-05-14T17:48:02Z","snapshot_observed_at":"2026-08-07T16:32:15.166320Z","submitted_at":"2025-03-27T17:00:51Z","title":"Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21696","snapshot_observed_at":"2026-08-07T13:22:26.448609Z","title":"Embodied-reasoner: Synergizing visual search, reasoning, and action for embodied interactive tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:26.448609Z"},"links":{"cited_paper":"/paper/2503.21696","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:40c4e3a7f1fe2f389179733558ab828628ed61d3cec3ded04cc1ce8c8240e53e","observation_id":"3365ba74-cedf-4a8a-bb6a-1d6134f17680","resolution":{"observed_at":"2026-08-07T13:22:26.448609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T13:22:26.520134Z","title":"Multimodal chain-of-thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:26.520134Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:df0828de186661235cba714c451ee583a4645708d21031938d2fbdb784f7280e","observation_id":"ba02ac77-4754-4ff3-8aeb-e459fef570f7","resolution":{"observed_at":"2026-08-07T13:22:26.520134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12680","last_updated":"2025-04-17T06:16:11Z","snapshot_observed_at":"2026-08-07T16:01:36.502631Z","submitted_at":"2025-04-17T06:16:11Z","title":"Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12680","snapshot_observed_at":"2026-08-07T13:22:26.571212Z","title":"Embodied-r: Collaborative framework for activating embodied spatial reasoning in foundation models via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:26.571212Z"},"links":{"cited_paper":"/paper/2504.12680","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:5f884a5895995980f6f35576ed911c0085fb0a57bd3e1d769fea41cfec452125","observation_id":"72e92544-ffec-44c3-805d-e83ce60e3698","resolution":{"observed_at":"2026-08-07T13:22:26.571212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-07T13:22:26.635776Z","title":"messages","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:26.635776Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:f3d5b7ecf9f6f9cf65b51fd66403d4f553dfdb22d038d4c2cb7e52642cc4fcb7","observation_id":"d2b29aa4-dbbc-4fdb-8da3-7385faca2cff","resolution":{"observed_at":"2026-08-07T13:22:26.635776Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:28.256465Z","title":"reasoning_and_reflection\\","venue":null,"work_id":"79090be9-785e-47e6-b4e8-637e7cad5adf","year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:26.700111Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:a85c8c75dcee1f95aa34cf258bdaecf8583b9876a3d710734c3817d7f6710bb3","observation_id":"1f57eff8-5fb6-4f00-974e-911afd275ee8","resolution":{"observed_at":"2026-08-07T13:22:28.353645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:28.138285Z","title":null,"venue":null,"work_id":"45b989b4-4688-4619-813a-3dc640645fd3","year":null},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":224,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:26.851204Z"},"links":{"citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:40bd84ae438663788884c727f850609cc003c4d5400827b774c79ceda43522ff","observation_id":"9bede566-deae-4e2d-a0ba-ca8adacd5eec","resolution":{"observed_at":"2026-08-07T13:22:28.207679Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":2,"verified_fuzzy":15},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 6 inbound Pith citation observations for arXiv:2505.22050."}