{"as_of":"2026-08-19T15:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4837f65507aadd9c1ff8c98dff36e7c60570c0c57134004717ccac8d3083ba74","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T13:33:17.574108Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.08024/citation-record","integrity":"/paper/2607.08024/integrity","json":"/paper/2607.08024/citation-record.json","paper":"/paper/2607.08024"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-08-18T11:44:22.813405Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":"2204.01691","doi":"10.48550/arxiv.2204.01691","metadata_source":"pith","pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","venue":"cs.RO","work_id":"037320f1-b0a9-4cbe-a639-bfb25409ce71","year":2022},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:0c2704ea7ed876e9933fac49a6e93b9d53a2fcb2bc32972a9258ffd111d5a3c2","observation_id":"530ad471-97aa-492f-ab25-89ffeb4ea510","resolution":{"observed_at":"2026-07-10T13:37:06.823058Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.07207","last_updated":"2022-03-08T06:47:17Z","snapshot_observed_at":"2026-08-16T17:27:31.831243Z","submitted_at":"2022-01-18T18:59:45Z","title":"Language Models as Zero-Shot Planners: Extracting Actionable Knowledge for Embodied Agents","version":2},"cited_work":{"arxiv_id":"2201.07207","doi":"10.48550/arxiv.2201.07207","metadata_source":"pith","pith_arxiv_id":"2201.07207","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language models as zero-shot planners: Extracting actionable knowledge for embodied agents","venue":"cs.LG","work_id":"e2e590a8-7af9-4ab9-b5be-29c703ef90fb","year":2022},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2201.07207","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:bcec895b7e0fd43bf036d307d7fb0027996cb2e91cf3eff8f874fd6747a36f65","observation_id":"abc2a541-cee5-4a4d-a71c-2fbac03474be","resolution":{"observed_at":"2026-07-10T13:37:06.820502Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05608","last_updated":"2022-07-12T15:20:48Z","snapshot_observed_at":"2026-08-17T09:42:08.942018Z","submitted_at":"2022-07-12T15:20:48Z","title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","version":1},"cited_work":{"arxiv_id":"2207.05608","doi":"10.1177/02783649231170897","metadata_source":"pith","pith_arxiv_id":"2207.05608","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","venue":"cs.RO","work_id":"f6e5e4a1-e34b-4602-a7ad-df0c6103a4d0","year":2022},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2207.05608","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:858bc736756ca18857103befe7fb9d002c3e2b3ce55f48f46a4ab7e7f8cb1d12","observation_id":"2bc0ee6e-3af5-4a22-84e4-6880a7479f22","resolution":{"observed_at":"2026-07-10T13:37:06.833089Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11477","last_updated":"2023-09-27T07:29:44Z","snapshot_observed_at":"2026-08-12T21:21:48.006892Z","submitted_at":"2023-04-22T20:34:03Z","title":"LLM+P: Empowering Large Language Models with Optimal Planning Proficiency","version":3},"cited_work":{"arxiv_id":"2304.11477","doi":"10.48550/arxiv.2304.11477","metadata_source":"pith","pith_arxiv_id":"2304.11477","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLM+P: Empowering Large Language Models with Optimal Planning Proficiency","venue":"cs.AI","work_id":"7226ffd7-2787-4b30-823a-785e230e85d1","year":2023},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2304.11477","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:ce8b3f9a48361aee59cf22873922ea581770e32e438d1575613ca1c617534905","observation_id":"b8ea7454-cf97-42c6-9f3a-4a730f493308","resolution":{"observed_at":"2026-07-10T13:37:06.923862Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:07.165800Z","title":"Progprompt: Program generation for situated robot task planning using large language models.Autonomous Robots, 47(8):999–1012, 2023","venue":null,"work_id":"df3d3f08-cece-46ef-88ef-7b8382a80338","year":2023},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:38e3b6692cd9ef0db850ca1ccf3ecfddf345e006dec3b8a90017ba225082683e","observation_id":"535475bb-0e63-4792-b873-c144f7255e64","resolution":{"observed_at":"2026-07-10T13:37:07.167162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:07.167771Z","title":"Code as policies: Language model programs for embodied control","venue":null,"work_id":"398c4226-f3ef-4286-9a41-e873b848a72e","year":2023},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:6db761b825159522e0bbaee85ce4436d45997069f379e7325e25712782b8f479","observation_id":"30b374a1-d4d7-4432-a2a1-876df5938160","resolution":{"observed_at":"2026-07-10T13:37:07.169125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:07.169690Z","title":"Llm-planner: Few-shot grounded planning for embodied agents with large language models","venue":null,"work_id":"fb712af3-0cd0-47a4-88c9-3aeb314ae2d7","year":2023},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:75d5d8dbdba2aae023b719511fc2942d74f4d2e37ef24ecb8e604ec68b40f82e","observation_id":"acc75b0c-39da-4499-bdf0-781eb2cdc28d","resolution":{"observed_at":"2026-07-10T13:37:07.170938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01848","last_updated":"2023-07-04T17:58:25Z","snapshot_observed_at":"2026-08-17T23:10:30.088274Z","submitted_at":"2023-07-04T17:58:25Z","title":"Embodied Task Planning with Large Language Models","version":1},"cited_work":{"arxiv_id":"2307.01848","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.01848","snapshot_observed_at":"2026-07-10T13:37:06.910388Z","title":"Embodied task planning with large language models","venue":"cs.CV","work_id":"80ce04e2-20c5-430d-9226-64d96d34a01a","year":2023},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2307.01848","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:83fd6591bf247cb6d35117b7f3043a61e4cf22e3b984567a814634a4dce02407","observation_id":"9ab74901-3b6c-401f-90dd-c34a87d60b94","resolution":{"observed_at":"2026-07-10T13:37:06.911613Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:07.164017Z","title":"CoPAL: Corrective Planning of Robot Actions with Large Language Models","venue":null,"work_id":"07722e07-94da-4ffa-a17b-4dcae2800e6a","year":2024},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:6503114ac455565393dd7c397027e14b4ecd232fa234f4e1ae0770319a3b51fa","observation_id":"a0fbfcfd-a6ab-46c3-b6fc-797200b88ea9","resolution":{"observed_at":"2026-07-10T13:37:07.165202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02193","last_updated":"2024-10-03T04:14:21Z","snapshot_observed_at":"2026-08-18T20:44:38.423700Z","submitted_at":"2024-10-03T04:14:21Z","title":"Guiding Long-Horizon Task and Motion Planning with Vision Language Models","version":1},"cited_work":{"arxiv_id":"2410.02193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02193","snapshot_observed_at":"2026-07-10T13:37:06.851753Z","title":"Guiding Long-Horizon Task and Motion Planning with Vision Language Models","venue":"cs.RO","work_id":"cc17e5c3-48bd-451a-88af-ed51c8c52493","year":2024},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2410.02193","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:6c21c54269b71b9eaba8e837fabbb1ba9fb99d765b57a5d4817ce8d82757c7f1","observation_id":"e39b477d-af21-431b-b9e6-24738d0c90a7","resolution":{"observed_at":"2026-07-10T13:37:06.852992Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11552","last_updated":"2024-08-21T09:46:35Z","snapshot_observed_at":"2026-08-16T14:08:54.721325Z","submitted_at":"2024-03-18T08:03:47Z","title":"LLM3:Large Language Model-based Task and Motion Planning with Motion Failure Reasoning","version":3},"cited_work":{"arxiv_id":"2403.11552","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.11552","snapshot_observed_at":"2026-07-10T13:37:06.907974Z","title":"N., Zhu, S.-C., and Liu, H","venue":"cs.RO","work_id":"b56ac001-6484-4e80-91cb-ff321d8ea29b","year":2024},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2403.11552","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:8594f9b98afacc29b5067ec13b307a35b6834a4d3374b2850969139819023b1f","observation_id":"4b2a6582-d104-45bd-b77a-28b429ce8ae2","resolution":{"observed_at":"2026-07-10T13:37:06.909213Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04157","last_updated":"2024-02-20T11:38:09Z","snapshot_observed_at":"2026-08-18T10:09:52.675307Z","submitted_at":"2024-01-08T18:57:54Z","title":"RePLan: Robotic Replanning with Perception and Language Models","version":2},"cited_work":{"arxiv_id":"2401.04157","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.04157","snapshot_observed_at":"2026-07-10T13:37:06.912799Z","title":"RePLan: Robotic replanning with perception and language models","venue":"cs.RO","work_id":"80f92282-435b-46b2-a88b-7573372eded1","year":2024},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2401.04157","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:4f636d4a6c8ed9c8d8a24c641864ca8378788cd2c7964fd8b6223250d7a5491f","observation_id":"3f88858a-561b-47f5-aeb1-ab11856b8545","resolution":{"observed_at":"2026-07-10T13:37:06.916557Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16707","last_updated":"2025-02-23T20:42:15Z","snapshot_observed_at":"2026-08-16T12:55:55.195708Z","submitted_at":"2025-02-23T20:42:15Z","title":"Reflective Planning: Vision-Language Models for Multi-Stage Long-Horizon Robotic Manipulation","version":1},"cited_work":{"arxiv_id":"2502.16707","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.16707","snapshot_observed_at":"2026-07-10T13:37:06.917674Z","title":"Moka: Open-world robotic manipu- lation through mark-based visual prompting","venue":"cs.RO","work_id":"4c0b2529-6aad-4823-8f87-900fce31956e","year":2025},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2502.16707","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:4d3983dbb351b3e17bcaaf8221c64988e6977a793c05c78354229f4df581d8ed","observation_id":"69db36f4-0792-4cde-b50a-29e78e9f4ae1","resolution":{"observed_at":"2026-07-10T13:37:06.918902Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":"2407.08693","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-07-10T13:37:06.920040Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","venue":"cs.RO","work_id":"bbe96698-686e-4b4a-9f7f-ed5054e61cca","year":2024},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:10d1be3a44832f427121cee6b99cf65a2b233d1e9903ba3200864122c53c2338","observation_id":"b44def62-c37b-4d18-9b2e-37f0e2af703b","resolution":{"observed_at":"2026-07-10T13:37:06.921290Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22020","last_updated":"2025-03-27T22:23:04Z","snapshot_observed_at":"2026-08-18T09:32:30.308050Z","submitted_at":"2025-03-27T22:23:04Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2503.22020","doi":"10.48550/arxiv.2503.22020","metadata_source":"pith","pith_arxiv_id":"2503.22020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","venue":"cs.CV","work_id":"14a3cf4d-f3aa-46dd-a613-bb5253154921","year":2025},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2503.22020","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:255b71a664778b903f166f0508557aea7bc040cf9e860fe14b125391ea673213","observation_id":"88fe80fd-30bc-4195-952c-11eaf7266fd6","resolution":{"observed_at":"2026-07-10T13:37:06.901919Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.09849","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:06.894151Z","title":"Bagelvla: Enhancing long-horizon manipulation via interleaved vision-language-action generation.CoRR, abs/2602.09849","venue":null,"work_id":"98c513cf-3c1a-415f-8acb-d897d3fcb765","year":2026},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:fc7b1f64588df5ec4cd8d89ed882d82e6d174eda2f05609068ea660f5a6dd685","observation_id":"79c6af02-9fbf-4ad2-96f6-55ea391bab8b","resolution":{"observed_at":"2026-07-10T13:37:06.896022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.21112","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:06.897588Z","title":"Eo-1: Interleaved vision- text-action pretraining for general robot control","venue":null,"work_id":"b512941f-aa42-401d-9e2e-c336dbb630ef","year":2025},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:ccc6d0553f78fe1a017d2d9e917ad8f233b9320cb1a4b205e4a96a29ea4a8742","observation_id":"e6670a89-b451-4a0e-8f7c-087fa3083406","resolution":{"observed_at":"2026-07-10T13:37:06.899264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08548","last_updated":"2026-04-05T00:57:47Z","snapshot_observed_at":"2026-07-06T21:23:14.666121Z","submitted_at":"2025-05-13T13:20:46Z","title":"From Seeing to Doing: Bridging Reasoning and Decision for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":"2505.08548","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.08548","snapshot_observed_at":"2026-07-10T13:37:06.905490Z","title":"From Seeing to Doing: Bridging Reasoning and Decision for Robotic Manipulation","venue":"cs.RO","work_id":"e9d2a19c-2585-42f5-84d7-d5601c3c3668","year":2025},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2505.08548","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:a7e36999c5f180201887f1c2e7d36567e6358a394cdbbab0bf6357a68f2ce842","observation_id":"a32d85ba-851d-45cd-8f06-2c7bc1bd340b","resolution":{"observed_at":"2026-07-10T13:37:06.906696Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15483","last_updated":"2026-04-24T23:18:28Z","snapshot_observed_at":"2026-08-11T15:03:01.640683Z","submitted_at":"2026-04-16T19:18:07Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","version":2},"cited_work":{"arxiv_id":"2604.15483","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.15483","snapshot_observed_at":"2026-07-10T19:47:32.631418Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","venue":"cs.LG","work_id":"7391297f-4dff-465c-9790-cb760a2c0542","year":2026},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2604.15483","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:7ced345e9ffba45b272bee8b80a9599eeef2253d8e5000dd7329e5fcd3c625c6","observation_id":"ff0d25d9-7332-45c1-90f1-7b854959f683","resolution":{"observed_at":"2026-07-10T13:37:06.892676Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:07.160397Z","title":"Integrated Task and Motion Planning.Annual Review of Control, Robotics, and Autonomous Systems, 4(1):265–293, May 2021","venue":null,"work_id":"4b16ea0d-72ce-4a0d-9733-92ee3cca074d","year":2021},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:f3f6e30eee05bfe18c056377328359ae3eedcbef208a35746943a61bb1e476fd","observation_id":"7df7b792-2c23-4a40-bcbd-10aea1b15cfb","resolution":{"observed_at":"2026-07-10T13:37:07.161743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.08705","last_updated":"2020-03-23T15:14:02Z","snapshot_observed_at":"2026-08-14T19:42:44.709891Z","submitted_at":"2018-02-23T19:26:46Z","title":"PDDLStream: Integrating Symbolic Planners and Blackbox Samplers via Optimistic Adaptive Planning","version":5},"cited_work":{"arxiv_id":"1802.08705","doi":null,"metadata_source":"pith","pith_arxiv_id":"1802.08705","snapshot_observed_at":"2026-07-10T13:37:06.903015Z","title":"PDDLStream: Integrating Symbolic Planners and Blackbox Samplers via Optimistic Adaptive Planning","venue":"cs.AI","work_id":"20a6ca23-96e2-4dc5-a632-9ad2a116cd1f","year":2018},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/1802.08705","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:2fb67b02d872de401fed87d03189d55bef09ff0bff342a026f293ad89bb8288b","observation_id":"c54e24ca-71aa-4c6e-b517-1cc8d10b439b","resolution":{"observed_at":"2026-07-10T13:37:06.904376Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:07.171480Z","title":"Pddl—the planning domain definition language.Technical Report, Tech","venue":null,"work_id":"b6f4c9d9-8f73-4970-8c20-34da8cea9fc0","year":1998},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:1c383e07e80ef317f6cca672933c00ed0686df7421902ce94701f3d7ebb330b1","observation_id":"89680387-dcc8-4a5f-9b3a-499fd7d41a53","resolution":{"observed_at":"2026-07-10T13:37:07.172716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1109.6051","last_updated":"2011-09-27T22:04:43Z","snapshot_observed_at":"2026-08-19T05:12:34.380936Z","submitted_at":"2011-09-27T22:04:43Z","title":"The Fast Downward Planning System","version":1},"cited_work":{"arxiv_id":"1109.6051","doi":null,"metadata_source":"pith","pith_arxiv_id":"1109.6051","snapshot_observed_at":"2026-07-10T13:37:06.854509Z","title":"The Fast Downward Planning System","venue":"cs.AI","work_id":"fbfe63fd-2262-4b54-a202-2eb63f04a152","year":2011},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/1109.6051","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:16c78271fcb6d5bea38c4854ab4bf60540d19478bc9cb9e095b5a9f233e08caf","observation_id":"64141ae5-3ed8-49cd-928f-4fe9948c603d","resolution":{"observed_at":"2026-07-10T13:37:06.855922Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:07.158429Z","title":"set it up","venue":null,"work_id":"c69beddd-9103-4798-8d05-d241cef2135e","year":2024},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:08561f2b98053088925e9eb6a6ec2b155e8a4b10836f548638ccf85836dfb895","observation_id":"16236ac9-ee41-4782-9da8-e52451b0db71","resolution":{"observed_at":"2026-07-10T13:37:07.159494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.25548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:06.876095Z","title":"Kavraki, and Zachary Kingston","venue":null,"work_id":"6abe1a9d-2817-4d64-9a24-58731efdd87e","year":2026},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:d15e2e6f2c0b531761967c305a3ff5bf0a6a460c54bf98b33048a2ff815049f1","observation_id":"815b0d24-f925-4dd2-8c51-c89f229bf8e0","resolution":{"observed_at":"2026-07-10T13:37:06.877810Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:db34ee974f72585f08f7007166db76a340b0c06bd4d8b45c84a551162180d8a3","observation_id":"0b70b6f1-5fb1-4f1a-acc8-36789b916792","resolution":{"observed_at":"2026-07-10T13:37:06.880125Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:07.155200Z","title":null,"venue":null,"work_id":"a613fa8d-2080-4a7a-9bda-eb46bcc804b8","year":null},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:6c474843c91138c3f8d2a810218ba1c3a21812919676829950c90af6c61c8174","observation_id":"21caaf61-6567-44db-9a4a-a5a04213f715","resolution":{"observed_at":"2026-07-10T13:37:07.156233Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-17T01:11:44.872398Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":"2505.14683","doi":"10.48550/arxiv.2505.14683","metadata_source":"pith","pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emerging Properties in Unified Multimodal Pretraining","venue":"cs.CV","work_id":"e0cfd82c-f5d4-44fd-b531-ec73ab0a805b","year":2025},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:374bc4f1a1a71e0984a8b18cc0f1c06e6f328534763d080221cb2be00a9be838","observation_id":"d05feb5a-7715-436c-a5c6-134018e47e28","resolution":{"observed_at":"2026-07-10T13:37:06.842962Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"cited_work":{"arxiv_id":"2506.15564","doi":"10.48550/arxiv.2506.15564","metadata_source":"pith","pith_arxiv_id":"2506.15564","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Show-o2: Improved Native Unified Multimodal Models","venue":"cs.CV","work_id":"77f00563-1ce6-4fba-9d4e-c8ce83f716ac","year":2025},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2506.15564","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:948da1130ed3c3d6cb4c9925bbb89f73867166a87beedaca8f96a8e8428b8801","observation_id":"71fad2ac-312b-4569-ac54-a1c37abb3a7c","resolution":{"observed_at":"2026-07-10T13:37:06.830230Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.02014","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:06.868333Z","title":"Tuna: Taming unified visual representations for native unified multimodal models","venue":null,"work_id":"caa100a4-03f6-4ad6-8461-4d3a89233486","year":2025},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:3e3dead59398e908680bf64a876c90a0844ea7c9f93d74723c28b3974c29a4a4","observation_id":"87a0bb2d-0e36-4e31-ba84-f552438c954f","resolution":{"observed_at":"2026-07-10T13:37:06.869892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-08-17T08:54:22.251874Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2604.24763","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.24763","snapshot_observed_at":"2026-07-10T13:37:06.881254Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"6d1815d2-46f1-4217-a874-f25ae24be85c","year":2026},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2604.24763","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:3dd657182e65f9d760f39d34604a0e5c06e47e251ae55531a709b91e19122e93","observation_id":"10f0d88f-3a7f-4a92-9a22-8170a221360b","resolution":{"observed_at":"2026-07-10T13:37:06.882491Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.03276","doi":"10.48550/arxiv.2603.03276","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond language modeling: An exploration of multimodal pretraining","venue":"arXiv (Cornell University)","work_id":"d972314c-446c-43b5-9de5-4bb7c5f1cdcf","year":2026},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:a627f6f4e4d1363ae6107d8d9d2cd101a1cbb07e1c2e05a70b75bdce1ee7ef17","observation_id":"a51f1893-2d62-4e72-b9b2-c77e0c4fe342","resolution":{"observed_at":"2026-07-10T13:37:06.875053Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23918","last_updated":"2025-07-03T16:49:39Z","snapshot_observed_at":"2026-08-16T16:52:49.240000Z","submitted_at":"2025-06-30T14:48:35Z","title":"Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers","version":3},"cited_work":{"arxiv_id":"2506.23918","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23918","snapshot_observed_at":"2026-07-11T03:17:51.399835Z","title":"Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers","venue":"cs.CV","work_id":"760ebd7d-977d-4280-afae-adb421d49ed4","year":2025},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2506.23918","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:1ce966ce3d458352d56f9add5e905659b03d85666218606eeb1c838ff165264c","observation_id":"464bbb67-9b7d-4381-bcf2-5ee8624ed433","resolution":{"observed_at":"2026-07-10T13:37:06.872441Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.16746","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:17:51.862251Z","title":"Zebra-cot: A dataset for interleaved vision language reasoning","venue":null,"work_id":"dea15336-3efa-4a03-a26a-baa3a38efb90","year":2025},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:33dbe7312d76c4930a8d4b33b289a390eaf8f2ef38189127ee303102a04cc0df","observation_id":"7091c428-b7cf-4f69-807e-75540eb76057","resolution":{"observed_at":"2026-07-10T13:37:06.840575Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:07.121860Z","title":"Imagine while Reasoning in Space: Multimodal Visualization-of-Thought, January","venue":null,"work_id":"c84ce038-6fa3-4fbc-b23b-3e549d990e1a","year":null},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:03205c33fc2bf5438696df606134739c0ba025b88f683b57884dce08d1417704","observation_id":"a5560386-e48a-476b-af4c-c450031579ce","resolution":{"observed_at":"2026-07-10T13:37:07.123364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07542","last_updated":"2025-01-13T18:23:57Z","snapshot_observed_at":"2026-08-17T08:25:34.071490Z","submitted_at":"2025-01-13T18:23:57Z","title":"Imagine while Reasoning in Space: Multimodal Visualization-of-Thought","version":1},"cited_work":{"arxiv_id":"2501.07542","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.07542","snapshot_observed_at":"2026-07-10T13:37:06.824298Z","title":"Imagine while Reasoning in Space: Multimodal Visualization-of-Thought","venue":"cs.CL","work_id":"fe549c4a-19fa-421a-9a30-230932ba737e","year":2025},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2501.07542","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:37a41b0fb518590d33dfb3c8c66f91d39e2c6451ea6e7779f970b896504d5ef8","observation_id":"de7a5ce2-023f-4fbf-817c-d47c85252534","resolution":{"observed_at":"2026-07-10T13:37:06.825486Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-17T03:34:43.784005Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:650cc0731df9c432b1a861f97d2f8118e96ae52da624e66bf4ff3936fa9b666e","observation_id":"55fc931d-9a60-4fab-b378-0040574e6bbb","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-13T03:28:19.590253Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:5d56a3ebffbc0c9f7c6798408ac50ba3eb3f262bd22ac68154cd106e18c8eae8","observation_id":"4ee2f962-6b5e-4826-b422-3518eb5e0a6b","resolution":{"observed_at":"2026-07-10T13:37:06.835539Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.27492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:06.844147Z","title":"Thinkmorph: Emergent properties in multimodal interleaved chain-of-thought reasoning","venue":null,"work_id":"03da248b-c710-48de-9cdc-1345fcfa31f4","year":2026},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:c0fcda78624037c69d459a0974464bb7c3b77102e3b37ee9558f8fc316bab991","observation_id":"4483960a-ec58-449c-80fd-99ff591568d8","resolution":{"observed_at":"2026-07-10T13:37:06.845631Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.05479","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:06.849199Z","title":"Taco: Learning multi-modal action models with synthetic chains-of-thought-and-action","venue":null,"work_id":"670f0f0d-d800-456e-aa92-4cbea7ddeee1","year":2025},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:b9d0aa8973a3d9e651496e15b96e4215dad2e4484f4f4f893b91073828159a62","observation_id":"74591c3a-8703-4fe3-aed6-e5ccd050a530","resolution":{"observed_at":"2026-07-10T13:37:06.850582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:07.129803Z","title":"Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning, October","venue":null,"work_id":"316cd536-6b02-40a2-ad48-32ba331ecd9c","year":null},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:224eceea17e40621bacad2c14ca6a93f3ea6545ca701a53fa178f6e8218629ae","observation_id":"4591168b-8405-4935-8005-cca3380e6fe5","resolution":{"observed_at":"2026-07-10T13:37:07.131323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15966","last_updated":"2025-10-24T09:35:22Z","snapshot_observed_at":"2026-08-15T21:58:54.708977Z","submitted_at":"2025-05-21T19:35:08Z","title":"Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.15966","doi":"10.48550/arxiv.2505.15966","metadata_source":"pith","pith_arxiv_id":"2505.15966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning","venue":"cs.CV","work_id":"878c3e90-ce55-4ba3-a588-2abe369013e6","year":2025},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2505.15966","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:5ee91146134ebc4d57cd6f2078e220bc108e555859eb0bffa1d371962229c444","observation_id":"fd4adf05-714d-4f3b-ae59-b2e400465841","resolution":{"observed_at":"2026-07-10T13:37:06.858472Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:07.123932Z","title":"Plummer, Kate Saenko, Ranjay Krishna, Leonidas Guibas, and Wen-Sheng Chu","venue":null,"work_id":"6c58285a-158c-4b15-9ae2-903fb9c1da6d","year":null},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:6ba3679e31205581db4a931a227226bd4e76c64b8e6b9550b4781a21b8bc9767","observation_id":"9af7e896-7cd5-47ee-9739-30a452267716","resolution":{"observed_at":"2026-07-10T13:37:07.125415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.10941","last_updated":"2026-04-30T17:59:42Z","snapshot_observed_at":"2026-08-17T16:36:13.869490Z","submitted_at":"2025-12-11T18:59:08Z","title":"Mull-Tokens: Modality-Agnostic Latent Thinking","version":2},"cited_work":{"arxiv_id":"2512.10941","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.10941","snapshot_observed_at":"2026-07-10T13:37:06.836665Z","title":"Mull-Tokens: Modality-Agnostic Latent Thinking","venue":"cs.CV","work_id":"a831fe1f-0927-46d3-a512-9e9b3a906248","year":2025},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2512.10941","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:543f3c31b2c81eace18c60642db5c545e6df24b2ee42024013f341584e9f09f9","observation_id":"f6b5f1f4-f221-499c-9d14-495a28bd019e","resolution":{"observed_at":"2026-07-10T13:37:06.837816Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:07.126014Z","title":"Thinking with visual primitives, 2026","venue":null,"work_id":"e356e05d-81f2-4fb7-873a-f357b86a3450","year":2026},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:9bc29225e1b00511d78f043410a307fb127f2e6149337fbbef75c0f32737aa34","observation_id":"5e9bc4ec-1da5-436d-96cc-feff151700d8","resolution":{"observed_at":"2026-07-10T13:37:07.127388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11896","last_updated":"2025-05-25T13:39:29Z","snapshot_observed_at":"2026-08-15T20:43:10.391637Z","submitted_at":"2025-05-17T08:27:00Z","title":"AdaCoT: Pareto-Optimal Adaptive Chain-of-Thought Triggering via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.11896","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.11896","snapshot_observed_at":"2026-07-10T13:37:06.846705Z","title":"AdaCoT:Pareto-optimaladaptivechain-of-thoughttriggeringviareinforcement learning.arXivpreprint","venue":"cs.LG","work_id":"d7166df4-ba8c-494e-b8c6-598a098cc9a5","year":2025},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2505.11896","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:6ec46e3cbd2cca6dd4e3cc38f17c4b03fd5f7645aecaa2899f237acebc68339b","observation_id":"e28b7a1c-7966-454a-a153-2d451b6ff518","resolution":{"observed_at":"2026-07-10T13:37:06.848077Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08243","last_updated":"2025-05-17T21:04:22Z","snapshot_observed_at":"2026-08-18T01:42:20.495799Z","submitted_at":"2025-05-13T05:35:00Z","title":"Training Strategies for Efficient Embodied Reasoning","version":2},"cited_work":{"arxiv_id":"2505.08243","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.08243","snapshot_observed_at":"2026-07-10T13:37:06.859851Z","title":"Training strategies for efficient embodied reasoning","venue":"cs.RO","work_id":"9d9fe5b6-fad2-44c8-97a4-7422bb746cbd","year":2025},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2505.08243","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:64767c3be477dad827b2f4dfc9c15f1a1dacdcd2931941c805ff47b532af9428","observation_id":"a185804e-cf60-4653-b464-ed95f389c415","resolution":{"observed_at":"2026-07-10T13:37:06.861034Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00093","last_updated":"2023-06-06T08:36:20Z","snapshot_observed_at":"2026-08-17T03:51:16.111447Z","submitted_at":"2023-01-31T20:48:57Z","title":"Large Language Models Can Be Easily Distracted by Irrelevant Context","version":3},"cited_work":{"arxiv_id":"2302.00093","doi":"10.48550/arxiv.2302.00093","metadata_source":"pith","pith_arxiv_id":"2302.00093","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chi, Nathanael Schärli, and Denny Zhou","venue":"cs.CL","work_id":"2a9f338c-2289-449d-9318-5489561438d2","year":2023},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2302.00093","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:1ff1bcaee773e0fcad66d2b4c2ed07e519fb61bd08bfb28fdf6a05b2bddab722","observation_id":"e9e3af8f-833d-4ea6-9d9c-e60a22863775","resolution":{"observed_at":"2026-07-10T13:37:06.827927Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:07.162304Z","title":"Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni, and Percy Liang","venue":null,"work_id":"a6a517b0-ecc5-4597-b21c-72a9def18061","year":null},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:12a50e50774cfab25562ae648ff87648f4c155f090d84e268665dd8da8354819","observation_id":"22b15a97-b24a-46af-84c0-0c5ce6bed912","resolution":{"observed_at":"2026-07-10T13:37:07.163481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03172","last_updated":"2023-11-20T23:09:34Z","snapshot_observed_at":"2026-07-06T15:51:12.179086Z","submitted_at":"2023-07-06T17:54:11Z","title":"Lost in the Middle: How Language Models Use Long Contexts","version":3},"cited_work":{"arxiv_id":"2307.03172","doi":"10.1162/tacl","metadata_source":"pith","pith_arxiv_id":"2307.03172","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lost in the Middle: How Language Models Use Long Contexts","venue":"cs.CL","work_id":"37c05e13-4a24-44f8-a1c4-da1bbe7223aa","year":2023},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2307.03172","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:c6a50c7c4191f20356b4f5d45117ca6767f082b337a8f235c874e6eefa3e6289","observation_id":"39c2458f-cc1c-43de-afdd-f7d9fccc4ab4","resolution":{"observed_at":"2026-07-10T13:37:06.889065Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03302","last_updated":"2024-09-12T11:51:51Z","snapshot_observed_at":"2026-08-16T14:03:42.311760Z","submitted_at":"2024-04-04T08:52:30Z","title":"How Easily do Irrelevant Inputs Skew the Responses of Large Language Models?","version":4},"cited_work":{"arxiv_id":"2404.03302","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.03302","snapshot_observed_at":"2026-07-10T13:37:06.862301Z","title":"How easily do irrelevant inputs skew the responses of large language models?","venue":"cs.CL","work_id":"a77d6016-f4f4-4394-94f2-80a8d9221212","year":2024},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2404.03302","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:88ca5970f3d913fae4ac07c05ca05b619ea1aedd98faa37b43053b2c9549afe7","observation_id":"e1eff53c-f1ac-48ab-8bbb-a51ca3376d88","resolution":{"observed_at":"2026-07-10T13:37:06.867149Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:07.147835Z","title":"Between mdps and semi-mdps: A framework for temporal abstraction in reinforcement learning.Artificial intelligence, 112(1- 2):181–211, 1999","venue":null,"work_id":"4b4e9f7c-ecc6-4c68-bcb7-99f1cf300cb4","year":1999},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:6c38f77908d88b9375e25c77dfb2da22d1af0a33408a191af4c37f40eedd1fd3","observation_id":"e77c0fb6-7319-4b78-8ed3-b7bb419ec23b","resolution":{"observed_at":"2026-07-10T13:37:07.149132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:07.151648Z","title":"Constrained model predictive control: Stability and optimality.Automatica, 36(6):789–814","venue":null,"work_id":"c90e3d80-a58b-4503-94ce-374fd69bf6d3","year":2000},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:03544a17e5bbe735b72a572fe681768ff7061ece30f549032b945e199a6eab6f","observation_id":"638af729-0ddd-4e05-8797-6090dea4a2c0","resolution":{"observed_at":"2026-07-10T13:37:07.152930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3030.0210","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:06.925133Z","title":"Learning compositional behaviors from demonstration and language","venue":null,"work_id":"c6b525ff-dce4-49d5-ad9e-7dc367ba4544","year":2024},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:717c1a668d269854b65adbe600b3eccdf7dbb1c2bce2113bdb861174177a280a","observation_id":"efa12b1c-b01d-4933-bfc0-0237373703f5","resolution":{"observed_at":"2026-07-10T13:37:06.926545Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:07.156804Z","title":null,"venue":null,"work_id":"89e5e5d4-d78f-45aa-912a-4afe6f5f459f","year":null},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:04500c83edba75588fdb1f8f70400ccafc81005167ff56a4b69c6a4717d9e409","observation_id":"fac3d154-5071-4875-9756-43f4fe95ddd9","resolution":{"observed_at":"2026-07-10T13:37:07.157868Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:07.142769Z","title":null,"venue":null,"work_id":"d4b67af5-9aab-4e0c-bc1a-0a6b30a8d3d0","year":null},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:9a31d0cc485c63fcd9ee71b81e3f2f5f2add85d41eb01201756859a931d261b9","observation_id":"0a7ff8a0-4beb-4019-bfd0-0bc114197a6e","resolution":{"observed_at":"2026-07-10T13:37:07.143811Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:07.139233Z","title":"step_index","venue":null,"work_id":"2e64a749-d37a-4e01-b583-7d329e101afe","year":null},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:ad814264a6bf5644330fcc816fa3370f472fa740280f3adb7c7f18b49c41d971","observation_id":"a94adc0b-5788-4b04-b105-577716504206","resolution":{"observed_at":"2026-07-10T13:37:07.140391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:07.140910Z","title":"Answer Format: You must output exactly two sections: <think>...</think> <answer>...</answer> ––––––––––––––––","venue":null,"work_id":"f61a7daa-4c99-49f6-a3d7-7f9cfdffeeaa","year":null},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:235fe599d5e36dd40becfd2530b62bc6cd690150c8439e1c8cc427e6f1252de0","observation_id":"3c5dd21f-6bad-4c7a-a0aa-17b803894725","resolution":{"observed_at":"2026-07-10T13:37:07.142236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:07.146022Z","title":"Each step should describe the next planning subgoal required to complete the task","venue":null,"work_id":"f77da036-3867-4b75-8573-92e0ff890c90","year":null},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:999fd02859397cd3a88aa46866381c6fb9ca35bdc71d1005c49e154097efe01c","observation_id":"09c4138b-6718-4940-a714-c145f483501d","resolution":{"observed_at":"2026-07-10T13:37:07.147253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:07.137558Z","title":null,"venue":null,"work_id":"c75a81ad-929a-4038-b9ad-f157e0e5a783","year":null},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:4263b78322b876bf79d05c45dbd8d15f0eae33e05114187956adea78dbab9463","observation_id":"89dc9f09-7cbc-412a-9b24-bb9c604cfedb","resolution":{"observed_at":"2026-07-10T13:37:07.138664Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:07.135590Z","title":"Examples include: - spatial capacity - object accessibility - ordering dependencies - none","venue":null,"work_id":"a19bb663-5a3f-4f71-97f7-2581c1c618b0","year":null},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:a4112314238864219915ad52a970efff2086ca9e9e75ef8ab2a6d66bb1a056d3","observation_id":"e73e215f-3ba9-4d26-963b-6a4d1746366f","resolution":{"observed_at":"2026-07-10T13:37:07.137015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:07.144392Z","title":null,"venue":null,"work_id":"13434eee-c633-468e-8de0-3288abbe4c3a","year":null},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:c3779207caa29d10ac13ab8e4c32bdaed3505720a0b8114ee9caa3007f54129c","observation_id":"7d5586a3-242b-4f18-a377-3316fa553e24","resolution":{"observed_at":"2026-07-10T13:37:07.145456Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:07.149726Z","title":"–––––––––––––––– Image representation rule: If visual verification is required for a step, you must emit an image representation immediately after the reasoning for that step","venue":null,"work_id":"eeb950a8-fe20-4e18-a4cc-88ced2edab5d","year":null},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:969739c1906399aedd31d9f383e32c35c9f4948a07523d2203532bae40c8b6fb","observation_id":"5151a433-a36e-49d3-8858-1bb9f18011cc","resolution":{"observed_at":"2026-07-10T13:37:07.151075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:07.153503Z","title":null,"venue":null,"work_id":"006174ca-5d59-4308-97d0-8a79daac741a","year":null},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:0c35e0611b7e73ee3147199ea98878c04ff31211c507a64c3b3fe1d21cb726ff","observation_id":"1de85280-4c21-4ce4-8558-f1d479c254a0","resolution":{"observed_at":"2026-07-10T13:37:07.154638Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:07.127978Z","title":null,"venue":null,"work_id":"65875784-3f4b-466f-b820-6856acf91cfc","year":null},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:715cba3e2bd00e22a3c94f2298e09298f9e3b7ba7411e025551817630cca4c38","observation_id":"d95a6a3d-fb90-4337-a009-845ffe83642a","resolution":{"observed_at":"2026-07-10T13:37:07.129233Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:07.131893Z","title":null,"venue":null,"work_id":"b47299d8-abef-4131-a134-d2cb5fa77a4a","year":null},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:e4122b880ffdd0e7fc78d345e6d8e66d274c199643b7c290ebb758032eaeff0c","observation_id":"7323c1f5-582f-4899-ab0f-2fe5b7981c73","resolution":{"observed_at":"2026-07-10T13:37:07.133048Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:07.133608Z","title":"Output Format: First, write step-by-step reasoning about how to complete the task, including task decomposition, subgoal setting, and action sequencing","venue":null,"work_id":"08b29e94-8a7d-47a0-aaa2-4cd37d2e1f21","year":null},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:d9d93d60f941bf7bba701e894f20a22294f084547f1ce6efb83b6dde5bd3fe1f","observation_id":"a87c408f-1e04-4550-a74f-a29d30312866","resolution":{"observed_at":"2026-07-10T13:37:07.135006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":8,"verified_exact":37,"verified_fuzzy":20},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2607.08024."}