{"as_of":"2026-08-07T08:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1fa0e52cc8dabf19de7ffc94f5ffd0c485b82ddeec57cb9475cb564f5e022e29","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:44:49.592008Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T11:39:15.308355Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T11:40:03.350024Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"cited_work":{"arxiv_id":"2507.15130","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15130","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enhanc- ing visual planning with auxiliary tasks and multi-token pre- diction","venue":null,"work_id":"3718eda6-ed58-4744-98bf-a2faa8f983e7","year":2025},"citing_paper":{"arxiv_id":"2602.23058","last_updated":"2026-05-17T06:55:06Z","snapshot_observed_at":"2026-07-06T22:47:11.228912Z","submitted_at":"2026-02-26T14:42:53Z","title":"GeoWorld: Geometric World Models","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-21T11:39:15.308355Z"},"links":{"cited_paper":"/paper/2507.15130","citing_paper":"/paper/2602.23058"},"observation_digest":"sha256:d5fa2836b84997c25fe6b89b9b7f2966f7b24ad39927524a8a17c0e5abab8a46","observation_id":"115e9f3b-1d83-4ccd-9d0b-7f6cbd293e61","resolution":{"observed_at":"2026-05-21T11:40:03.352082Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.15130/citation-record","integrity":"/paper/2507.15130/integrity","json":"/paper/2507.15130/citation-record.json","paper":"/paper/2507.15130"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:50.170617Z","title":"When will you do what?-anticipating temporal occurrences of activities","venue":null,"work_id":"47ac1765-7c0f-40e0-874f-03f643083aea","year":null},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:43.981738Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:9d0551f5cb1dd4e3620d9e83d28d00478ac40a48f053a619e5b417e98edee50f","observation_id":"d1ef1572-a27c-4efd-b6ee-8a89deccadc8","resolution":{"observed_at":"2026-08-06T15:44:50.173046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T15:44:44.065986Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:44.065986Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:0b722660a178449a330e459b68d886cf46040c91b11158ceadeabdd34b7d5dc9","observation_id":"cb381446-e785-4243-9a8f-b90d5f812668","resolution":{"observed_at":"2026-08-06T15:44:44.065986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:44.155587Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:44.155587Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:aa824c045400638b438a9fcbf8bd29add62d7c7c0311876604cc8dca9467c6f0","observation_id":"72238229-4323-4029-bb15-8fa4759981fb","resolution":{"observed_at":"2026-08-06T15:44:44.155587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:50.158651Z","title":"Hiervl: Learning hierarchical video- language embeddings","venue":null,"work_id":"26a793f8-71f4-4b18-9bac-997b139b6216","year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:44.281924Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:4d34d741fc5664f4355677eb2789349835650a6f7f5e1c7963b1c7020cd6218e","observation_id":"fff40a00-3055-483b-99c0-73bf8ca694e5","resolution":{"observed_at":"2026-08-06T15:44:50.161138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:50.151050Z","title":"Procedure planning in instructional videos","venue":null,"work_id":"01e4f963-ed53-471b-b80d-411483f33e25","year":2020},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:44.356600Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:1667899746d235b35f28379be80bea81d074ce72d67a919339298f161782ab62","observation_id":"f9f18253-afc6-42b3-9605-c383a5d72b26","resolution":{"observed_at":"2026-08-06T15:44:50.153750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:50.143871Z","title":"Spatialvlm: Endow- ing vision-language models with spatial reasoning capabili- ties","venue":null,"work_id":"f23a56eb-77cf-4f4e-b24b-4dff7b232b1d","year":null},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:44.497438Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:5552df917ede24f04a3cf3b68028fee1abd4b290cf493d18ffe283756879beb0","observation_id":"fbf579ff-4efe-43d4-889e-b9e8957a91b8","resolution":{"observed_at":"2026-08-06T15:44:50.146331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06722","last_updated":"2024-06-11T06:53:44Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T03:35:58Z","title":"EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06722","snapshot_observed_at":"2026-08-06T15:44:44.617672Z","title":"Egoplan-bench: Benchmarking egocentric embodied plan- ning with multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:44.617672Z"},"links":{"cited_paper":"/paper/2312.06722","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:78a7ea7862b3ae99555d2fbcc730682bb02dba07bcf4a8a11c0796c746adc29d","observation_id":"b1b39347-9368-4e03-9849-e3285bb02838","resolution":{"observed_at":"2026-08-06T15:44:44.617672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T15:44:44.712467Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:44.712467Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:e6f6d644fb7640ab14e4670416be924cc488094bb7006ad611f54ece767b2596","observation_id":"92f198ec-ee75-48ac-8f2a-66d84f03eb99","resolution":{"observed_at":"2026-08-06T15:44:44.712467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19737","last_updated":"2024-04-30T17:33:57Z","snapshot_observed_at":"2026-08-03T23:22:09.849239Z","submitted_at":"2024-04-30T17:33:57Z","title":"Better & Faster Large Language Models via Multi-token Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19737","snapshot_observed_at":"2026-08-06T15:44:44.806734Z","title":"Better & faster large language models via multi-token prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:44.806734Z"},"links":{"cited_paper":"/paper/2404.19737","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:1e79c05e02471638aa15b2b1e448cd5653134203f26018771c286b0c4f6757e6","observation_id":"6c23d4da-96e1-43a4-b120-7c4db34acdaa","resolution":{"observed_at":"2026-08-06T15:44:44.806734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:50.136199Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"b9119467-5ba8-4ab7-bc2c-a6b2dedadd1b","year":2022},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:44.914759Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:a28ba6d5970ee2f62df333b0c07374d7857c03717f808c6943bf4e8f8bc7d859","observation_id":"9b8f4eb0-eead-471e-a8b0-4397c62e683a","resolution":{"observed_at":"2026-08-06T15:44:50.138897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14992","last_updated":"2023-10-23T07:24:28Z","snapshot_observed_at":"2026-07-06T15:32:25.931739Z","submitted_at":"2023-05-24T10:28:28Z","title":"Reasoning with Language Model is Planning with World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14992","snapshot_observed_at":"2026-08-06T15:44:45.036118Z","title":"Reasoning with language model is planning with world model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:45.036118Z"},"links":{"cited_paper":"/paper/2305.14992","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:5dca513e0103b624bb1f10f5aeaaf1959cc0a9e7346370ed4c59d845afcd6ce6","observation_id":"1e7b96ed-19db-489a-b249-63f02ce724b2","resolution":{"observed_at":"2026-08-06T15:44:45.036118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T15:44:45.143895Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:45.143895Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:cdff349ad78ed0ca798c64b7a9c901cb63f6fd0952fbb1256bc92f41bc7cf17e","observation_id":"66bf25b6-aa1e-4d23-82b3-1a50ffecafe2","resolution":{"observed_at":"2026-08-06T15:44:45.143895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:45.259004Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:45.259004Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:9962c612e121f6f8494af4d26986ded25b606edadb834e4e7011ce5dcfd7ec9f","observation_id":"3231d02b-bfad-4a3e-9862-4454351e6988","resolution":{"observed_at":"2026-08-06T15:44:45.259004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:50.064198Z","title":"Language models as zero-shot planners: Extract- ing actionable knowledge for embodied agents","venue":null,"work_id":"913ff6e1-2c00-415d-adc3-f3f283ec7609","year":2022},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:45.361973Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:a9d1dc96affd760d5f043a6b1f18c3927801953cdd0c38adb9f20a3eb3432231","observation_id":"b452a7b1-8d21-4b5b-a131-554a48270480","resolution":{"observed_at":"2026-08-06T15:44:50.066608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20557","last_updated":"2024-09-30T17:57:28Z","snapshot_observed_at":"2026-07-06T19:24:43.745786Z","submitted_at":"2024-09-30T17:57:28Z","title":"Propose, Assess, Search: Harnessing LLMs for Goal-Oriented Planning in Instructional Videos","version":1},"cited_work":{"arxiv_id":"2409.20557","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.20557","snapshot_observed_at":"2026-08-06T15:44:49.789289Z","title":"Propose, Assess, Search: Harnessing LLMs for Goal-Oriented Planning in Instructional Videos","venue":"cs.CV","work_id":"ad691b60-ec41-425d-be39-f1ed40f86782","year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:45.482849Z"},"links":{"cited_paper":"/paper/2409.20557","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:bc9d78fade60050d48cb1b8343662d8f353c9f3cce6b95ccebd10c0f122d6268","observation_id":"5ebe8f6a-baad-455f-a467-80ef575e3610","resolution":{"observed_at":"2026-08-06T15:44:49.792034Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:50.057088Z","title":"Palm: Predicting actions through language models","venue":null,"work_id":"084581e3-249c-4e6b-9d45-126ab6133094","year":2025},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:45.617947Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:000ab31504eed1d61d960d066eeab91df4592057ff60e1381a4bd6bd0c53980b","observation_id":"0f03c10e-7a52-4b22-a0c9-7d99c64ba0c9","resolution":{"observed_at":"2026-08-06T15:44:50.059681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T15:44:45.736431Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:45.736431Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:56a0c5acbf5c938de4d0a08a26cce4eb3befa79c3ca9f56eb5b813ec1f8317e0","observation_id":"df76deea-f9a7-4c2b-9cea-6dc95f0b37bf","resolution":{"observed_at":"2026-08-06T15:44:45.736431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:50.050234Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"dedcee43-5da6-43bf-920b-e4064d8df947","year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:45.818880Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:0e35ddd1ede0af7461f4ae10880bdb410f03d4e1f14f8381b7592d9c4ce3a6d9","observation_id":"bbd8abc5-45e6-4a6a-9c4d-1e2ad8ac49ec","resolution":{"observed_at":"2026-08-06T15:44:50.052622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-06T15:44:45.907158Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:45.907158Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:1a104e1a2610357a7fe930e199526112ee2bc92b8d91908bcdef5acb38cd7462","observation_id":"010fbb76-6cf4-4479-82d7-62955d2fc731","resolution":{"observed_at":"2026-08-06T15:44:45.907158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:50.043357Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":"ae0e4acc-ef24-41c6-9423-a955e28e22ed","year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:45.981792Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:1933db0fac46eff92b7dc6044a796b90d4b2ea253daa27f3c0495819c2881fa2","observation_id":"8e2c3f67-7f3d-463a-ae90-eab374619d4d","resolution":{"observed_at":"2026-08-06T15:44:50.045748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:50.035803Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"db5d5a5b-4a9d-4d0d-9c5d-dd923c7519a5","year":2025},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:46.075955Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:df124b021ec6265586c639aeeeda95d8da0b76877741ba67b81dde62059731bf","observation_id":"83e61c2f-2559-4abc-bed2-2b054d6e6cc0","resolution":{"observed_at":"2026-08-06T15:44:50.038452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:50.028872Z","title":"Skip-plan: Procedure plan- ning in instructional videos via condensed action space learn- ing","venue":null,"work_id":"f913cef5-1af7-42d0-b8e4-f696e76e48f4","year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:46.185631Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:7632f363113d8bca769334e32656525de4f76092f4d291019b369c48a96e9986","observation_id":"e32811d9-557a-45dc-8a30-0dcf25808e09","resolution":{"observed_at":"2026-08-06T15:44:50.031304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-06T15:44:46.272623Z","title":"Video-llava: Learning united visual rep- resentation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:46.272623Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:ee88f4594666fc8b2b08ae5c0fbec5ec9d7b1a363c03c958c206fbd0cb9a2e2b","observation_id":"5d031845-fb8f-4d37-83cd-620bed5edc2f","resolution":{"observed_at":"2026-08-06T15:44:46.272623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11477","last_updated":"2023-09-27T07:29:44Z","snapshot_observed_at":"2026-08-01T15:58:01.346044Z","submitted_at":"2023-04-22T20:34:03Z","title":"LLM+P: Empowering Large Language Models with Optimal Planning Proficiency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11477","snapshot_observed_at":"2026-08-06T15:44:46.355848Z","title":"Llm+ p: Empower- ing large language models with optimal planning proficiency","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:46.355848Z"},"links":{"cited_paper":"/paper/2304.11477","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:0fd9d07fd63467cc5782c625ba161f968943ef0ff6924f7db2e7ae80309e20ef","observation_id":"1826b2e1-b5d0-4166-95ad-9199fcbaf75d","resolution":{"observed_at":"2026-08-06T15:44:46.355848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:50.021865Z","title":"Visual instruction tuning","venue":null,"work_id":"cd9237af-cc63-4ce5-87b9-7972202f63a7","year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:46.434456Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:3741c89b47f67582aebb824b5d6601c9ce454893b0bd76866de6a5daf916ba44","observation_id":"0d423aea-4a84-411c-8400-7a297d87cd58","resolution":{"observed_at":"2026-08-06T15:44:50.024103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:50.014534Z","title":"A language-first approach for procedure planning","venue":null,"work_id":"24df45cc-699b-4cad-9e7f-acdf9055cfdf","year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:46.528710Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:f2a981d31f53aea94667b5e3592985360f7f9d0792fa0eb666d48d4738c6511c","observation_id":"19b722b5-fe3a-422c-807c-cf83d362d10d","resolution":{"observed_at":"2026-08-06T15:44:50.017054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:50.007051Z","title":"Intention-conditioned long-term human egocentric action anticipation","venue":null,"work_id":"80961b54-4064-4366-9ce5-fd10000193b1","year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:46.610609Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:f6672f2ec4ab073268a853b68d3706bce059c2c2cddbe06ceed45f0650595c9c","observation_id":"ec54eccf-757e-4470-a178-8c20ac2ca022","resolution":{"observed_at":"2026-08-06T15:44:50.009663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.999645Z","title":"Can’t make an omelette without breaking some eggs: Plausible action anticipation using large video- language models","venue":null,"work_id":"6f807542-d63f-44a8-ac25-5dde79d575c8","year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:46.680605Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:d5e0d8e80bf1e51706c34793e2fe938610e670125453de00228adf57e0c22436","observation_id":"e70b9c84-0c3a-4466-b36c-262583ebbfa4","resolution":{"observed_at":"2026-08-06T15:44:50.002240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.991549Z","title":"Any- mal: An efficient and scalable any-modality augmented lan- guage model","venue":null,"work_id":"2584af62-0734-4004-a34a-9bfa152c9292","year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:46.734541Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:1b82fc5a6422d643e3ef2f0bb24147a1da0936caf3744f655513678e775ae5ca","observation_id":"7e57bf75-9560-4cb3-a881-8c99d592fa92","resolution":{"observed_at":"2026-08-06T15:44:49.994645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.983869Z","title":"Embodiedgpt: Vision-language pre-training via embodied chain of thought","venue":null,"work_id":"63944f1b-2106-4c49-8ca9-56970f8d8097","year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:46.817312Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:0de41f190678f5f8e9b6ba7d89069e6918c454e87e849c0849b0e2f1e441aebc","observation_id":"acc44834-e809-4f34-9a37-ff9452287226","resolution":{"observed_at":"2026-08-06T15:44:49.986211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.976517Z","title":"Ego-topo: Environment affordances from egocentric video","venue":null,"work_id":"a8bd20c3-5657-4f30-a1cb-10639f4dba1a","year":2020},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:46.889917Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:d7d90ba7c1bd342feeade08768607a6d7cd29d9ee3f1327273a9550b0ff736d4","observation_id":"c0cd7f5f-bff3-49d8-b818-96adb1df2653","resolution":{"observed_at":"2026-08-06T15:44:49.979003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.968986Z","title":"Why not use your text- book? knowledge-enhanced procedure planning of instruc- tional videos","venue":null,"work_id":"5a1a1bef-5017-4a81-82de-52eb84bec433","year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:46.976969Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:3482e52e8927a1d1e61f56f91602e334bb916f6fa46c4eb03c8520e1d34a250c","observation_id":"b8de1b13-6e6a-4cc0-b53e-59a503d393c0","resolution":{"observed_at":"2026-08-06T15:44:49.971464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.961546Z","title":"Re- thinking learning approaches for long-term action anticipa- tion","venue":null,"work_id":"f6f43d17-c7a8-41cc-ac17-4d664712820a","year":2022},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:47.046680Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:49895d85ea0919d340c01cc48d711732d81d4c249ba83468f1ebed4a69dfbedd","observation_id":"4d55b9dd-512e-4f59-9f33-0bc19cd72ffc","resolution":{"observed_at":"2026-08-06T15:44:49.964005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10488","last_updated":"2024-09-16T17:22:18Z","snapshot_observed_at":"2026-07-06T19:16:10.416481Z","submitted_at":"2024-09-16T17:22:18Z","title":"Do Pre-trained Vision-Language Models Encode Object States?","version":1},"cited_work":{"arxiv_id":"2409.10488","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.10488","snapshot_observed_at":"2026-08-06T15:44:49.749031Z","title":"Do Pre-trained Vision-Language Models Encode Object States?","venue":"cs.CV","work_id":"f14ed7bb-137b-48fe-b1d2-10f2b30b5a0b","year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:47.143277Z"},"links":{"cited_paper":"/paper/2409.10488","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:06926fb102d44bedb23aa3381e570f32f484632548acb103dc9c48df835fb811","observation_id":"003f8245-b33f-43fc-8cb8-f28d80703fbb","resolution":{"observed_at":"2026-08-06T15:44:49.751802Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01599","last_updated":"2024-03-03T19:53:06Z","snapshot_observed_at":"2026-08-05T20:18:45.090026Z","submitted_at":"2024-03-03T19:53:06Z","title":"SCHEMA: State CHangEs MAtter for Procedure Planning in Instructional Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01599","snapshot_observed_at":"2026-08-06T15:44:47.232091Z","title":"Schema: State changes matter for pro- cedure planning in instructional videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:47.232091Z"},"links":{"cited_paper":"/paper/2403.01599","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:42cf04ed345171274a9c1d6ed7c0afeef241c47cd9ebaf244ae36ea4c2fa63ce","observation_id":"23e267b8-7b9e-44fa-ba12-6ecdce73340d","resolution":{"observed_at":"2026-08-06T15:44:47.232091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.953866Z","title":"Pretrained language models as visual planners for human assistance","venue":null,"work_id":"63ef98f1-008f-4d1f-843a-ccb640d156b7","year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:47.334176Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:3e0be33be84a41d4e1447b2a6f2d526d2d23f8c0c0f5ea78e4591bb75f184051","observation_id":"eb7d0d66-827a-41ca-975d-84c6678d8883","resolution":{"observed_at":"2026-08-06T15:44:49.956596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18070","last_updated":"2024-07-01T02:44:11Z","snapshot_observed_at":"2026-08-03T16:08:46.390961Z","submitted_at":"2024-06-26T05:01:37Z","title":"EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18070","snapshot_observed_at":"2026-08-06T15:44:47.422726Z","title":"Egovideo: Exploring egocentric founda- tion model and downstream adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:47.422726Z"},"links":{"cited_paper":"/paper/2406.18070","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:6dae611f5cdf666da073f336f7b7022d322746ede73d8ad28d4f1545b1f558f1","observation_id":"ad121c6a-9f47-4e65-820a-c8f927d7c9d2","resolution":{"observed_at":"2026-08-06T15:44:47.422726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-06T15:44:47.520419Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:47.520419Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:fb5625235ebbdf9ee82cda6abee54b636b7327f24a5d4da458a15e59b01ced68","observation_id":"212abde4-2bc1-42ed-82a1-c02e251bec32","resolution":{"observed_at":"2026-08-06T15:44:47.520419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:47.619011Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:47.619011Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:4b09a2351b2c4ca101dd1cee942dcff3f327067eff8ae4d1ca6997f6a72dbdeb","observation_id":"8d5e895f-1c46-43d7-9700-6300edf4e55b","resolution":{"observed_at":"2026-08-06T15:44:47.619011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.941863Z","title":"Llm-planner: Few-shot grounded planning for embodied agents with large language models","venue":null,"work_id":"e12a410b-93b6-4562-8cba-f33a57404818","year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:47.715754Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:488fafb48258e944007b399ccc79a3445297077b0133f2ae9bdd9797373b9867","observation_id":"9f2e9711-22f4-4fe6-98c5-e186b4b5e058","resolution":{"observed_at":"2026-08-06T15:44:49.944499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:47.800874Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:47.800874Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:fdf8b9b3cfe4a607d043cfc17692e5fe0c141bd057ec87887a362c815c8b93c0","observation_id":"0332c79f-4bd2-4097-a37d-4d215e106510","resolution":{"observed_at":"2026-08-06T15:44:47.800874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.930137Z","title":"Coin: A large-scale dataset for comprehensive instructional video analysis","venue":null,"work_id":"2a3fc59b-042a-4f0f-a531-81b2174fa6e7","year":2019},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:47.933683Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:3de3e1130d8abf81cc2ee85ea454e306050f81e61f37c3c7cdda1c1ae8057400","observation_id":"5d54eda3-0659-45a6-9c88-e1e0f13aaf97","resolution":{"observed_at":"2026-08-06T15:44:49.932602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01090","last_updated":"2024-11-06T11:44:50Z","snapshot_observed_at":"2026-07-06T18:08:39.127793Z","submitted_at":"2024-05-02T08:43:16Z","title":"Learning Multiple Object States from Actions via Large Language Models","version":2},"cited_work":{"arxiv_id":"2405.01090","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.01090","snapshot_observed_at":"2026-08-06T15:44:49.714421Z","title":"Learning Multiple Object States from Actions via Large Language Models","venue":"cs.CV","work_id":"2bea8894-1c1b-428b-9e6d-d126270eab32","year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:48.030903Z"},"links":{"cited_paper":"/paper/2405.01090","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:e4025213c87ff6ccdc260dd257b4debf5be67d194541154011aba8a811022376","observation_id":"f219ca49-d55a-4d09-96f2-08470039b654","resolution":{"observed_at":"2026-08-06T15:44:49.717370Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T15:44:48.175250Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:48.175250Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:2427926381aa4a35fc6ee376cb05d16b647a9d2103f51d738aa275fc6999976f","observation_id":"5f6f2c71-ab4a-44a8-a5de-3d2bf337fcc5","resolution":{"observed_at":"2026-08-06T15:44:48.175250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03160","last_updated":"2024-08-12T01:59:00Z","snapshot_observed_at":"2026-07-06T18:57:26.924381Z","submitted_at":"2024-08-04T06:12:42Z","title":"User-in-the-loop Evaluation of Multimodal LLMs for Activity Assistance","version":2},"cited_work":{"arxiv_id":"2408.03160","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.03160","snapshot_observed_at":"2026-08-06T15:44:49.694895Z","title":"User-in-the-loop Evaluation of Multimodal LLMs for Activity Assistance","venue":"cs.CV","work_id":"0bb37d01-9386-41c2-a152-61c1a3b68d20","year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:48.352122Z"},"links":{"cited_paper":"/paper/2408.03160","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:4b93cf5f8c492753fee1bd8cefcac2c5e4e93dcccd7e61cdd72555e9b870a112","observation_id":"ddc243e0-b54d-4218-ba0d-974bfd281f57","resolution":{"observed_at":"2026-08-06T15:44:49.697709Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.922867Z","title":"Event-guided procedure planning from in- structional videos with text supervision","venue":null,"work_id":"f32c699b-7974-43b0-89bb-f68ec1e42343","year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:48.507610Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:b05214c7b505d6ad9f12a765d1421d85e51c650c164ae029febc983f93e34a8c","observation_id":"3b647031-8ff2-4b39-9107-29dbc407fde3","resolution":{"observed_at":"2026-08-06T15:44:49.925468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.915073Z","title":"Pdpp: Projected diffusion for procedure planning in instructional videos","venue":null,"work_id":"b4013855-25d1-47e3-bdbd-ce2c070140f8","year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:48.650999Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:3da198b4f97134811e909388776e9878b0abc3a2a12fad11626676af54b7ad82","observation_id":"7bd79037-3e2b-4fd2-afcb-c52500d9e309","resolution":{"observed_at":"2026-08-06T15:44:49.917737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13627","last_updated":"2024-07-13T22:10:57Z","snapshot_observed_at":"2026-07-06T16:51:15.252642Z","submitted_at":"2023-11-22T17:44:24Z","title":"Vamos: Versatile Action Models for Video Understanding","version":3},"cited_work":{"arxiv_id":"2311.13627","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.13627","snapshot_observed_at":"2026-08-06T15:44:49.684407Z","title":"Vamos: Versatile Action Models for Video Understanding","venue":"cs.CV","work_id":"996a7071-91ef-426f-b328-432e8e9d29c3","year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:48.688715Z"},"links":{"cited_paper":"/paper/2311.13627","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:aad7f368d67439d798e0e219e4aadc38102356dcfbfb2402c728aac2bd1cbb42","observation_id":"9cb4e834-73d3-49bc-aaee-44abd6ea5728","resolution":{"observed_at":"2026-08-06T15:44:49.687256Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.907020Z","title":"Learn- ing object state changes in videos: An open-world perspec- tive","venue":null,"work_id":"887e9b5f-1149-419b-8bfc-86dc9c914e56","year":null},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:48.748675Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:22f75f276e4ea826276b3833dabb19c9da6fe0e7c08f1037837872dfd5a6f191","observation_id":"a088458d-7634-4f1c-8ca8-51e26ea5be01","resolution":{"observed_at":"2026-08-06T15:44:49.909513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.899336Z","title":"Octopus: Embodied vision- language programmer from environmental feedback, 2023","venue":null,"work_id":"908e00cd-2436-47b0-a975-79ce70cab87c","year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:48.801693Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:3b9a0dae11c0d0b5f5b41726c428dc61bd93939c22f5c6b62bf7adbd7220a8f0","observation_id":"956f8e27-856e-4355-936d-0666a9808099","resolution":{"observed_at":"2026-08-06T15:44:49.901873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18600","last_updated":"2024-09-25T14:20:39Z","snapshot_observed_at":"2026-08-05T01:29:46.694898Z","submitted_at":"2024-03-27T14:22:40Z","title":"RAP: Retrieval-Augmented Planner for Adaptive Procedure Planning in Instructional Videos","version":2},"cited_work":{"arxiv_id":"2403.18600","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.18600","snapshot_observed_at":"2026-08-06T15:44:49.670915Z","title":"RAP: Retrieval-Augmented Planner for Adaptive Procedure Planning in Instructional Videos","venue":"cs.CV","work_id":"f54d139a-3a41-4ac3-92e1-71c67a818d17","year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:48.842813Z"},"links":{"cited_paper":"/paper/2403.18600","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:b6fabe5419ff3eb1f175e25aca39bdb1da1fced52e7f35b6fc6cb48274460a61","observation_id":"1d5423c0-02f8-49f9-9e76-ff78bfff4087","resolution":{"observed_at":"2026-08-06T15:44:49.675996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.891362Z","title":"Object-centric video representation for long-term action anticipation","venue":null,"work_id":"a54eca2e-e0c2-4d3a-aee0-a59766e10662","year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:48.910963Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:bd5f7e096d541b571dbb09d58d0830f55f7345bb471f936946f417c148976fe3","observation_id":"a03f4ecb-e404-4648-bf90-07472dcd2fc3","resolution":{"observed_at":"2026-08-06T15:44:49.894247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T15:44:48.976855Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:48.976855Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:b0f073b9f64861f9de4ad4271f01b3e652e1f53131295d264b291b1912560da7","observation_id":"23a278c6-bd3f-43e7-ab9b-259c65b1eb56","resolution":{"observed_at":"2026-08-06T15:44:48.976855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.883376Z","title":"P3iv: Prob- abilistic procedure planning from instructional videos with weak supervision","venue":null,"work_id":"a926041c-216b-4eb2-8487-773f90b4469f","year":2022},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:49.021366Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:86de35d794d7af83185acef5f4e1ca096f40796a026ea94540496367ab3a185a","observation_id":"b78c2393-32b0-4215-884f-cf024c8db353","resolution":{"observed_at":"2026-08-06T15:44:49.886095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16368","last_updated":"2024-04-01T01:33:53Z","snapshot_observed_at":"2026-07-06T16:00:25.707740Z","submitted_at":"2023-07-31T02:14:19Z","title":"AntGPT: Can Large Language Models Help Long-term Action Anticipation from Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16368","snapshot_observed_at":"2026-08-06T15:44:49.029086Z","title":"Antgpt: Can large language models help long- term action anticipation from videos? arXiv preprint arXiv:2307.16368, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:49.029086Z"},"links":{"cited_paper":"/paper/2307.16368","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:88718456ab34f394c84a2d3ba2a515488527ed6df72ba3f13a1330f3ff8a97bd","observation_id":"70571645-9ad2-4347-bea0-571aa42e7e8b","resolution":{"observed_at":"2026-08-06T15:44:49.029086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.875739Z","title":"Towards learning a generalist model for embod- ied navigation","venue":null,"work_id":"990c59dd-71d1-47df-bae5-a1c2deb42c7f","year":2024},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:49.034663Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:9b56d9d266e418f7cf9444fdc6f0f69c68b83fb6c1c9fb2aea5a6e83bbf3a429","observation_id":"653059be-6758-4f8a-ad93-a510d079ded0","resolution":{"observed_at":"2026-08-06T15:44:49.878331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.120307Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems, 36:46595–46623, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:49.120307Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:173f0ec7571f5d34a01b3de3a32ed6d94fbdc03cb7988fd3d91508ef817d7ce4","observation_id":"c8f553c1-b4d0-4bc1-9634-e562077195be","resolution":{"observed_at":"2026-08-06T15:44:49.120307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T15:44:49.190266Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:49.190266Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:dc5036a0cd208eabed6f6d57942e052b3bcade0e184521dab67de67e7132597d","observation_id":"ed1535af-4470-4e8e-bb0b-5efafbe389f7","resolution":{"observed_at":"2026-08-06T15:44:49.190266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.863839Z","title":"Cross- task weakly supervised learning from instructional videos","venue":null,"work_id":"0b03fc74-dd13-4eef-8161-a37a70a4b591","year":2019},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:49.288340Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:6ac70d31a6e6b5d2d35d808a59efb59b901bd8726f341d75ef9ee8bc91680022","observation_id":"58977a31-b981-4e08-ae42-3f13da79417e","resolution":{"observed_at":"2026-08-06T15:44:49.866298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.856534Z","title":"before” with “after","venue":null,"work_id":"f3dc8adb-0f0a-420c-a35d-d2bff00e6109","year":null},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:49.417662Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:0dbe43232465c6a4dbd2309a39b8f6ee1285ea6435ce6e6bd3f283a953726ac7","observation_id":"aa874697-635c-4d25-8905-c864c4106a8e","resolution":{"observed_at":"2026-08-06T15:44:49.858942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.849005Z","title":"Training We train our model for 1 epoch with a batch size of 1024","venue":null,"work_id":"48172f7a-62cf-4532-bb54-e711b793489f","year":null},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:49.495928Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:c9973a654a460c4efc535c4644fbcae17a932bdc92cf368546ee509503a7faf5","observation_id":"df875fdf-dfaf-490e-b2ae-bd12d17b3fe7","resolution":{"observed_at":"2026-08-06T15:44:49.851659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:49.841105Z","title":"dough”, “container","venue":null,"work_id":"5fa08f45-3d4e-419a-a4ea-f96d2b8b3c24","year":null},"citing_paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:49.592008Z"},"links":{"citing_paper":"/paper/2507.15130"},"observation_digest":"sha256:fd1c277b8a729479d0307cbe6cac013373fa4ca3b66ee3e2c791734f6fd04ddc","observation_id":"889eb96f-8bc6-4f6a-b0ec-b5d88ce41d6b","resolution":{"observed_at":"2026-08-06T15:44:49.843986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.15130","last_updated":"2025-07-20T21:39:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T15:37:34.103575Z","submitted_at":"2025-07-20T21:39:05Z","title":"Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":6,"verified_fuzzy":34},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 1 inbound Pith citation observation for arXiv:2507.15130."}