{"as_of":"2026-08-07T20:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7b46f899d281381f9680ef7b5b5b45c565547068b00c30e42e55029ed9184131","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:21:51.244696Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.08496/citation-record","integrity":"/paper/2507.08496/integrity","json":"/paper/2507.08496/citation-record.json","paper":"/paper/2507.08496"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:44.570259Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:44.570259Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:3aeb69dbf996c43b16ec94a30ff98991143a2dee8ef7f9e48da2aa8e3e8ec4f9","observation_id":"de51e18a-4ac3-4917-b4b3-b045032243f4","resolution":{"observed_at":"2026-08-06T18:21:44.570259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:59.070578Z","title":null,"venue":null,"work_id":"12f48b05-2f43-4af3-a558-d2c01992211c","year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:44.626542Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:e9524ec1ae28df536b4fee66612fd7b2c5e902e7093874770b9080af124735bc","observation_id":"d3a60039-9acc-4159-8da6-59e85edf3eda","resolution":{"observed_at":"2026-08-06T18:21:59.159967Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:58.864447Z","title":null,"venue":null,"work_id":"363fdb7f-39e4-4bc1-b3e0-cbed48af3e99","year":2020},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:44.705572Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:85212b8d6bad036771e693497d1ee29d4d84cc2a953f7605d91bcf7641125523","observation_id":"1f418d61-9696-4600-904c-87322a01166d","resolution":{"observed_at":"2026-08-06T18:21:58.961744Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:44.812886Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:44.812886Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:17f14a9d105b1ffbb6e5f96c13254d32de573c173f96c23671219511c094658a","observation_id":"d1dd50c5-13ab-40e9-acbc-63f139ccd9e3","resolution":{"observed_at":"2026-08-06T18:21:44.812886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:44.898908Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:44.898908Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:ad23b16e295451ea7f94a8b98bf0e666c18a46aa2f63314bd61971faadecef5d","observation_id":"9288beff-2e3d-4a6a-8c3d-6a3b1f9dd73f","resolution":{"observed_at":"2026-08-06T18:21:44.898908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T18:21:44.970567Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:44.970567Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:99a44019143d2e3ba81654402948a547f9ad39e90996c0aae68954bda6419850","observation_id":"8b4f6cab-d886-4e5f-ac84-7fdf180f776c","resolution":{"observed_at":"2026-08-06T18:21:44.970567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-07-06T19:17:02.745056Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-08-06T18:21:45.055037Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:45.055037Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:75d44814a47a01ac58977f367c9badb74adba499d0f332bd08b0e99d7f8a8363","observation_id":"55102870-4915-4560-a293-9adcb80f0ca4","resolution":{"observed_at":"2026-08-06T18:21:45.055037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:45.121350Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:45.121350Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:d86d2526e98885a27860f7cf1d4889d79dd21f3910020bd0bdb9b978c0c5028f","observation_id":"7da83e3c-6af5-458e-a354-bc6d3a6371f6","resolution":{"observed_at":"2026-08-06T18:21:45.121350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:58.665290Z","title":null,"venue":null,"work_id":"1ca6d4ff-5c3d-46c6-b7b5-98e648931329","year":null},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:45.190264Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:7b628e93c621393d26e9e49e20995d8b154b440266f5438c70d85779b488c0d4","observation_id":"40f891bc-5672-4141-8b49-d50202128df4","resolution":{"observed_at":"2026-08-06T18:21:58.751228Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:58.312816Z","title":null,"venue":null,"work_id":"c0738390-9fa9-40d3-b5f9-36f15e744297","year":2023},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:45.355704Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:7fbf7aef4f20c24a362c819b7f6d7ba9f873e4c67db1317a263915c412eef137","observation_id":"25cf6fd1-3e91-4458-abf6-d3a22240f617","resolution":{"observed_at":"2026-08-06T18:21:58.425038Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:58.111483Z","title":null,"venue":null,"work_id":"66ba7035-d1a0-4dd9-a9bc-352f6dcfd9ee","year":2025},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:45.419467Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:9ea72057e27571657363c925a5cb942fadb3feb999b69eafe6fd56db026ae812","observation_id":"ea1b7ae1-d044-454e-9ed2-6dd803815844","resolution":{"observed_at":"2026-08-06T18:21:58.185367Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:57.869719Z","title":null,"venue":null,"work_id":"d5e13e42-4421-4eb1-b16a-fbbc593eac66","year":2025},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:45.510100Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:f4b92c94fe836744c97cca87ed214fc48a4077394a068371f819ea8f33b0d411","observation_id":"67dd072d-4e1d-4e4f-924f-40258e245af0","resolution":{"observed_at":"2026-08-06T18:21:57.985784Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:57.789999Z","title":null,"venue":null,"work_id":"6e04fc80-11c8-441e-a434-5031439fe54c","year":2023},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:45.622330Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:2192379469cc4337cf1f61df6785312e28a9512adb4242cffdd0e5b8d218f26e","observation_id":"a2d50294-f87c-47b3-bbc6-cf5ed050d434","resolution":{"observed_at":"2026-08-06T18:21:57.826628Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:57.726544Z","title":null,"venue":null,"work_id":"55209081-dbb2-47e4-8064-51c847e80f20","year":2022},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:45.775243Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:6c3bccfeed8ed335856572aa49566a276b69e80e412263f39209b053d8a2bbb2","observation_id":"b35522e2-fd7f-4c4b-92aa-12951d693385","resolution":{"observed_at":"2026-08-06T18:21:57.771568Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:57.627204Z","title":null,"venue":null,"work_id":"d2441d4a-d818-49e3-b516-35bed095e9f6","year":null},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:45.851468Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:4a7082bf816b940a373727af4f57837ce99e121b0feca1f8ec6cd4ad01e8459f","observation_id":"312ca3f7-0776-4652-927a-2709e8e400a5","resolution":{"observed_at":"2026-08-06T18:21:57.663552Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:46.036257Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:46.036257Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:545d783a4b2b1bc6680e027c696cb50f8e794b8fd6523a15a596eab65024b644","observation_id":"4d986e8d-8962-410c-a1e7-fba22849afac","resolution":{"observed_at":"2026-08-06T18:21:46.036257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:57.499715Z","title":"Advances in Neural Information Processing Systems 36 (2023), 79081–79094","venue":null,"work_id":"c2f6ff17-553c-4dbe-9478-58dad0602873","year":2023},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:45.929141Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:009774c0fd1cec5deafbf8a0597ec5effcc4d3f7195c2e03d603cdd28ef40f89","observation_id":"83edfb12-579f-4ddd-88d0-ca6c4ce8fc09","resolution":{"observed_at":"2026-08-06T18:21:57.580794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.00834","last_updated":"2021-01-29T13:44:14Z","snapshot_observed_at":"2026-08-06T01:31:35.376836Z","submitted_at":"2021-01-29T13:44:14Z","title":"Counterfactual Planning in AGI Systems","version":1},"cited_work":{"arxiv_id":"2102.00834","doi":null,"metadata_source":"pith","pith_arxiv_id":"2102.00834","snapshot_observed_at":"2026-08-06T18:21:52.702750Z","title":"Counterfactual Planning in AGI Systems","venue":"cs.AI","work_id":"06f7a7cf-436a-48fd-86e2-37a4e5f3fa32","year":2021},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:46.204560Z"},"links":{"cited_paper":"/paper/2102.00834","citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:53f6c9900a8f04b6f9e4f08bd400d8b54fb83b4bb698e364579dcfa852b46076","observation_id":"d0297501-576c-4a55-a56f-bc833b517f97","resolution":{"observed_at":"2026-08-06T18:21:52.762518Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:57.380410Z","title":null,"venue":null,"work_id":"3dfb063f-87d7-4aeb-a257-8a0f049655fc","year":2023},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:46.148386Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:960a379354e8340ac4d1736c16b936fdc2bdca49f9d083cd9779eddb11ecaa5a","observation_id":"e940cd0f-f53b-48dd-a6d8-1d92c029d8c9","resolution":{"observed_at":"2026-08-06T18:21:57.451996Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:57.303938Z","title":null,"venue":null,"work_id":"ba35a9a5-1df2-424c-846e-bc764575099f","year":2022},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:46.451657Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:1fe8c361032227f6b7b2d25872fcb0c6d90f4762097324e680b1ece25d95899a","observation_id":"8f4f3677-ad05-42a1-8f06-a4be3430292a","resolution":{"observed_at":"2026-08-06T18:21:57.333877Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:46.302352Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:46.302352Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:dcfd10e620142987c6927a557cda97c48f1a02e1ab96ecdb401985a6f4c7b762","observation_id":"f20074c7-b984-4847-b974-746f5a7e85e0","resolution":{"observed_at":"2026-08-06T18:21:46.302352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T18:21:46.733044Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:46.733044Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:348d41e08012a29f2405efb006b8b9e12e5aa6d3319f9a4fac2065751a849c37","observation_id":"47d31e5c-7e2e-47d6-b623-71397a896084","resolution":{"observed_at":"2026-08-06T18:21:46.733044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05608","last_updated":"2022-07-12T15:20:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-12T15:20:48Z","title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05608","snapshot_observed_at":"2026-08-06T18:21:46.601214Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:46.601214Z"},"links":{"cited_paper":"/paper/2207.05608","citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:8237e2e629f6180ff09716b3350f0e076dadab6fd237af67583b4693e107a884","observation_id":"42d5a748-a7af-4678-be46-52e92a024a12","resolution":{"observed_at":"2026-08-06T18:21:46.601214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T18:21:46.949417Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:46.949417Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:cfa23fd9bcf97d8e0625efcee10e82351ea053f0c435387bc7c97c785e95ec20","observation_id":"4538fcbd-2ec2-4ba8-94e9-b6a0e76935b6","resolution":{"observed_at":"2026-08-06T18:21:46.949417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:57.208154Z","title":null,"venue":null,"work_id":"f584f9c0-f52d-4496-b244-283f037a5f70","year":2023},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:46.828028Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:e83d64c65285bd585c60473c5ddbee0e78e5c52d9f30ecc7e1dfe07d7ea6ff23","observation_id":"3127d0da-76df-48bf-8f75-9da24455b3d3","resolution":{"observed_at":"2026-08-06T18:21:57.261240Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:57.135680Z","title":null,"venue":null,"work_id":"7ac31e76-cb37-4e9b-b846-375748d7c71f","year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:47.116830Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:8b879db29aeedc373ee4fb0155113cd5a0f52d9c4b97ff5137f264c9049edab9","observation_id":"a0a2da3e-07ac-4e11-b916-af72f7b19b3c","resolution":{"observed_at":"2026-08-06T18:21:57.168596Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-06T18:21:47.045449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:47.045449Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:87d973cf6a016ce283c8863fe078dff1781ff7e9cdcd58da7d4e91a9fe2ecfd6","observation_id":"e25e0201-3283-4438-9f8e-5f5121cef561","resolution":{"observed_at":"2026-08-06T18:21:47.045449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:47.284989Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:47.284989Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:37f3ba27df5e2c87c5616d83859ab9dc6305bbb2679b0acc1bdbedc7f1773b2f","observation_id":"50f8a404-a11d-4ed2-8c3d-a0ad1c2812ec","resolution":{"observed_at":"2026-08-06T18:21:47.284989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07575","last_updated":"2023-11-13T18:59:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-13T18:59:47Z","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07575","snapshot_observed_at":"2026-08-06T18:21:47.197177Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:47.197177Z"},"links":{"cited_paper":"/paper/2311.07575","citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:a619fea0f790ed88ff780de48c38ad692ebe0c9e4f278af52a46fbb9d0eaec00","observation_id":"768446ef-3ed2-4d7e-9d0c-19b60dcc2fbd","resolution":{"observed_at":"2026-08-06T18:21:47.197177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-06T18:21:47.469042Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:47.469042Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:ea27769df28d379ff2b2ea1126431fcacd34eec4ba4d7b3094e8987ac43c0160","observation_id":"255dc6f9-6f10-4c13-acb6-2b97f65a8b23","resolution":{"observed_at":"2026-08-06T18:21:47.469042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:57.003519Z","title":null,"venue":null,"work_id":"472f30b3-50d2-467a-9410-316e2f3e3acc","year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:47.394798Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:b59404654b7a1147f255dca239d0f46ec526b33892d8ffe18d5780c6ec604879","observation_id":"178569e0-a431-4cfa-912b-a902ac1d7649","resolution":{"observed_at":"2026-08-06T18:21:57.058628Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12583","last_updated":"2024-10-16T14:01:22Z","snapshot_observed_at":"2026-07-06T19:34:37.027078Z","submitted_at":"2024-10-16T14:01:22Z","title":"STRUX: An LLM for Decision-Making with Structured Explanations","version":1},"cited_work":{"arxiv_id":"2410.12583","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12583","snapshot_observed_at":"2026-08-06T18:21:52.437657Z","title":"STRUX: An LLM for Decision-Making with Structured Explanations","venue":"cs.CL","work_id":"aeaa31f8-48be-4c4e-b8ae-a0a3f9ae5b99","year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:47.634914Z"},"links":{"cited_paper":"/paper/2410.12583","citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:15f27d20972db9a39d2ac43bc393327564cd24e1b65d93adcf707b7ad2705848","observation_id":"3b0436a6-5740-4776-8d01-81b4ff07d57f","resolution":{"observed_at":"2026-08-06T18:21:52.513904Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:56.875024Z","title":null,"venue":null,"work_id":"e5f54c82-5d01-4bb2-ba1a-c74e43fd0483","year":2020},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:47.550941Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:366bb39fae2035fbf3b5a5cb1f3aa4bce0f2a58e3d81cc9872ecbb9b72055a63","observation_id":"f636e258-24da-4249-bf27-abc01c587ea6","resolution":{"observed_at":"2026-08-06T18:21:56.915471Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-06T18:21:47.820050Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:47.820050Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:278eaaa0cc97ba8fba41ab0d908b6b3e040bfeca8b30892f9e1fe6cfe8564495","observation_id":"382d78d9-c7aa-49df-baa3-9797b2cf1ffb","resolution":{"observed_at":"2026-08-06T18:21:47.820050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01795","last_updated":"2023-05-02T21:46:44Z","snapshot_observed_at":"2026-08-03T23:35:46.475935Z","submitted_at":"2023-05-02T21:46:44Z","title":"Multimodal Procedural Planning via Dual Text-Image Prompting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01795","snapshot_observed_at":"2026-08-06T18:21:47.730503Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:47.730503Z"},"links":{"cited_paper":"/paper/2305.01795","citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:ccd39b3b84acaec4625081bd1b497197c83c1e031307c1e9741f9520fd897c29","observation_id":"381d6a6b-ef6f-4752-9839-5cb1e98f4cf1","resolution":{"observed_at":"2026-08-06T18:21:47.730503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:56.683217Z","title":null,"venue":null,"work_id":"4229c9b8-1479-4d7d-acec-3fe8d1938a10","year":2023},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:47.972327Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:e62598f4cc99351322d3b165d495ffbf6496326710a5f1c0086d22c1e3efdfee","observation_id":"2b9446f8-4cdf-4d22-bfb3-39c3394bd966","resolution":{"observed_at":"2026-08-06T18:21:56.741272Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:56.778926Z","title":null,"venue":null,"work_id":"6fb955d7-189e-4fff-8201-4b4132e63d3c","year":2023},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:47.909243Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:860a27a18c947b8524e4ea9cb461e6c8cd42c52b8020b27cd1e7fc7c7f5231a9","observation_id":"ae7049a4-0ffb-4ff8-89b6-671b094941cb","resolution":{"observed_at":"2026-08-06T18:21:56.823219Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-06T18:21:48.130614Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:48.130614Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:40b8614c97c18608512ad18f0cac552493b1687bd1a0f8bbc72a53ae216d17f2","observation_id":"c81a00d7-54e0-4dfe-bd29-e0018b8af0b2","resolution":{"observed_at":"2026-08-06T18:21:48.130614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:56.594238Z","title":null,"venue":null,"work_id":"b5e1caec-5d76-455e-ad2b-f81c49859459","year":2018},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:48.029177Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:5a1d8ea2ebcb39c23978657ce78ea5e3e925b4942b4bdd1beb9385884ed85ce3","observation_id":"79fb74c5-9b67-477f-954a-6fe79b7b4987","resolution":{"observed_at":"2026-08-06T18:21:56.633666Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-06T18:21:48.303361Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:48.303361Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:e59bcb291c72710ef41b0261c8a446d62ab79663c8f4a47b6986dfae632fa72c","observation_id":"c7c1d50d-27bb-47d0-b34c-3eb5eec05941","resolution":{"observed_at":"2026-08-06T18:21:48.303361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10300","last_updated":"2024-06-01T03:35:22Z","snapshot_observed_at":"2026-08-05T08:31:40.101811Z","submitted_at":"2024-05-16T17:54:15Z","title":"Grounding DINO 1.5: Advance the \"Edge\" of Open-Set Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10300","snapshot_observed_at":"2026-08-06T18:21:48.217230Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:48.217230Z"},"links":{"cited_paper":"/paper/2405.10300","citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:c7fa86da8c60d7c90307efde8ce53d219e366f56506b8613e90849b5e8b1d1de","observation_id":"448d2f21-6508-4fab-beb8-07749773831c","resolution":{"observed_at":"2026-08-06T18:21:48.217230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:56.487947Z","title":null,"venue":null,"work_id":"236976e3-c26f-4f7f-9a94-99f54600c2ae","year":2019},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:48.461774Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:a5997e71373758c508c2a95526e5096cffa7f0253f78aaad2e39dac82c868410","observation_id":"f91df066-fb23-416f-80c7-7d6acc8eab16","resolution":{"observed_at":"2026-08-06T18:21:56.541918Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05766","last_updated":"2024-06-04T20:55:04Z","snapshot_observed_at":"2026-07-06T17:41:55.780727Z","submitted_at":"2024-03-09T02:27:45Z","title":"FLAP: Flow-Adhering Planning with Constrained Decoding in LLMs","version":3},"cited_work":{"arxiv_id":"2403.05766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05766","snapshot_observed_at":"2026-08-06T18:21:52.159012Z","title":"FLAP: Flow-Adhering Planning with Constrained Decoding in LLMs","venue":"cs.CL","work_id":"a8e8bd67-2186-4441-9b9f-073dde652d60","year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:48.407968Z"},"links":{"cited_paper":"/paper/2403.05766","citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:e3842f6f82e3d92da593927f5fe921b80cf5e4738a13039722bdb096f0a42f84","observation_id":"e44564d2-74e2-4c89-95df-10e4106c651a","resolution":{"observed_at":"2026-08-06T18:21:52.259006Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:56.154854Z","title":null,"venue":null,"work_id":"612dc861-6444-4cb7-bbb5-23355e37bd98","year":2020},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:48.635053Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:509deb80fad526e0b1e6eedebc2d0241782c0e8402b8634337879c612ea4a8f7","observation_id":"47629d3a-09a2-42bd-a089-217e4766fa49","resolution":{"observed_at":"2026-08-06T18:21:56.253166Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:56.341819Z","title":null,"venue":null,"work_id":"0e71b9a2-6cb4-4143-9eb1-ba3b1be75da1","year":2023},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:48.538941Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:b35e70595fb1bed389c1dee50edaebefa9f38c81989e3238fa4b55a7cd6f6fc7","observation_id":"960cce1a-f8dc-4ab0-97e4-5e297f4d71fd","resolution":{"observed_at":"2026-08-06T18:21:56.409140Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:55.802727Z","title":null,"venue":null,"work_id":"793716fe-86df-4741-9395-1090e83ed963","year":2022},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:48.790985Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:cbbe1d5a24f5a8df32cecb194a6a46168e20641cfbe29739e87bffb5916e8d62","observation_id":"2880b169-72af-4688-9d65-b89db8b0448a","resolution":{"observed_at":"2026-08-06T18:21:55.897345Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:55.982685Z","title":null,"venue":null,"work_id":"828141e1-f197-4702-8019-fe145ac6db00","year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:48.692673Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:85d9c709c863284acc4f615d3b11375a9b7112dc034872e4ec7ff53df34779ad","observation_id":"2e03fc59-f774-418d-adb2-511a521d5dc6","resolution":{"observed_at":"2026-08-06T18:21:56.088891Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:55.666748Z","title":null,"venue":null,"work_id":"5df6f148-3512-4af3-a047-37b89431e65c","year":2021},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:48.978102Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:5d7ae1248e23358157d332b803b90decde65fa7935ec2a246668b3332979b9af","observation_id":"15f1b08c-cfdb-41f7-aa7b-a9d2ab420388","resolution":{"observed_at":"2026-08-06T18:21:55.738252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:48.881030Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:48.881030Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:47679c77cdd351c7a21926c1d1b48bddd47f9f2d30e1840bcbdc67ba545247e5","observation_id":"d244ec0f-50a4-45b1-8273-29df7bdc7a30","resolution":{"observed_at":"2026-08-06T18:21:48.881030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03907","last_updated":"2024-10-04T20:21:40Z","snapshot_observed_at":"2026-08-01T04:13:45.801059Z","submitted_at":"2024-10-04T20:21:40Z","title":"ActPlan-1K: Benchmarking the Procedural Planning Ability of Visual Language Models in Household Activities","version":1},"cited_work":{"arxiv_id":"2410.03907","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.03907","snapshot_observed_at":"2026-08-06T18:21:51.989097Z","title":"ActPlan-1K: Benchmarking the Procedural Planning Ability of Visual Language Models in Household Activities","venue":"cs.CL","work_id":"1b390448-ab3e-4555-aaea-7dd1316526c3","year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:49.202777Z"},"links":{"cited_paper":"/paper/2410.03907","citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:f5204c555639ad71a568eab68b9f0fe02cfd65ae1bb513fd753eed6e02879186","observation_id":"16015d9b-6303-4576-b813-2f6613b30d82","resolution":{"observed_at":"2026-08-06T18:21:52.068349Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:55.510888Z","title":null,"venue":null,"work_id":"8ea9d3ae-13c8-4480-bcfe-fcc545602ae0","year":2022},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:49.091212Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:bc76e0d4aa4c152604d940cf9a0b88665b02cf908e77219a8bc296ab00c6f200","observation_id":"5708d831-5d80-48f4-be54-22e78eb60cdf","resolution":{"observed_at":"2026-08-06T18:21:55.585682Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:49.401390Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:49.401390Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:f83026c8a8fc740da118b9a3131414b9246cbc8e5c162f9f856e8f7b998fba15","observation_id":"042b9872-1e5b-478e-a056-683d8f24b51a","resolution":{"observed_at":"2026-08-06T18:21:49.401390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T18:21:49.285266Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:49.285266Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:27e80b139b82c37a695cea94db0e5f4a21af9d1949e1d1843e90e4038dd0ca4d","observation_id":"10aded97-1fa7-4530-b7d3-be0d6110d617","resolution":{"observed_at":"2026-08-06T18:21:49.285266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T18:21:49.626937Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:49.626937Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:d74e33dcb56844083ef5e0519d3d2b7bbe830eb49df5823a1c0c613a670d4928","observation_id":"a3738f7c-9caa-4790-a277-b8df595ff2c7","resolution":{"observed_at":"2026-08-06T18:21:49.626937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03256","last_updated":"2024-09-29T06:00:09Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T05:22:27Z","title":"E2CL: Exploration-based Error Correction Learning for Embodied Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03256","snapshot_observed_at":"2026-08-06T18:21:49.504791Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:49.504791Z"},"links":{"cited_paper":"/paper/2409.03256","citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:5fee2a5e10a8e198e766cb991aed846c720b8bdb5de1d145e73a2bf0b7852c0c","observation_id":"d19622c4-52c5-4e47-a46f-90c9700d1814","resolution":{"observed_at":"2026-08-06T18:21:49.504791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:55.072849Z","title":null,"venue":null,"work_id":"449c7a10-1723-458e-bde9-cae1ee25ad04","year":2021},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:49.785253Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:05a75b5016cb9510688c9c1a788618a5dd37a771130d6043a9f2394f66a20ceb","observation_id":"ee959a1b-8557-4843-b50c-3f50782e9263","resolution":{"observed_at":"2026-08-06T18:21:55.189047Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:55.326271Z","title":null,"venue":null,"work_id":"943aa937-04a9-44df-9513-fcd909004606","year":2023},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:49.705965Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:ff51d39a5f9536006d1ab7b3ab86f2a90ba250c47b4c78ee5cfc2e2634a5cb51","observation_id":"4f03097b-8baa-45e1-842d-fb384cbc7f57","resolution":{"observed_at":"2026-08-06T18:21:55.411122Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-06T18:21:49.974992Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:49.974992Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:3086bfa3c121ff1aba02678376e30b354a14150f368b66c17c211cb514773a22","observation_id":"a59b773e-e5ad-47c4-999d-0009ac114356","resolution":{"observed_at":"2026-08-06T18:21:49.974992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:49.892524Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:49.892524Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:5be222f5567c732b95807577733933bbdca534c33ab0dc7db32488f73658c538","observation_id":"52418382-3195-49f7-9433-ef79cc2ea618","resolution":{"observed_at":"2026-08-06T18:21:49.892524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:50.171609Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:50.171609Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:89a138ad9b1c064cc9cb5f15b43112c296ef95262daee49ce25685ee35e03661","observation_id":"fa73e92c-6378-4804-8a69-1145a5b1c8a4","resolution":{"observed_at":"2026-08-06T18:21:50.171609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:54.109337Z","title":null,"venue":null,"work_id":"35e05cce-f4c6-41f7-871c-3a52bb15e939","year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:50.064837Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:9ecc2b559bb82ea5918d6a9f9360977d148d07fbf29834fee3765b50aa3d5768","observation_id":"283b3559-40a3-4893-a2ab-0261073de399","resolution":{"observed_at":"2026-08-06T18:21:54.638034Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01493","last_updated":"2025-06-25T13:27:10Z","snapshot_observed_at":"2026-07-06T20:00:14.194746Z","submitted_at":"2024-12-02T13:44:53Z","title":"Learning Adaptive Lighting via Channel-Aware Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01493","snapshot_observed_at":"2026-08-06T18:21:50.498420Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:50.498420Z"},"links":{"cited_paper":"/paper/2412.01493","citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:2b63eb1d3ec3f76087aa5ddb5c4b4146844c843a29fd229cce5887a473ed6f75","observation_id":"4f323420-6eec-404f-9541-3ad9f404edb1","resolution":{"observed_at":"2026-08-06T18:21:50.498420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:53.848479Z","title":null,"venue":null,"work_id":"528729a7-9618-4ae3-93e7-4e1bb889b809","year":null},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:50.282178Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:2809932b3d5601e73055ce8aa9fcc08f1629b472a73293fac5c2ade8a8389cef","observation_id":"15e53f39-d6cf-4161-9149-abdeca3212b5","resolution":{"observed_at":"2026-08-06T18:21:53.976808Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:50.713158Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:50.713158Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:87bea92b7231074e2164217397c038f27b6351e04dca9b67d1c7d95be8013578","observation_id":"7282c70b-c68e-4089-ab2f-cdcb5c69e3a2","resolution":{"observed_at":"2026-08-06T18:21:50.713158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13601","last_updated":"2024-05-28T05:36:23Z","snapshot_observed_at":"2026-07-06T17:20:00.101661Z","submitted_at":"2024-01-24T17:10:45Z","title":"MM-LLMs: Recent Advances in MultiModal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13601","snapshot_observed_at":"2026-08-06T18:21:50.798439Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:50.798439Z"},"links":{"cited_paper":"/paper/2401.13601","citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:79fac57b68375070de5c7d6af3b5393d61eecf301c391c03aeccbb37e52e12f7","observation_id":"beacfd96-9a84-4420-b15a-2568e4b055d1","resolution":{"observed_at":"2026-08-06T18:21:50.798439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.15756","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:51.683918Z","title":null,"venue":null,"work_id":"39fbc4fa-611a-4cb3-9b55-8b6fdbdaf1b0","year":2025},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:50.585216Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:6df9981add824cf4ad372349deda04710b70506b5389b52aeab88a88165fa29f","observation_id":"58767394-874b-4238-a71c-6030e8db97ad","resolution":{"observed_at":"2026-08-06T18:21:51.770078Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:53.407525Z","title":null,"venue":null,"work_id":"0e4b6697-54ee-49d4-abba-18cab55c868f","year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:51.032096Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:b73161391147e224b4acbce4290a2a63f3d0d3ba4857590d7df455992d63b68b","observation_id":"6574e7e6-688b-47f5-8cb7-ff6328bc68aa","resolution":{"observed_at":"2026-08-06T18:21:53.507027Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:53.158737Z","title":null,"venue":null,"work_id":"181327a1-2afd-4323-8cb2-e07bcb1cda75","year":2025},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:51.122714Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:ceea8309d3830e4e57ebc4935ff2746631424b0146b6f21daff4729504d87cb4","observation_id":"a72647bb-ce11-47e9-aadf-69851487f872","resolution":{"observed_at":"2026-08-06T18:21:53.259183Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05047","last_updated":"2024-10-07T14:05:05Z","snapshot_observed_at":"2026-07-06T18:42:22.322763Z","submitted_at":"2024-07-06T11:07:18Z","title":"MFE-ETP: A Comprehensive Evaluation Benchmark for Multi-modal Foundation Models on Embodied Task Planning","version":3},"cited_work":{"arxiv_id":"2407.05047","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.05047","snapshot_observed_at":"2026-08-06T18:21:51.394587Z","title":"MFE-ETP: A Comprehensive Evaluation Benchmark for Multi-modal Foundation Models on Embodied Task Planning","venue":"cs.AI","work_id":"360a3059-d653-44f8-b358-9d20b27f9bba","year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:50.906222Z"},"links":{"cited_paper":"/paper/2407.05047","citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:224b70b25b87501e140eeefdafe12da73ed94db18ac4b5e0743f7933c0973fce","observation_id":"abfef92a-a834-42a1-8574-f0094014b7cb","resolution":{"observed_at":"2026-08-06T18:21:51.459545Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:52.961181Z","title":null,"venue":null,"work_id":"f6f53e90-ac33-485c-9eca-c74aff1f3888","year":2023},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:51.244696Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:1ba67b63869e014854fdc84cfd14232cf2b9c20ee4d99979528c44093a23f477","observation_id":"35108cd2-4e3b-4608-8caf-14862978782f","resolution":{"observed_at":"2026-08-06T18:21:53.064953Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:58.510578Z","title":null,"venue":null,"work_id":"b82bff93-7fbb-480e-b596-a7c6ec48ff02","year":null},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:45.301234Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:8ef53b1211302db64a1a09ceec4491c8f545f448b48df54584bc9feb1fd93ea1","observation_id":"41be7759-a05b-4a56-84d4-dc7e4071ecfa","resolution":{"observed_at":"2026-08-06T18:21:58.583649Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:53.592408Z","title":"IEEE Transactions on Image Processing (2025)","venue":null,"work_id":"a8ad9229-86e0-47e7-b85b-c4c9fa03185e","year":2025},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:50.402373Z"},"links":{"citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:b3389d8021a506260a102626e42dc0ba8d3bb7825cffa35cf244be1399fd42b4","observation_id":"394c7b69-d444-49de-8e49-57c028e12b0b","resolution":{"observed_at":"2026-08-06T18:21:53.744140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T18:14:37.908727Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":64,"verified_exact":6,"verified_fuzzy":2},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 0 inbound Pith citation observations for arXiv:2507.08496."}