{"as_of":"2026-08-08T02:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e6ece8076e6b20111d22a8d074922447baa117705c642ed5ff89536d4a5321ff","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:14:29.482855Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.11380/citation-record","integrity":"/paper/2506.11380/integrity","json":"/paper/2506.11380/citation-record.json","paper":"/paper/2506.11380"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:14:30.462875Z","title":null,"venue":null,"work_id":"6c15164d-17ed-4c39-b87c-abf743bf7863","year":null},"citing_paper":{"arxiv_id":"2506.11380","last_updated":"2025-06-13T01:03:29Z","snapshot_observed_at":"2026-08-08T00:28:18.847167Z","submitted_at":"2025-06-13T01:03:29Z","title":"Enhance Multimodal Consistency and Coherence for Text-Image Plan Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:14:29.011158Z"},"links":{"citing_paper":"/paper/2506.11380"},"observation_digest":"sha256:7426a9345d25a61eb8949db19219318829f5d1c297aabd4b8e47aeb9eac15677","observation_id":"8bf112e4-dc4c-453b-8352-2d8b5b85dced","resolution":{"observed_at":"2026-08-07T04:14:30.500766Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11477","last_updated":"2023-09-27T07:29:44Z","snapshot_observed_at":"2026-08-01T15:58:01.346044Z","submitted_at":"2023-04-22T20:34:03Z","title":"LLM+P: Empowering Large Language Models with Optimal Planning Proficiency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11477","snapshot_observed_at":"2026-08-07T04:14:28.867443Z","title":"Yujie Lu, Pan Lu, Zhiyu Chen, Wanrong Zhu, Xin Eric Wang, and William Yang Wang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11380","last_updated":"2025-06-13T01:03:29Z","snapshot_observed_at":"2026-08-08T00:28:18.847167Z","submitted_at":"2025-06-13T01:03:29Z","title":"Enhance Multimodal Consistency and Coherence for Text-Image Plan Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:14:28.867443Z"},"links":{"cited_paper":"/paper/2304.11477","citing_paper":"/paper/2506.11380"},"observation_digest":"sha256:b0be5e1048fd926f0fa26145680b296696303e3233e8db31e4eb879313197dba","observation_id":"e609a620-eb69-4781-b6fc-ba4c1f745fb6","resolution":{"observed_at":"2026-08-07T04:14:28.867443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:14:30.299730Z","title":null,"venue":null,"work_id":"4f8c4b9a-8bf2-4f64-815a-758cfb7e9a73","year":null},"citing_paper":{"arxiv_id":"2506.11380","last_updated":"2025-06-13T01:03:29Z","snapshot_observed_at":"2026-08-08T00:28:18.847167Z","submitted_at":"2025-06-13T01:03:29Z","title":"Enhance Multimodal Consistency and Coherence for Text-Image Plan Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:14:29.106652Z"},"links":{"citing_paper":"/paper/2506.11380"},"observation_digest":"sha256:8b2c46ff0b4b7631574dfa86b88f375ad50485dd0f28e8cb6970d6b6c931dcab","observation_id":"66bc283c-1e62-4a2d-920b-c5d976a44efc","resolution":{"observed_at":"2026-08-07T04:14:30.332972Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T04:14:28.955153Z","title":"make an origami pinwheel","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11380","last_updated":"2025-06-13T01:03:29Z","snapshot_observed_at":"2026-08-08T00:28:18.847167Z","submitted_at":"2025-06-13T01:03:29Z","title":"Enhance Multimodal Consistency and Coherence for Text-Image Plan Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:14:28.955153Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.11380"},"observation_digest":"sha256:4e7b7f8d7a6b63d9e3afe5d85aa485efa7a26f511caf4e3db29e723ac771f342","observation_id":"321b4cd2-42c1-439b-a103-54ddd6c14e09","resolution":{"observed_at":"2026-08-07T04:14:28.955153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:14:30.372834Z","title":null,"venue":null,"work_id":"f4147324-0de0-4932-9d99-639cf340b665","year":null},"citing_paper":{"arxiv_id":"2506.11380","last_updated":"2025-06-13T01:03:29Z","snapshot_observed_at":"2026-08-08T00:28:18.847167Z","submitted_at":"2025-06-13T01:03:29Z","title":"Enhance Multimodal Consistency and Coherence for Text-Image Plan Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:14:29.058811Z"},"links":{"citing_paper":"/paper/2506.11380"},"observation_digest":"sha256:99ce6ed9a5f2cc48b9d1f1a3e992d88932cf673fec567344d6b909d024f43e3c","observation_id":"06fdeab4-66da-4dd4-b4dd-9b766fa1cee8","resolution":{"observed_at":"2026-08-07T04:14:30.408760Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:14:30.214150Z","title":"Let’s improve a step toGwith visual information","venue":null,"work_id":"b8713dc9-288d-402b-99f2-2d3fa6369a40","year":null},"citing_paper":{"arxiv_id":"2506.11380","last_updated":"2025-06-13T01:03:29Z","snapshot_observed_at":"2026-08-08T00:28:18.847167Z","submitted_at":"2025-06-13T01:03:29Z","title":"Enhance Multimodal Consistency and Coherence for Text-Image Plan Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:14:29.150192Z"},"links":{"citing_paper":"/paper/2506.11380"},"observation_digest":"sha256:049f40fe75327477643b02218bd5f09d66f1bae601537271ea3d52598a70aa3d","observation_id":"712feb65-3b2e-4312-9fd6-b0966e665e53","resolution":{"observed_at":"2026-08-07T04:14:30.250877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:14:30.099845Z","title":null,"venue":null,"work_id":"2e11833d-81b3-448f-9a3c-34e6c2cdb372","year":null},"citing_paper":{"arxiv_id":"2506.11380","last_updated":"2025-06-13T01:03:29Z","snapshot_observed_at":"2026-08-08T00:28:18.847167Z","submitted_at":"2025-06-13T01:03:29Z","title":"Enhance Multimodal Consistency and Coherence for Text-Image Plan Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:14:29.200602Z"},"links":{"citing_paper":"/paper/2506.11380"},"observation_digest":"sha256:04af17162307b166055c3bcc5475602b76042c310be20934f21842702d5f4749","observation_id":"a05a9ca8-2151-4fd8-9381-5f379e8da042","resolution":{"observed_at":"2026-08-07T04:14:30.153594Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:14:30.019153Z","title":null,"venue":null,"work_id":"fd942e00-e330-4e11-80f9-ef226cade0c4","year":null},"citing_paper":{"arxiv_id":"2506.11380","last_updated":"2025-06-13T01:03:29Z","snapshot_observed_at":"2026-08-08T00:28:18.847167Z","submitted_at":"2025-06-13T01:03:29Z","title":"Enhance Multimodal Consistency and Coherence for Text-Image Plan Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:14:29.243794Z"},"links":{"citing_paper":"/paper/2506.11380"},"observation_digest":"sha256:79c669ec09da615d24253d3fcae6db68ff583936f4fb5baa4d3377f50bec58e5","observation_id":"77a8981f-afc0-449a-9d31-6e5ea9f32dbd","resolution":{"observed_at":"2026-08-07T04:14:30.057830Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:14:29.930296Z","title":"Tie” for “Textual Quality","venue":null,"work_id":"9060cff6-451a-419d-aa31-c9c0cd538744","year":2022},"citing_paper":{"arxiv_id":"2506.11380","last_updated":"2025-06-13T01:03:29Z","snapshot_observed_at":"2026-08-08T00:28:18.847167Z","submitted_at":"2025-06-13T01:03:29Z","title":"Enhance Multimodal Consistency and Coherence for Text-Image Plan Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:14:29.290892Z"},"links":{"citing_paper":"/paper/2506.11380"},"observation_digest":"sha256:9b8d5ea8490b5cc27d5ca934a1ffe8b20c7a7c17e54262e2171eddbf0220c808","observation_id":"de4054d2-4b13-4090-a2bb-7f310d10c171","resolution":{"observed_at":"2026-08-07T04:14:29.957433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:14:29.843919Z","title":null,"venue":null,"work_id":"0df746b0-8ed0-4fb6-a87f-d29eee8d555e","year":null},"citing_paper":{"arxiv_id":"2506.11380","last_updated":"2025-06-13T01:03:29Z","snapshot_observed_at":"2026-08-08T00:28:18.847167Z","submitted_at":"2025-06-13T01:03:29Z","title":"Enhance Multimodal Consistency and Coherence for Text-Image Plan Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:14:29.344193Z"},"links":{"citing_paper":"/paper/2506.11380"},"observation_digest":"sha256:451518b562ff2146ec5ff06ccbd6f23505286e137c174d83ae829dfcd4564ba1","observation_id":"97f39116-2264-4adb-9b17-92084d95a3c1","resolution":{"observed_at":"2026-08-07T04:14:29.879480Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:14:29.758317Z","title":null,"venue":null,"work_id":"c2b76c22-6ea9-4cf1-8697-56740dd680ad","year":null},"citing_paper":{"arxiv_id":"2506.11380","last_updated":"2025-06-13T01:03:29Z","snapshot_observed_at":"2026-08-08T00:28:18.847167Z","submitted_at":"2025-06-13T01:03:29Z","title":"Enhance Multimodal Consistency and Coherence for Text-Image Plan Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:14:29.396630Z"},"links":{"citing_paper":"/paper/2506.11380"},"observation_digest":"sha256:9907dcfd2b5429a6b0722c1569623f91482b0cc7224d523a21878100f245e91e","observation_id":"52783f23-e09a-4689-be77-670abb294039","resolution":{"observed_at":"2026-08-07T04:14:29.798378Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:14:29.669740Z","title":null,"venue":null,"work_id":"4bab596a-3461-4789-b9a3-2379a8d9a8fd","year":null},"citing_paper":{"arxiv_id":"2506.11380","last_updated":"2025-06-13T01:03:29Z","snapshot_observed_at":"2026-08-08T00:28:18.847167Z","submitted_at":"2025-06-13T01:03:29Z","title":"Enhance Multimodal Consistency and Coherence for Text-Image Plan Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:14:29.437039Z"},"links":{"citing_paper":"/paper/2506.11380"},"observation_digest":"sha256:4835a0128651a7b4048f6acbc1f6522b23f4a7da3fb29f129c9ededc7da0d14d","observation_id":"06bc4e8b-cb5f-4fe8-a427-3d13067a0b17","resolution":{"observed_at":"2026-08-07T04:14:29.711568Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:14:29.597479Z","title":null,"venue":null,"work_id":"168365e9-e3f9-4733-ab52-eed8e6cfb740","year":null},"citing_paper":{"arxiv_id":"2506.11380","last_updated":"2025-06-13T01:03:29Z","snapshot_observed_at":"2026-08-08T00:28:18.847167Z","submitted_at":"2025-06-13T01:03:29Z","title":"Enhance Multimodal Consistency and Coherence for Text-Image Plan Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:14:29.482855Z"},"links":{"citing_paper":"/paper/2506.11380"},"observation_digest":"sha256:54b2deb42ec72b54f301df032910175e62a721a1089ffc4e49605e1593f8f218","observation_id":"6f0d2a26-9721-4c60-a1a0-4ab35859dfc3","resolution":{"observed_at":"2026-08-07T04:14:29.630085Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09800","last_updated":"2023-01-18T17:31:52Z","snapshot_observed_at":"2026-08-06T07:25:23.651829Z","submitted_at":"2022-11-17T18:58:43Z","title":"InstructPix2Pix: Learning to Follow Image Editing Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09800","snapshot_observed_at":"2026-08-07T04:14:28.819047Z","title":null,"venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.11380","last_updated":"2025-06-13T01:03:29Z","snapshot_observed_at":"2026-08-08T00:28:18.847167Z","submitted_at":"2025-06-13T01:03:29Z","title":"Enhance Multimodal Consistency and Coherence for Text-Image Plan Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T04:14:28.819047Z"},"links":{"cited_paper":"/paper/2211.09800","citing_paper":"/paper/2506.11380"},"observation_digest":"sha256:ccbff6aaf5ab22dff7ea355ca65c0e01f392e69a6334593217e486c328198614","observation_id":"baed8f9a-6e54-423d-8192-56728cce2a6f","resolution":{"observed_at":"2026-08-07T04:14:28.819047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04088","last_updated":"2023-03-30T04:50:44Z","snapshot_observed_at":"2026-07-06T14:28:09.770851Z","submitted_at":"2022-12-08T05:46:32Z","title":"LLM-Planner: Few-Shot Grounded Planning for Embodied Agents with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04088","snapshot_observed_at":"2026-08-07T04:14:28.908967Z","title":"InProceedings of the AAAI Conference on Artificial Intelligence, volume 38, pages 20256–20264","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11380","last_updated":"2025-06-13T01:03:29Z","snapshot_observed_at":"2026-08-08T00:28:18.847167Z","submitted_at":"2025-06-13T01:03:29Z","title":"Enhance Multimodal Consistency and Coherence for Text-Image Plan Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T04:14:28.908967Z"},"links":{"cited_paper":"/paper/2212.04088","citing_paper":"/paper/2506.11380"},"observation_digest":"sha256:1db70db671133b6d1246870f6f03a2aa68b5f9a277468adda33bfbe9b2f92daa","observation_id":"b11bbddd-215b-449a-951e-b61d403315af","resolution":{"observed_at":"2026-08-07T04:14:28.908967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.11380","last_updated":"2025-06-13T01:03:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T00:28:18.847167Z","submitted_at":"2025-06-13T01:03:29Z","title":"Enhance Multimodal Consistency and Coherence for Text-Image Plan Generation"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 0 inbound Pith citation observations for arXiv:2506.11380."}