{"as_of":"2026-08-10T05:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:04c6786aa43593053f257e4c6f4999c4ac77f79498925bad80b5395e16da436b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":5,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":5,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T15:01:38.393426Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T08:13:14.633660Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.14320","last_updated":"2023-09-25T17:45:31Z","snapshot_observed_at":"2026-08-09T18:28:42.728459Z","submitted_at":"2023-09-25T17:45:31Z","title":"MUTEX: Learning Unified Policies from Multimodal Task Specifications","version":1},"cited_work":{"arxiv_id":"2309.14320","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.14320","snapshot_observed_at":"2026-06-29T08:13:14.633660Z","title":"arXiv preprint arXiv:2309.14320 , year=","venue":null,"work_id":"855f2fc9-3cf8-476a-a4f6-cf6f0ec55349","year":2023},"citing_paper":{"arxiv_id":"2401.03568","last_updated":"2024-01-25T21:20:27Z","snapshot_observed_at":"2026-07-30T06:39:40.880794Z","submitted_at":"2024-01-07T19:11:18Z","title":"Agent AI: Surveying the Horizons of Multimodal Interaction","version":2},"reference_index":133,"source":"arxiv_source","source_observed_at":"2026-05-18T14:25:58.876978Z"},"links":{"cited_paper":"/paper/2309.14320","citing_paper":"/paper/2401.03568"},"observation_digest":"sha256:4989d5170ac0ca660c93fce9f458b64eda4595e707d2d2d513066cb29a7b3468","observation_id":"268623c9-800f-4a71-bfb0-6b09ad209d51","resolution":{"observed_at":"2026-05-18T14:25:59.407241Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14320","last_updated":"2023-09-25T17:45:31Z","snapshot_observed_at":"2026-08-09T18:28:42.728459Z","submitted_at":"2023-09-25T17:45:31Z","title":"MUTEX: Learning Unified Policies from Multimodal Task Specifications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14320","snapshot_observed_at":"2026-08-08T15:01:38.393426Z","title":"Mutex: Learning uni- fied policies from multimodal task specifications,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06583","last_updated":"2025-02-10T15:50:26Z","snapshot_observed_at":"2026-08-08T14:55:18.557727Z","submitted_at":"2025-02-10T15:50:26Z","title":"Adaptive Perception for Unified Visual Multi-modal Object Tracking","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T15:01:38.393426Z"},"links":{"cited_paper":"/paper/2309.14320","citing_paper":"/paper/2502.06583"},"observation_digest":"sha256:acddc198466ba5af0f3585ecaf654c58d86601b96992920657a07eb6ac291827","observation_id":"a63fec7a-da80-4305-abd7-d572bb5a9d0d","resolution":{"observed_at":"2026-08-08T15:01:38.393426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14320","last_updated":"2023-09-25T17:45:31Z","snapshot_observed_at":"2026-08-09T18:28:42.728459Z","submitted_at":"2023-09-25T17:45:31Z","title":"MUTEX: Learning Unified Policies from Multimodal Task Specifications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14320","snapshot_observed_at":"2026-08-06T22:53:19.742757Z","title":"MUTEX: Learning Unified Policies from Multimodal Task Specifications,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20373","last_updated":"2025-06-25T12:36:49Z","snapshot_observed_at":"2026-08-09T16:44:03.327727Z","submitted_at":"2025-06-25T12:36:49Z","title":"CARMA: Context-Aware Situational Grounding of Human-Robot Group Interactions by Combining Vision-Language Models with Object and Action Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:19.742757Z"},"links":{"cited_paper":"/paper/2309.14320","citing_paper":"/paper/2506.20373"},"observation_digest":"sha256:d8d8a8049597035a2bdda46a4605d509bac373dede44ca1f177e30aa5769b260","observation_id":"a67e63f2-50c3-4244-b6a0-ffe57fa8d91f","resolution":{"observed_at":"2026-08-06T22:53:19.742757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14320","last_updated":"2023-09-25T17:45:31Z","snapshot_observed_at":"2026-08-09T18:28:42.728459Z","submitted_at":"2023-09-25T17:45:31Z","title":"MUTEX: Learning Unified Policies from Multimodal Task Specifications","version":1},"cited_work":{"arxiv_id":"2309.14320","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.14320","snapshot_observed_at":"2026-06-29T08:13:14.633660Z","title":"arXiv preprint arXiv:2309.14320 , year=","venue":null,"work_id":"855f2fc9-3cf8-476a-a4f6-cf6f0ec55349","year":2023},"citing_paper":{"arxiv_id":"2605.13403","last_updated":"2026-05-13T11:58:02Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T11:58:02Z","title":"RotVLA: Rotational Latent Action for Vision-Language-Action Model","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-14T17:48:06.734816Z"},"links":{"cited_paper":"/paper/2309.14320","citing_paper":"/paper/2605.13403"},"observation_digest":"sha256:5ea0a4ab5644fe6fc4026865ff77042612d280a18d4d5c5bbfde9e424e557aa5","observation_id":"2b7b8524-d70a-4a48-a3d3-5bf4ee6a3056","resolution":{"observed_at":"2026-05-14T17:49:23.054060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14320","last_updated":"2023-09-25T17:45:31Z","snapshot_observed_at":"2026-08-09T18:28:42.728459Z","submitted_at":"2023-09-25T17:45:31Z","title":"MUTEX: Learning Unified Policies from Multimodal Task Specifications","version":1},"cited_work":{"arxiv_id":"2309.14320","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.14320","snapshot_observed_at":"2026-06-29T08:13:14.633660Z","title":"arXiv preprint arXiv:2309.14320 , year=","venue":null,"work_id":"855f2fc9-3cf8-476a-a4f6-cf6f0ec55349","year":2023},"citing_paper":{"arxiv_id":"2605.30011","last_updated":"2026-05-28T14:36:53Z","snapshot_observed_at":"2026-07-06T23:39:20.085961Z","submitted_at":"2026-05-28T14:36:53Z","title":"VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-29T08:12:24.023638Z"},"links":{"cited_paper":"/paper/2309.14320","citing_paper":"/paper/2605.30011"},"observation_digest":"sha256:b0333724db30e9212410c0c9740b698d565db95a2f01b26afcaea50f1bf4ed0f","observation_id":"10114916-1580-4ca7-95f4-2556eeccf972","resolution":{"observed_at":"2026-06-29T08:13:14.635232Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2309.14320/citation-record","integrity":"/paper/2309.14320/integrity","json":"/paper/2309.14320/citation-record.json","paper":"/paper/2309.14320"},"outbound":[],"paper":{"arxiv_id":"2309.14320","last_updated":"2023-09-25T17:45:31Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-09T18:28:42.728459Z","submitted_at":"2023-09-25T17:45:31Z","title":"MUTEX: Learning Unified Policies from Multimodal Task Specifications"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 5 inbound Pith citation observations for arXiv:2309.14320."}