{"as_of":"2026-08-07T22:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:43b8e6baba1aa84c4a7029aff86edfc5d32dd89bd852b08afc8cc55e44f924a8","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:08:09.248749Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T07:34:22.143661Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-07-06T19:09:14.628371Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-08-07T14:08:09.248749Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-07T13:56:53.335109Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:09.248749Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:fac9df427bc8d5a2d634569db69517535b6ed92f18adf40cc57648affeab3334","observation_id":"52f69615-1a5e-44bc-b7fc-b0b73babfd78","resolution":{"observed_at":"2026-08-07T14:08:09.248749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-07-06T19:09:14.628371Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-08-07T05:04:38.599960Z","title":"Tempme: Video temporal token merging for efficient text-video re- trieval.arXiv preprint arXiv:2409.01156, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-07T04:57:03.654241Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.599960Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:42f559a46644d05608c3b91dab1aa7f1f3c4001ef17baa28329ba772827883f7","observation_id":"20943e42-6839-4b62-ad48-600cbe32f003","resolution":{"observed_at":"2026-08-07T05:04:38.599960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-07-06T19:09:14.628371Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-08-06T22:24:31.751666Z","title":"Tempme: Video temporal token merging for efficient text-video retrieval.arXiv preprint arXiv:2409.01156, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21862","last_updated":"2025-06-27T02:29:58Z","snapshot_observed_at":"2026-08-07T08:24:31.697101Z","submitted_at":"2025-06-27T02:29:58Z","title":"LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T22:24:31.751666Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2506.21862"},"observation_digest":"sha256:baf80a75cfa04f518ff903a3d185973634bd6958190959f99387ee6d235829a0","observation_id":"c1ba48df-e473-4e59-bdf4-1306f72d7a79","resolution":{"observed_at":"2026-08-06T22:24:31.751666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-07-06T19:09:14.628371Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":"2409.01156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-06-30T07:34:22.143661Z","title":"Tempme: Video temporal token merging for efficient text- video retrieval","venue":null,"work_id":"e3e84514-69ce-4dba-a047-ffcc35ffb615","year":2024},"citing_paper":{"arxiv_id":"2509.02560","last_updated":"2025-11-09T15:12:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-02T17:54:21Z","title":"FastVGGT: Training-Free Acceleration of Visual Geometry Transformer","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T23:36:06.870759Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2509.02560"},"observation_digest":"sha256:7ec48d822490c01ab6d38d55248482910b6f2b812957564d382b016d1714606a","observation_id":"86d26e7a-4e49-4ef1-8d1a-ee965f131884","resolution":{"observed_at":"2026-05-15T23:36:06.973826Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-07-06T19:09:14.628371Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-08-04T10:22:45.895680Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10180","last_updated":"2026-07-01T15:54:56Z","snapshot_observed_at":"2026-08-06T13:55:50.316117Z","submitted_at":"2025-10-11T11:38:01Z","title":"TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T10:22:45.895680Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2510.10180"},"observation_digest":"sha256:f381cd6545b311d6fac4f90b5bebc46105b8cd706c9b05e3e4914d42600c6efe","observation_id":"7ed984dd-c281-4f1b-bf8f-54d493bc3784","resolution":{"observed_at":"2026-08-04T10:22:45.895680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-07-06T19:09:14.628371Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":"2409.01156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-06-30T07:34:22.143661Z","title":"Tempme: Video temporal token merging for efficient text- video retrieval","venue":null,"work_id":"e3e84514-69ce-4dba-a047-ffcc35ffb615","year":2024},"citing_paper":{"arxiv_id":"2602.20913","last_updated":"2026-04-15T16:09:22Z","snapshot_observed_at":"2026-08-02T12:38:41.181077Z","submitted_at":"2026-02-24T13:49:47Z","title":"LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T20:01:31.129959Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2602.20913"},"observation_digest":"sha256:70e0b1e1d3b303e943eda530478b0759a16a3d1106d543143f3417d637bbd282","observation_id":"98511968-0902-473b-a2c6-0aeff1f6d256","resolution":{"observed_at":"2026-05-15T20:01:33.518670Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-07-06T19:09:14.628371Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":"2409.01156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-06-30T07:34:22.143661Z","title":"Tempme: Video temporal token merging for efficient text- video retrieval","venue":null,"work_id":"e3e84514-69ce-4dba-a047-ffcc35ffb615","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-07T14:16:18.120869Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:0d5aeffb66790809183b7d1d53160417071bce8daba8f9164b255424fd96f87e","observation_id":"e6373ec4-0774-4ee1-8c9a-40bb5e22f222","resolution":{"observed_at":"2026-05-15T18:26:27.050959Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-07-06T19:09:14.628371Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":"2409.01156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-06-30T07:34:22.143661Z","title":"Tempme: Video temporal token merging for efficient text- video retrieval","venue":null,"work_id":"e3e84514-69ce-4dba-a047-ffcc35ffb615","year":2024},"citing_paper":{"arxiv_id":"2605.00826","last_updated":"2026-03-07T12:28:35Z","snapshot_observed_at":"2026-07-06T23:14:11.211164Z","submitted_at":"2026-03-07T12:28:35Z","title":"Understanding the Performance Plateau in Text-to-Video Retrieval: A Comprehensive Empirical and Linguistic Analysis","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-15T15:05:37.964883Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2605.00826"},"observation_digest":"sha256:147dc2884d168eb6b54e1a792f34603f786832242e5a452ebb1892e6b69847e7","observation_id":"4d8556ba-eb10-4551-832a-2fafc5d97a49","resolution":{"observed_at":"2026-05-15T15:06:09.663380Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-07-06T19:09:14.628371Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":"2409.01156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-06-30T07:34:22.143661Z","title":"Tempme: Video temporal token merging for efficient text- video retrieval","venue":null,"work_id":"e3e84514-69ce-4dba-a047-ffcc35ffb615","year":2024},"citing_paper":{"arxiv_id":"2606.29350","last_updated":"2026-06-28T11:42:55Z","snapshot_observed_at":"2026-08-01T11:08:50.663741Z","submitted_at":"2026-06-28T11:42:55Z","title":"Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T07:24:59.159037Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2606.29350"},"observation_digest":"sha256:da8d04ecc3988d6ff88ecec272c13c9232f225ecb741093c1afe56622d78b266","observation_id":"405e9bd1-0db9-4bfc-8bf8-6a6e5c2d1341","resolution":{"observed_at":"2026-06-30T07:34:22.145236Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-07-06T19:09:14.628371Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2409.01156 (2024) STAC 19","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:fe7ad09f7795b5f45ccb69ef177b9a426d2d12f4c862429102cee03c2ccd338c","observation_id":"54e0cb18-43af-407f-b79f-dc31dac84aca","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-07-06T19:09:14.628371Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-07-31T23:59:17.042425Z","title":"Tempme: Video temporal token merging for efficient text- video retrieval.arXiv preprint arXiv:2409.01156, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T23:59:17.042425Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:1399de8b057e9b367af8e404e59bd8015d45d79d3c8778d724d8eb2c0ba8ce16","observation_id":"fe4e68f3-7808-4951-9552-1dcae442deca","resolution":{"observed_at":"2026-07-31T23:59:17.042425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-07-06T19:09:14.628371Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-08-04T04:01:48.573191Z","title":"Tempme: Video temporal token merging for efficient text- video retrieval.arXiv preprint arXiv:2409.01156, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23265","last_updated":"2026-08-03T14:35:14Z","snapshot_observed_at":"2026-08-06T23:32:32.715200Z","submitted_at":"2026-07-25T16:05:22Z","title":"WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T04:01:48.573191Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2607.23265"},"observation_digest":"sha256:01fa80f643b9bcd82705b9cb059480e38148bfdc41edf3d074c8619e69adbf2a","observation_id":"bd2233ae-0764-4622-ba01-0bc71e99655c","resolution":{"observed_at":"2026-08-04T04:01:48.573191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2409.01156/citation-record","integrity":"/paper/2409.01156/integrity","json":"/paper/2409.01156/citation-record.json","paper":"/paper/2409.01156"},"outbound":[],"paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T19:09:14.628371Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2409.01156."}