{"as_of":"2026-08-09T04:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:18e94d0bcc4edf4731130fa0cf74ed46a81ddc9b02204b11ad3f5d7a0506edf2","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T20:06:35.130897Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T08:45:34.766676Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.18445","last_updated":"2023-11-30T10:49:56Z","snapshot_observed_at":"2026-08-06T04:44:45.537021Z","submitted_at":"2023-11-30T10:49:56Z","title":"VTimeLLM: Empower LLM to Grasp Video Moments","version":1},"cited_work":{"arxiv_id":"2311.18445","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.18445","snapshot_observed_at":"2026-07-01T08:45:34.766676Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":"7484a96d-058a-496d-9c63-13e4481d6e47","year":2023},"citing_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T02:44:53.284345Z"},"links":{"cited_paper":"/paper/2311.18445","citing_paper":"/paper/2406.07476"},"observation_digest":"sha256:68d4703fb249914c15d047e537f7f9c4998858826207c570024c2071a51b3da2","observation_id":"c34e4c35-76cd-442a-8933-209119e7c252","resolution":{"observed_at":"2026-05-11T02:44:53.448438Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18445","last_updated":"2023-11-30T10:49:56Z","snapshot_observed_at":"2026-08-06T04:44:45.537021Z","submitted_at":"2023-11-30T10:49:56Z","title":"VTimeLLM: Empower LLM to Grasp Video Moments","version":1},"cited_work":{"arxiv_id":"2311.18445","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.18445","snapshot_observed_at":"2026-07-01T08:45:34.766676Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":"7484a96d-058a-496d-9c63-13e4481d6e47","year":2023},"citing_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T17:31:59.030963Z"},"links":{"cited_paper":"/paper/2311.18445","citing_paper":"/paper/2411.02327"},"observation_digest":"sha256:0b363dbf95e4a574b8be1ae0cdade180cec11dde3c9e9c65095db7d40e2b7ec8","observation_id":"e2794c98-6dde-432a-abc5-45cdba567235","resolution":{"observed_at":"2026-05-23T17:33:15.634988Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18445","last_updated":"2023-11-30T10:49:56Z","snapshot_observed_at":"2026-08-06T04:44:45.537021Z","submitted_at":"2023-11-30T10:49:56Z","title":"VTimeLLM: Empower LLM to Grasp Video Moments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18445","snapshot_observed_at":"2026-08-08T20:06:35.130897Z","title":"Huang, Q., Dong, X., Zhang, P., Wang, B., He, C., Wang, J., Lin, D., Zhang, W., and Yu, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-08T19:58:39.444110Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.130897Z"},"links":{"cited_paper":"/paper/2311.18445","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:8e5100e5afb9867fc214a7e54b34a4a83e638f7c36d0ad087d21dcd7b8b2e5f5","observation_id":"76ce522a-51f9-4e33-8d59-0eba8a33ac6e","resolution":{"observed_at":"2026-08-08T20:06:35.130897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18445","last_updated":"2023-11-30T10:49:56Z","snapshot_observed_at":"2026-08-06T04:44:45.537021Z","submitted_at":"2023-11-30T10:49:56Z","title":"VTimeLLM: Empower LLM to Grasp Video Moments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18445","snapshot_observed_at":"2026-08-06T14:36:55.781535Z","title":"Vtimellm: Empower llm to grasp video moments,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18447","last_updated":"2025-07-24T14:33:06Z","snapshot_observed_at":"2026-08-06T19:31:11.014579Z","submitted_at":"2025-07-24T14:33:06Z","title":"PDB-Eval: An Evaluation of Large Multimodal Models for Description and Explanation of Personalized Driving Behavior","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:55.781535Z"},"links":{"cited_paper":"/paper/2311.18445","citing_paper":"/paper/2507.18447"},"observation_digest":"sha256:a285cc4717362546b03d89b595bfaf6b758b2a80d1379b4416dd825e3e0c07bc","observation_id":"33e18d71-395a-4d2a-886f-d54016a41e1b","resolution":{"observed_at":"2026-08-06T14:36:55.781535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18445","last_updated":"2023-11-30T10:49:56Z","snapshot_observed_at":"2026-08-06T04:44:45.537021Z","submitted_at":"2023-11-30T10:49:56Z","title":"VTimeLLM: Empower LLM to Grasp Video Moments","version":1},"cited_work":{"arxiv_id":"2311.18445","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.18445","snapshot_observed_at":"2026-07-01T08:45:34.766676Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":"7484a96d-058a-496d-9c63-13e4481d6e47","year":2023},"citing_paper":{"arxiv_id":"2604.02860","last_updated":"2026-04-03T08:26:12Z","snapshot_observed_at":"2026-07-06T22:52:10.923214Z","submitted_at":"2026-04-03T08:26:12Z","title":"A Paradigm Shift: Fully End-to-End Training for Temporal Sentence Grounding in Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T19:43:57.298338Z"},"links":{"cited_paper":"/paper/2311.18445","citing_paper":"/paper/2604.02860"},"observation_digest":"sha256:1c7c85c19efa0307a99fa88cfb636acf585858c2f81fc631a4d143f13851095f","observation_id":"08bdc58b-990a-4b98-8c63-4042fc607a58","resolution":{"observed_at":"2026-05-13T19:48:11.527741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18445","last_updated":"2023-11-30T10:49:56Z","snapshot_observed_at":"2026-08-06T04:44:45.537021Z","submitted_at":"2023-11-30T10:49:56Z","title":"VTimeLLM: Empower LLM to Grasp Video Moments","version":1},"cited_work":{"arxiv_id":"2311.18445","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.18445","snapshot_observed_at":"2026-07-01T08:45:34.766676Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":"7484a96d-058a-496d-9c63-13e4481d6e47","year":2023},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-08-08T01:22:27.799880Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-07T14:10:27.416341Z"},"links":{"cited_paper":"/paper/2311.18445","citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:d379aef290045d80191d902b8ab1d78e63f698f3e9200ca4bfd030870e3b3449","observation_id":"755d4af9-53eb-438f-8fe2-696c6546b606","resolution":{"observed_at":"2026-05-12T00:46:13.688106Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18445","last_updated":"2023-11-30T10:49:56Z","snapshot_observed_at":"2026-08-06T04:44:45.537021Z","submitted_at":"2023-11-30T10:49:56Z","title":"VTimeLLM: Empower LLM to Grasp Video Moments","version":1},"cited_work":{"arxiv_id":"2311.18445","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.18445","snapshot_observed_at":"2026-07-01T08:45:34.766676Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":"7484a96d-058a-496d-9c63-13e4481d6e47","year":2023},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-08-08T01:22:27.799880Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"cited_paper":"/paper/2311.18445","citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:a12d6b0e4e16a6bae5fac18de601318b3ad5c68c2116cb9f38b62074102bdc21","observation_id":"b8b842b8-d96b-4015-8c38-0b713131a6bb","resolution":{"observed_at":"2026-07-01T08:45:34.768754Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18445","last_updated":"2023-11-30T10:49:56Z","snapshot_observed_at":"2026-08-06T04:44:45.537021Z","submitted_at":"2023-11-30T10:49:56Z","title":"VTimeLLM: Empower LLM to Grasp Video Moments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18445","snapshot_observed_at":"2026-08-02T00:44:50.295963Z","title":"Vtimellm: Empower llm to grasp video moments, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-06T19:13:04.526298Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:50.295963Z"},"links":{"cited_paper":"/paper/2311.18445","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:1113da8917727955189998eae7d7ae413e09fedee5725788f172b149467dba64","observation_id":"28687dfa-c2a3-48e0-af69-1c6b34771ef1","resolution":{"observed_at":"2026-08-02T00:44:50.295963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18445","last_updated":"2023-11-30T10:49:56Z","snapshot_observed_at":"2026-08-06T04:44:45.537021Z","submitted_at":"2023-11-30T10:49:56Z","title":"VTimeLLM: Empower LLM to Grasp Video Moments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18445","snapshot_observed_at":"2026-07-31T23:32:51.395681Z","title":"Vtimellm: Empower llm to grasp video moments.arXiv preprint arXiv:2311.18445, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23951","last_updated":"2026-07-27T02:56:43Z","snapshot_observed_at":"2026-07-31T23:32:36.040113Z","submitted_at":"2026-07-27T02:56:43Z","title":"TimePLE: Rethinking Temporal Representation for Video Temporal Grounding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T23:32:51.395681Z"},"links":{"cited_paper":"/paper/2311.18445","citing_paper":"/paper/2607.23951"},"observation_digest":"sha256:0d3391c35aadde1b64631949749c7271db6e7e458087272b1b4a8692fe27f623","observation_id":"b4672433-9574-44ed-8088-14daf013796f","resolution":{"observed_at":"2026-07-31T23:32:51.395681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.18445/citation-record","integrity":"/paper/2311.18445/integrity","json":"/paper/2311.18445/citation-record.json","paper":"/paper/2311.18445"},"outbound":[],"paper":{"arxiv_id":"2311.18445","last_updated":"2023-11-30T10:49:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T04:44:45.537021Z","submitted_at":"2023-11-30T10:49:56Z","title":"VTimeLLM: Empower LLM to Grasp Video Moments"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2311.18445."}