{"as_of":"2026-08-07T12:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e1d9bd01a9b85e43c8c2b7141956b0be550322d57dd069c57bdcb839544a759f","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:32:55.846636Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T05:14:24.814323Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T08:40:46.400243Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2505.24329","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24329","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Distime: Distribution-based time represen- tation for video large language models.arXiv preprint arXiv:2505.24329","venue":null,"work_id":"2bc81c15-b727-4980-ba39-352a81587c13","year":2025},"citing_paper":{"arxiv_id":"2602.02994","last_updated":"2026-06-02T08:33:06Z","snapshot_observed_at":"2026-08-03T05:14:21.502066Z","submitted_at":"2026-02-03T02:05:48Z","title":"Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T08:38:49.075457Z"},"links":{"cited_paper":"/paper/2505.24329","citing_paper":"/paper/2602.02994"},"observation_digest":"sha256:9d35f44d88ac8f67ed544ae76156f2657f41fe8b8d1b4b6e8cbd8e7300b49eb1","observation_id":"48cf3857-f29c-42f7-8e63-d7dbd67fd0c2","resolution":{"observed_at":"2026-05-16T08:40:46.401909Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24329","snapshot_observed_at":"2026-08-03T05:14:24.814323Z","title":"Distime: Distribution-based time represen- tation for video large language models.arXiv preprint arXiv:2505.24329,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02994","last_updated":"2026-06-02T08:33:06Z","snapshot_observed_at":"2026-08-03T05:14:21.502066Z","submitted_at":"2026-02-03T02:05:48Z","title":"Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T05:14:24.814323Z"},"links":{"cited_paper":"/paper/2505.24329","citing_paper":"/paper/2602.02994"},"observation_digest":"sha256:20fce64f81a4c6bc2127637f4b70cb702784ed228362491aeae757c075731ba8","observation_id":"4944cbca-33ab-44b1-a708-1985c1e860aa","resolution":{"observed_at":"2026-08-03T05:14:24.814323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2505.24329","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24329","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Distime: Distribution-based time represen- tation for video large language models.arXiv preprint arXiv:2505.24329","venue":null,"work_id":"2bc81c15-b727-4980-ba39-352a81587c13","year":2025},"citing_paper":{"arxiv_id":"2604.25276","last_updated":"2026-04-28T06:34:19Z","snapshot_observed_at":"2026-07-06T23:11:11.827339Z","submitted_at":"2026-04-28T06:34:19Z","title":"OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-07T16:51:43.783133Z"},"links":{"cited_paper":"/paper/2505.24329","citing_paper":"/paper/2604.25276"},"observation_digest":"sha256:9891bcf1a9dd9ecce7540d3d39daeb1d502393d0912c280d1e5803fa8555ac21","observation_id":"1f28223d-7405-4cd7-83c5-6a4824473fa1","resolution":{"observed_at":"2026-05-11T23:31:15.758838Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24329","snapshot_observed_at":"2026-07-31T23:32:54.788326Z","title":"Distime: Distribution-based time representation for video large language models.arXiv preprint arXiv:2505.24329, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23951","last_updated":"2026-07-27T02:56:43Z","snapshot_observed_at":"2026-07-31T23:32:36.040113Z","submitted_at":"2026-07-27T02:56:43Z","title":"TimePLE: Rethinking Temporal Representation for Video Temporal Grounding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T23:32:54.788326Z"},"links":{"cited_paper":"/paper/2505.24329","citing_paper":"/paper/2607.23951"},"observation_digest":"sha256:d79ab3071e8c64280c0ab2601795ca4a48b1227434553960b0545320e28eb502","observation_id":"fb0229f2-85fa-4610-ba82-d25d5f94f700","resolution":{"observed_at":"2026-07-31T23:32:54.788326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24329/citation-record","integrity":"/paper/2505.24329/integrity","json":"/paper/2505.24329/citation-record.json","paper":"/paper/2505.24329"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:32:49.930599Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:49.930599Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:974b4c07cf2f4a73061fcdd6938f8a06b3a2c05c9c006faaa82582f29fc3532e","observation_id":"e983d84c-ad2e-4741-9dd1-b6b1a56c401b","resolution":{"observed_at":"2026-08-07T12:32:49.930599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:50.034969Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:50.034969Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:7555a8f5e53397b6e992e3545de3c0c2819d7207801ee28cfb9bc3531b405cf1","observation_id":"046fa311-fe12-4a19-b887-0a6fd01b6ce5","resolution":{"observed_at":"2026-08-07T12:32:50.034969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12075","last_updated":"2024-12-16T18:46:45Z","snapshot_observed_at":"2026-07-06T20:07:58.873037Z","submitted_at":"2024-12-16T18:46:45Z","title":"CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12075","snapshot_observed_at":"2026-08-07T12:32:50.149539Z","title":"Cg- bench: Clue-grounded question answering benchmark for long video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:50.149539Z"},"links":{"cited_paper":"/paper/2412.12075","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:48213532831996d1b4285c7a1f4fdc21b52f7a083dfb760857fef33060b9050b","observation_id":"e150a606-02fb-4a4e-8b6f-c23c42111155","resolution":{"observed_at":"2026-08-07T12:32:50.149539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18211","last_updated":"2024-11-27T10:45:40Z","snapshot_observed_at":"2026-07-06T19:57:51.125083Z","submitted_at":"2024-11-27T10:45:40Z","title":"TimeMarker: A Versatile Video-LLM for Long and Short Video Understanding with Superior Temporal Localization Ability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18211","snapshot_observed_at":"2026-08-07T12:32:50.318296Z","title":"Timemarker: A versatile video-llm for long and short video understanding with superior temporal localiza- tion ability","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:50.318296Z"},"links":{"cited_paper":"/paper/2411.18211","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:23a71ca3a5738f86bd9de6c4105e953a00bf8da1f9f44286b7bfe21108416b2b","observation_id":"866881c4-15df-4a8a-b47b-10bf6d8e8030","resolution":{"observed_at":"2026-08-07T12:32:50.318296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T12:32:50.466205Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test- time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:50.466205Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:5941b5b02c4ba56df9aa6a5fd9d945ab4036902a2e52306cdc6c836810abf4ae","observation_id":"538b5115-2b18-4501-8090-17fa6c5d4c27","resolution":{"observed_at":"2026-08-07T12:32:50.466205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:50.609800Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:50.609800Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:779994e23e9197ca52e882d4f21fdf05b7c139741a485ebf198bb2f8de326805","observation_id":"5f47d592-0777-426d-a89d-ac41ca6148e3","resolution":{"observed_at":"2026-08-07T12:32:50.609800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:00.666719Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":"36c96749-2fdf-45ee-af60-9117a63cf94b","year":2023},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:50.706528Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:0006791a04241ab451543a17b263fd4acd6ab4c028b35b0cd9f7f24fb62130f4","observation_id":"af726b0c-8c59-43c4-b747-5ff92d29d4e0","resolution":{"observed_at":"2026-08-07T12:33:00.717368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T12:32:50.808047Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:50.808047Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:02e6febe7e99a5bef6ec5bac984b3fcb339b8f6d3f2ca1db562234602486d638","observation_id":"7fee8cdc-d608-4d80-879c-706639178c51","resolution":{"observed_at":"2026-08-07T12:32:50.808047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:00.554359Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":"9da7f3cf-0813-422f-b422-f27983d264a9","year":2017},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:50.911068Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:0503f244d13f868402e176e6b229ffaad4d8dbf4aa4f66353720b64f51d49adb","observation_id":"872d5253-b461-4aaa-a439-6770b4e4f72a","resolution":{"observed_at":"2026-08-07T12:33:00.601125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05185","last_updated":"2024-12-11T14:43:02Z","snapshot_observed_at":"2026-07-06T20:02:53.153763Z","submitted_at":"2024-12-06T17:04:42Z","title":"LinVT: Empower Your Image-level Large Language Model to Understand Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05185","snapshot_observed_at":"2026-08-07T12:32:51.011685Z","title":"Linvt: Empower your image- level large language model to understand videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:51.011685Z"},"links":{"cited_paper":"/paper/2412.05185","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:ca1913835ec149f9e431bde36a4a270508a8eb22be542cfbd58fc8bc2e01b1dc","observation_id":"e2bdee07-8166-41f5-a9a7-78f04a2aaf8d","resolution":{"observed_at":"2026-08-07T12:32:51.011685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:51.110427Z","title":"Saliency-guided detr for mo- ment retrieval and highlight detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:51.110427Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:5bb57696fad8f3d36cfa9226e43a824d416db3c8f544edcfffbf2386dbfcb5c2","observation_id":"8d62473d-8e26-4913-b3c3-cf1625e38c8f","resolution":{"observed_at":"2026-08-07T12:32:51.110427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:00.433548Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"ef92e4d3-f17d-497a-837b-1f28001e0ae1","year":2022},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:51.175073Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:9948afbd91715719481936d80553697d9afd885b15e3cad4b6499648aacb9442","observation_id":"a097448b-0aec-4dac-9ec7-7ab4de3fd9dd","resolution":{"observed_at":"2026-08-07T12:33:00.485258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13382","last_updated":"2025-02-01T03:55:30Z","snapshot_observed_at":"2026-07-06T18:17:46.369537Z","submitted_at":"2024-05-22T06:31:42Z","title":"VTG-LLM: Integrating Timestamp Knowledge into Video LLMs for Enhanced Video Temporal Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13382","snapshot_observed_at":"2026-08-07T12:32:51.273965Z","title":"Vtg-llm: Integrating timestamp knowledge into video llms for enhanced video temporal grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:51.273965Z"},"links":{"cited_paper":"/paper/2405.13382","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:cd3fb04c203568c2f09e9fe23e79b30ddd70268c9b79452f6ff7358de8a1a4db","observation_id":"4a7dd681-5851-4269-98a3-7d8710374cc3","resolution":{"observed_at":"2026-08-07T12:32:51.273965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:00.297685Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"9b87e8bc-0f5e-43f6-bd6e-bdffb48f4574","year":2022},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:51.368935Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:9e9638e268853435bc4a3bf8ee2efbc2c911c962fcb0f46bda28a3f1f19a10e3","observation_id":"46d40a68-0663-4594-a67f-c871ece1aa77","resolution":{"observed_at":"2026-08-07T12:33:00.364833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:33:00.163107Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":"4c993c18-535e-4b89-9065-10491df68a77","year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:51.473579Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:ad3cd07309bf91941ec1adc1d006f2a0205bbad4d485a3c2b574a77f061b710d","observation_id":"ad03b8fa-587b-4f00-b849-d94343e2cd88","resolution":{"observed_at":"2026-08-07T12:33:00.224325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:51.534075Z","title":"Dense-captioning events in videos","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:51.534075Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:077e87e1731e47773e3c78b88bda1ec620afeb229b366bae268cdcf85443a001","observation_id":"99209f1d-808b-46a7-b8ad-cc1eda223349","resolution":{"observed_at":"2026-08-07T12:32:51.534075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:59.971907Z","title":"Detecting mo- ments and highlights in videos via natural language queries","venue":null,"work_id":"be680b12-536f-40ee-ae7c-7cf6a3a4fccd","year":2021},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:51.628353Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:266b1a04acc873d6e5aa96d55188be63dcf3803390523e72716aa208fe3bfec9","observation_id":"e0516f95-5d10-48ae-b0aa-9690bfc48e09","resolution":{"observed_at":"2026-08-07T12:33:00.059185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T12:32:51.722537Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:51.722537Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:29df2eb7bc15a9fe1641d67efddf7c687c67c545b73b835bb08829aa82823548","observation_id":"ca54fab8-e018-4a59-a862-6e7ff182cc8e","resolution":{"observed_at":"2026-08-07T12:32:51.722537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:59.808388Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"23120e34-8387-477e-8f79-c87f49999980","year":2023},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:51.820610Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:30c1a77dbd6b53cf9f23e7276323252295fde3501e8f7d126e6367dfb995a1bd","observation_id":"c6a31558-7800-4065-9018-751a255c5cb3","resolution":{"observed_at":"2026-08-07T12:32:59.896873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T12:32:51.944782Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:51.944782Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:e6a790cefa2956f6f201afaee8c0aa4296664feebfc3dfd82f2825135e20cb6d","observation_id":"21d7e694-12db-4d82-a923-8fecfdde71d9","resolution":{"observed_at":"2026-08-07T12:32:51.944782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:59.666377Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":"6d839551-7bdf-44e1-98dc-504885d4a7b6","year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:52.015588Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:c0fb9ae09ef0c48eb6a955211da31c9f81e54df0e32e7feafdc39e9cb3be7e52","observation_id":"6db8b069-5dc4-4c7b-b4e0-4830daab98cf","resolution":{"observed_at":"2026-08-07T12:32:59.732986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:59.485707Z","title":"Generalized focal loss: Learning qualified and distributed bounding boxes for dense 9 object detection","venue":null,"work_id":"97b1661b-c505-4b70-9270-594e3acc1621","year":2020},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:52.100242Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:4e33d259d612822e6e4134a776267709faa5f596f1ef21682a615898a6e4106d","observation_id":"1c5b0dde-dbb6-429c-8e15-e36514292473","resolution":{"observed_at":"2026-08-07T12:32:59.550281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:52.213019Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:52.213019Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:632435b3cd6834e24b0a5f168c8ad792294edfbb7b0cebe96eb32f4a24e71466","observation_id":"236837cc-17ff-4c9b-845d-37a95944f148","resolution":{"observed_at":"2026-08-07T12:32:52.213019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06071","last_updated":"2024-03-05T14:36:12Z","snapshot_observed_at":"2026-07-30T19:32:30.807724Z","submitted_at":"2024-01-11T17:41:57Z","title":"GroundingGPT:Language Enhanced Multi-modal Grounding Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06071","snapshot_observed_at":"2026-08-07T12:32:52.287195Z","title":"Groundinggpt: Language enhanced multi-modal grounding model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:52.287195Z"},"links":{"cited_paper":"/paper/2401.06071","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:2272ea50891402a31c0e3c1354a9afb3fe21b76bd85c8760754e0e1c62252203","observation_id":"4644ef79-c8e4-4276-aac2-14c94566a4e0","resolution":{"observed_at":"2026-08-07T12:32:52.287195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:59.291375Z","title":"Detal: Open-vocabulary temporal action localization with decoupled networks","venue":null,"work_id":"43aa99eb-877c-47c3-8ad9-6d4e818b542a","year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:52.373305Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:8efb7d9a95b8fcce0f136951fe0a898d3361c3dac2b97a4607c96c986b4aa6c3","observation_id":"bffae752-2bbc-48d1-afa2-3ff47b1f1019","resolution":{"observed_at":"2026-08-07T12:32:59.375299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:59.113510Z","title":"Univtg: Towards unified video- language temporal grounding","venue":null,"work_id":"f3b4bc16-d08a-4f5b-9203-88d9466b2a16","year":2023},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:52.493479Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:0e44ed5600379186efbad241c25f655e308b1c64a54e0165ebcaacd1664fd6a2","observation_id":"de9c4524-36a8-459d-9684-22869a55e3dc","resolution":{"observed_at":"2026-08-07T12:32:59.190583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:52.552107Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:52.552107Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:cf78f9f7208945eff1d532a4c3b16fb15198296a5c9d4bd66f0063df2dab38a8","observation_id":"09668194-d388-476e-b1b1-3a5cdb596534","resolution":{"observed_at":"2026-08-07T12:32:52.552107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18111","last_updated":"2024-09-26T17:53:04Z","snapshot_observed_at":"2026-07-06T19:22:58.341345Z","submitted_at":"2024-09-26T17:53:04Z","title":"E.T. Bench: Towards Open-Ended Event-Level Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18111","snapshot_observed_at":"2026-08-07T12:32:52.655077Z","title":"Et bench: Towards open-ended event-level video-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:52.655077Z"},"links":{"cited_paper":"/paper/2409.18111","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:824507dc55be6677b245381f2de9e79dc5b5587d31c80b2d1fab1011d03b3dc1","observation_id":"039de858-bae8-427b-a797-8f0160f23146","resolution":{"observed_at":"2026-08-07T12:32:52.655077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T12:32:52.766856Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:52.766856Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:2d8bb1a78ddad6ebdcb50f179948f681c987c2c434a204ff611b2f3bba4d113f","observation_id":"3d2a4862-2b69-4d78-8e00-51a1e96f90cb","resolution":{"observed_at":"2026-08-07T12:32:52.766856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-07-06T19:54:00.822571Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14505","snapshot_observed_at":"2026-08-07T12:32:52.859271Z","title":"Llava-mr: Large language-and- vision assistant for video moment retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:52.859271Z"},"links":{"cited_paper":"/paper/2411.14505","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:121049d581ee12343296ccb96b6024ec9890de22efa5df6cad9dbf57e86290a4","observation_id":"a8c5eb12-65ec-487d-8628-b0f2bed9b148","resolution":{"observed_at":"2026-08-07T12:32:52.859271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-07T12:32:52.929275Z","title":"Valley: Video assistant with large language model enhanced ability","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:52.929275Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:41af8307a1623ed30639b6edf72ffd861701390df082428fa5262bb0000f06f1","observation_id":"c1b43079-4c42-428b-a47a-aff1f18e0f89","resolution":{"observed_at":"2026-08-07T12:32:52.929275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:53.040750Z","title":"The surprising effectiveness of multimodal large language models for video moment retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:53.040750Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:057fedc7618a588b96bb9f32bac289b245f7e6df2c663b6243a588386ae54735","observation_id":"4941de7b-9f8d-4784-aaf8-718110310073","resolution":{"observed_at":"2026-08-07T12:32:53.040750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08835","last_updated":"2024-07-03T18:05:02Z","snapshot_observed_at":"2026-08-04T18:08:42.450729Z","submitted_at":"2023-11-15T10:22:35Z","title":"Correlation-Guided Query-Dependency Calibration for Video Temporal Grounding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08835","snapshot_observed_at":"2026-08-07T12:32:53.147022Z","title":"Correlation-guided query-dependency calibra- tion for video temporal grounding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:53.147022Z"},"links":{"cited_paper":"/paper/2311.08835","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:c366c02c668ff49b4feebc80fbf823349d6b20c669a2a1d7978999db9b9fcc5b","observation_id":"dfe258fe-aad4-4e4b-8b4d-450c4bd1da09","resolution":{"observed_at":"2026-08-07T12:32:53.147022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:53.284040Z","title":"Perceptiongpt: Effectively fusing visual perception into llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:53.284040Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:2f183831d4cc723442424d86ec7fc4126e82812d5938a79bb17915481a4f13de","observation_id":"1d5c674d-ccd7-4949-80ac-ace48b687509","resolution":{"observed_at":"2026-08-07T12:32:53.284040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-05T15:20:33.981747Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-08-07T12:32:53.366366Z","title":"Momen- tor: Advancing video large language model with fine-grained temporal reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:53.366366Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:ffeb978f148bcef58be146548a6a5e9504a24e28e7516d5dbc05ba3c6c2fd61a","observation_id":"0f4567e2-5e6e-4036-9683-4241c6b3734d","resolution":{"observed_at":"2026-08-07T12:32:53.366366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:58.857967Z","title":"Chatvtg: Video temporal grounding via chat with video dialogue large language models","venue":null,"work_id":"82ba6216-77e2-4fb8-8155-ac0cdd5c0a36","year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:53.420330Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:d98b357ec52f7b21e5157ee4cae9c772492f52816751bc49dc72f36fbe44f2cc","observation_id":"37c0725f-863e-457e-bda2-48f82bcbb0eb","resolution":{"observed_at":"2026-08-07T12:32:58.946972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:58.613758Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"0264fed6-497b-4876-8625-3d6a2426b1e4","year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:53.525437Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:93e0724b0093c4c366efa37162a8238febd4b299acca362f97c2bdabbe6aabd4","observation_id":"be224410-daab-4624-ada5-1d69663abbef","resolution":{"observed_at":"2026-08-07T12:32:58.734554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16267","last_updated":"2025-06-09T19:33:32Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:59:11Z","title":"xGen-MM-Vid (BLIP-3-Video): You Only Need 32 Tokens to Represent a Video Even in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16267","snapshot_observed_at":"2026-08-07T12:32:53.658205Z","title":"xgen-mm-vid (blip-3- video): You only need 32 tokens to represent a video even in vlms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:53.658205Z"},"links":{"cited_paper":"/paper/2410.16267","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:20d03b8e6d8446c706c11acc756ab2782cf666fcd04a1bca980b3adc537d268d","observation_id":"dae1cfa4-b820-47e8-a865-124eaad7325d","resolution":{"observed_at":"2026-08-07T12:32:53.658205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:58.426499Z","title":"React: Temporal action detection with relational queries","venue":null,"work_id":"9d605c20-3cc1-440e-b905-3bd52c3bb6a5","year":2022},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:53.768815Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:66d6321b8c4b5aa99ea1b2686a2d945908a4f01ebbf2e86304bc8bf560d27faf","observation_id":"3caff01c-d124-4cdf-9fe6-4f42d9280603","resolution":{"observed_at":"2026-08-07T12:32:58.506942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05590","last_updated":"2023-09-11T16:17:50Z","snapshot_observed_at":"2026-07-06T16:17:00.299422Z","submitted_at":"2023-09-11T16:17:50Z","title":"Temporal Action Localization with Enhanced Instant Discriminability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05590","snapshot_observed_at":"2026-08-07T12:32:53.865330Z","title":"Temporal action localization with enhanced instant discriminability","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:53.865330Z"},"links":{"cited_paper":"/paper/2309.05590","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:a45b67e41473dc79fe6f508911a511dbb646479ec342e07ee11423cc74e9b55b","observation_id":"551e7c59-7076-4afa-91cd-d51c2096a59b","resolution":{"observed_at":"2026-08-07T12:32:53.865330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:58.211572Z","title":"Tridet: Temporal action detection with relative boundary modeling","venue":null,"work_id":"36ca5d1c-d3ec-4aef-b186-9c352bc278ba","year":2023},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:53.939553Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:4d118f87c237bcf7c706587b9487bb98e12ab511396e0b21fee7a73a9409d5db","observation_id":"5128f6d0-93b9-45d2-abb8-e424557f2f22","resolution":{"observed_at":"2026-08-07T12:32:58.335414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-07T12:32:54.042453Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:54.042453Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:14a797db70d05d47d372d5de0bfa2807096b63818aa81f105eb17f35a2a55933","observation_id":"213c9c4c-bd20-43cf-8c8d-d90308fb481e","resolution":{"observed_at":"2026-08-07T12:32:54.042453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:58.039506Z","title":"Internvideo2: Scaling foundation models for mul- timodal video understanding","venue":null,"work_id":"d1f4c707-feb0-4681-afbe-e94a528ce1ad","year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:54.145196Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:a760f430cb57d900fbcf61be1eaf0b82a55ac1b153b4d0fc77c5e7c6bc14f48b","observation_id":"1569b71e-42fe-4991-9cb7-2e6b70e55ea5","resolution":{"observed_at":"2026-08-07T12:32:58.125529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-07T12:32:54.252300Z","title":"Internvideo2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:54.252300Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:6483f84cfcaf03ce6288f7e0cf8f931df398c9ec0627163e824c890d3a91f69d","observation_id":"ee4104bc-0d5b-416d-9007-440cd0f92730","resolution":{"observed_at":"2026-08-07T12:32:54.252300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:57.856636Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding","venue":null,"work_id":"88a91c0d-8e4b-493a-b01c-36af0078ece1","year":2025},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:54.341102Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:013c92c9131d6c2152aa8c7d25ff5cc80ddfe08187548b17d1a05e8a37554bd2","observation_id":"ee2793be-62f1-48b5-964c-1c8c4c7b02b7","resolution":{"observed_at":"2026-08-07T12:32:57.949737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:57.653137Z","title":"Can i trust your answer? visually grounded video question answering","venue":null,"work_id":"35ce4b05-7774-477a-923d-5755382f9550","year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:54.441110Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:4d9210a795ef30dede047f2e3c26344772f04d04b320a5fbf3f0c56bfe4ec9ad","observation_id":"0bd14b92-e188-48bd-af3a-0d310dfc8100","resolution":{"observed_at":"2026-08-07T12:32:57.761265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-07T12:32:54.522637Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:54.522637Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:7e0b73c479256ea0fc23e0dd33ca932da38138fa819906a9d85dd7115bbd57ca","observation_id":"e29da4d6-2586-4b7a-b153-79b9c7f0bd1f","resolution":{"observed_at":"2026-08-07T12:32:54.522637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:57.496220Z","title":"Zero-shot video question answering via 10 frozen bidirectional language models","venue":null,"work_id":"0ceed886-2103-47bf-b3b4-56e8a40b93ec","year":2022},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:54.633174Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:b765245ed475ec2f3ad02dd313826d01368edccfa760e0c108fbf234f22ef4ee","observation_id":"c4afb9bc-f957-4eac-9ddd-24f633e3724d","resolution":{"observed_at":"2026-08-07T12:32:57.564606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T12:32:54.728045Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:54.728045Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:ea4096a82d95c76f683e6d0429205fdb382d2a13a11dad7de6446f225093a93f","observation_id":"a1c6c84f-88c8-4d7f-876c-e230f0f6b518","resolution":{"observed_at":"2026-08-07T12:32:54.728045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:57.311756Z","title":"Self-chained image-language model for video localization and question answering","venue":null,"work_id":"11579be8-8ea8-47ca-9210-d042678217b6","year":2023},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:54.841533Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:3dc4fbfb294ac5984c11a29879ead8b428d86a263bbf49d224dba7aa35a83628","observation_id":"bce61b1b-d678-4b3d-b4b9-22fe8ddce6b3","resolution":{"observed_at":"2026-08-07T12:32:57.378825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:54.974321Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:54.974321Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:848514c6023e1cabfcf15e576d6ecce9b807a8833b45d012da462915f44574b8","observation_id":"044d7d47-c453-4bd2-b160-9d8f5f843d4e","resolution":{"observed_at":"2026-08-07T12:32:54.974321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:57.123885Z","title":"Unimd: Towards unifying moment retrieval and temporal ac- tion detection","venue":null,"work_id":"7c51cec7-6923-4380-9687-d9bd9a5492ba","year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:55.048733Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:d592bf724b14138851b56b9bfd359fcbf26c56c53b8e3df68c545082d167aa08","observation_id":"c8466171-b24c-4362-a5f6-34e316667057","resolution":{"observed_at":"2026-08-07T12:32:57.232076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-07T12:32:55.159633Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:55.159633Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:6ab214fb135af22285fd3822e1d826f89d48e6905b33d12acc6946b6f9e67d7a","observation_id":"53e72cc7-89e6-494b-a7da-65fab8cf662d","resolution":{"observed_at":"2026-08-07T12:32:55.159633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10787","last_updated":"2025-01-18T14:54:56Z","snapshot_observed_at":"2026-07-06T20:22:50.018799Z","submitted_at":"2025-01-18T14:54:56Z","title":"LD-DETR: Loop Decoder DEtection TRansformer for Video Moment Retrieval and Highlight Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10787","snapshot_observed_at":"2026-08-07T12:32:55.288998Z","title":"Ld-detr: Loop decoder detection transformer for video moment retrieval and highlight detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:55.288998Z"},"links":{"cited_paper":"/paper/2501.10787","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:c4faa2fa3bd4bb0adaeb566e7dc186c8d1e153753dc0074bf06bac73c72bfc1b","observation_id":"01593c2e-f8b1-48d3-99d3-1f3a35340e4f","resolution":{"observed_at":"2026-08-07T12:32:55.288998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:56.967939Z","title":"Training-free video temporal grounding using large-scale pre-trained models","venue":null,"work_id":"314ab90c-c934-401f-b822-2ae8cbcb487f","year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:55.399042Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:8f603ff61652d8a7dbe3aaa5d5dc200029d560e9bbb62c50c15fd861f964473b","observation_id":"4113345c-9176-4ccf-b553-d34527587dff","resolution":{"observed_at":"2026-08-07T12:32:57.043893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:56.777986Z","title":"Towards automatic learning of procedures from web instructional videos","venue":null,"work_id":"01eb553c-2445-4b0a-884c-51c478dc79df","year":2018},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:55.508617Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:9b1230c964d905d41b443d1525e7ba8efd612cee527d4316c1fc9f0382b4979e","observation_id":"5b333f8d-3dec-4341-a7f5-6a4bb8e52b42","resolution":{"observed_at":"2026-08-07T12:32:56.872197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T12:32:55.604775Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:55.604775Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:d3b56c29429f3a695a4dd56d084c63d5933ad4a8b23d582d0112dbc7babf8c3e","observation_id":"6e564994-cdc0-40c3-8e92-e5c81178fd94","resolution":{"observed_at":"2026-08-07T12:32:55.604775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:56.580817Z","title":"Dedicated","venue":null,"work_id":"c0aad3e8-542c-48b4-b30f-16978495579c","year":null},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:55.709982Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:8c86694f138baad6bf1a41ca203846cf2484d30f29b4b4d470cff8d5138ede6b","observation_id":"be464263-fe35-4f22-9094-5c98ea8d6d8d","resolution":{"observed_at":"2026-08-07T12:32:56.674125Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:56.406851Z","title":"Give you the textual query: ‘thereis an orange barrier out of which people can stand’","venue":null,"work_id":"96b30517-1af7-4924-a8e7-61b0a1e408b4","year":null},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:55.846636Z"},"links":{"citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:f83b6a2fc39aeb1c028c1bd0714d6f146942582e842cce9a789a740b435d9859","observation_id":"8b2765c7-1c23-42b5-ba1f-7890ff6a0025","resolution":{"observed_at":"2026-08-07T12:32:56.490871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 4 inbound Pith citation observations for arXiv:2505.24329."}