{"as_of":"2026-08-05T15:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b34b24483a47817141898918a8f8a49dd55e5b1f36b2ef37219ca9929ff3f5ac","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":27,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:05:54.875262Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:20:06.409899Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T16:59:50.495335Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2307.16125"},"observation_digest":"sha256:585c0f81a904caf75d8d5efd824ee63e6699598c43173c2f5aad42c0603bec61","observation_id":"897e4d1c-875a-441b-b2f8-26c72af5d579","resolution":{"observed_at":"2026-05-12T16:59:50.650439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-14T18:08:01.166072Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2311.10122"},"observation_digest":"sha256:44b07c32eab7444d787e269cb4a64339ebd7aee1a247a085f9620b3c5972c030","observation_id":"c342be09-1bd7-449d-b81d-5e098411cd7c","resolution":{"observed_at":"2026-05-14T18:08:01.242531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2311.17005","last_updated":"2024-05-23T14:49:29Z","snapshot_observed_at":"2026-07-06T16:53:55.269172Z","submitted_at":"2023-11-28T17:59:04Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-17T20:22:34.954228Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2311.17005"},"observation_digest":"sha256:bf4caf13ea5fd6dc99b54b2d3b43c84ed4a9292977e41fab53c3ffd62e57473c","observation_id":"f560f83b-f72e-4b21-9b3f-27f69a86c5a5","resolution":{"observed_at":"2026-05-17T20:22:35.014045Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-04T21:17:37.211833Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"reference_index":108,"source":"arxiv_source","source_observed_at":"2026-05-17T02:46:16.632743Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2403.00476"},"observation_digest":"sha256:5068edf3844d5e1af31bfedd2fdff0c34fed968f88bcf1de56f48882afb5053d","observation_id":"da2205a2-3c68-494f-bd58-63204b3bf502","resolution":{"observed_at":"2026-05-17T02:46:16.769669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-04T22:09:42.241578Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-05-17T10:46:28.447347Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2407.03320"},"observation_digest":"sha256:3bc490ed73b37f03a835fc05abcb132e159e6778ee9410a6d99c874ac2e3d1b2","observation_id":"d8272357-eb90-40ef-b937-06bdfc05800d","resolution":{"observed_at":"2026-05-17T10:46:28.884272Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T13:53:33.585035Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2410.17434"},"observation_digest":"sha256:871d03ae4ed9e6a3a9c95c5d9a96b8ea52b6b4adeea95e477fd78b1455d6df32","observation_id":"634a0eee-6bd6-4860-99f0-19f0893c45f8","resolution":{"observed_at":"2026-05-16T13:53:33.675561Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T17:31:59.030963Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2411.02327"},"observation_digest":"sha256:43dd186e48783e1f15210dca620e952d6d37bc9b0b95f07a8490c086cb8678c1","observation_id":"dc8993eb-df65-4539-8b6b-4bd24028e0e2","resolution":{"observed_at":"2026-05-23T17:33:15.706077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2412.02930","last_updated":"2026-04-19T04:24:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-04T00:50:33Z","title":"TemporalVLM: Video LLMs for Temporal Reasoning in Long Videos","version":6},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-23T08:08:01.889675Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2412.02930"},"observation_digest":"sha256:c73de1a3b90a5540e838c642e072c8c3ea1cf5d600eb83c6f0d8a01fe4434dec","observation_id":"8f5e0e6f-f569-4ead-809a-2a3b4e6d6d3e","resolution":{"observed_at":"2026-05-23T08:12:43.870984Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:2088aef0b3a46f6cf51ff57d69f80b7928c840eb17b1e10765a0811ddf816ac3","observation_id":"08271f24-be62-4741-8711-197e91098711","resolution":{"observed_at":"2026-05-23T00:22:18.746828Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2506.18962","last_updated":"2026-05-11T09:01:24Z","snapshot_observed_at":"2026-08-01T20:32:32.808839Z","submitted_at":"2025-06-23T17:58:17Z","title":"UniMind: Unleashing the Power of LLMs for Unified Multi-Task Brain Decoding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-19T07:43:26.736409Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2506.18962"},"observation_digest":"sha256:03ce207a5fe944fd75beeb4a52078786bcfb6ffe56b64ee6cc6ff4a977fd38c4","observation_id":"c4229669-f0ae-4e90-a50f-ac08f48c9807","resolution":{"observed_at":"2026-05-19T07:47:10.369499Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-05T13:05:54.875262Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-05T13:05:51.875633Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:54.875262Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:fea3afd3c99601d696b7939f68968c7668bfb773c23667c03b7d386776126f44","observation_id":"a6630497-dc85-42bc-83c5-efaa1c28942c","resolution":{"observed_at":"2026-08-05T13:05:54.875262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-04T19:37:42.248728Z","title":"Valley: Video assistant with large language model enhanced ability,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-04T19:37:40.169661Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":248,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:42.248728Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:29737cef34a142d528db1deebbcf7d4c440ba31ab53c0ef622af48019044daf0","observation_id":"34b2886f-ccd6-447f-b1c7-55ef0e380930","resolution":{"observed_at":"2026-08-04T19:37:42.248728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-03T21:42:47.855446Z","title":"Valley: Video assistant with large language model enhanced ability,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.14143","last_updated":"2026-06-08T00:19:12Z","snapshot_observed_at":"2026-08-03T21:42:43.699429Z","submitted_at":"2025-11-18T05:03:17Z","title":"SMART: Shot-Aware Multimodal Video Moment Retrieval with Audio-Enhanced MLLM","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T21:42:47.855446Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2511.14143"},"observation_digest":"sha256:c07582a653659f2701182788592ab10d4b1018e09bfaba7fc88f6bd98cc2de42","observation_id":"d5431206-c977-4ddb-9a17-869ded7abf2b","resolution":{"observed_at":"2026-08-03T21:42:47.855446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-03T20:57:30.906964Z","title":"Valley: Video assistant with large language model enhanced ability","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.17731","last_updated":"2026-06-30T21:37:31Z","snapshot_observed_at":"2026-08-03T20:57:27.147869Z","submitted_at":"2025-11-21T19:30:24Z","title":"VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T20:57:30.906964Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2511.17731"},"observation_digest":"sha256:d9efd6e02a5858d2ee9d9939487ca8c091c9d01832642593009178e17e3210e3","observation_id":"0536ee5a-5b72-4bb6-b5f3-d8f5ecdfcc87","resolution":{"observed_at":"2026-08-03T20:57:30.906964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2512.06673","last_updated":"2026-05-09T07:46:05Z","snapshot_observed_at":"2026-07-06T22:37:59.340166Z","submitted_at":"2025-12-07T06:11:15Z","title":"Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-17T00:54:53.789523Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2512.06673"},"observation_digest":"sha256:83433b58a501d716ba2b67531f4e7a5ad4ffb834c1b892238d21cc79b5a5b7fd","observation_id":"3780dad6-ab2a-414b-8f9d-9e81fe75ccdc","resolution":{"observed_at":"2026-05-17T00:58:46.556812Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2604.05079","last_updated":"2026-04-06T18:30:50Z","snapshot_observed_at":"2026-08-02T23:48:40.440218Z","submitted_at":"2026-04-06T18:30:50Z","title":"SVAgent: Storyline-Guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T20:20:08.590407Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2604.05079"},"observation_digest":"sha256:2764d8e011e6ae0fcf427d887584542b8484a7eb5022e9b6d53a8a1f15b08af8","observation_id":"89f4997e-db72-495e-a46d-391c9c729afc","resolution":{"observed_at":"2026-05-10T22:00:49.044127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:5466afb54eaef2c7c7970f52d4f42973ed61a5c136050655b40d85d52560dec1","observation_id":"053cc833-2807-415b-b9d3-2620cdc741e8","resolution":{"observed_at":"2026-05-11T08:30:56.924293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Valley: Video assistant with large language model enhanced ability,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:9ee70a74efe68024e083c1c7adf99948053bb1e644db76488342f1ff29a88569","observation_id":"6d2e3842-bbb3-4e92-84ad-800e932d1c89","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2604.14149","last_updated":"2026-04-16T15:48:38Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-15T17:59:52Z","title":"One Token per Highly Selective Frame: Towards Extreme Compression for Long Video Understanding","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T13:28:58.920442Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2604.14149"},"observation_digest":"sha256:b2ed5c3142db7b0aa72d4a7daa46333670b61d2341a74fd445be37d66871d6a2","observation_id":"6ef3b4ba-347d-4592-8f41-d38510568d4b","resolution":{"observed_at":"2026-05-10T13:30:26.566195Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2604.27968","last_updated":"2026-04-30T15:00:52Z","snapshot_observed_at":"2026-07-06T23:13:20.516759Z","submitted_at":"2026-04-30T15:00:52Z","title":"ClimateVID -- Social Media Videos Analysis and Challenges Involved","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-07T05:25:05.760276Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2604.27968"},"observation_digest":"sha256:965162592df1c33b234a57516d0c97a952bcb3d63c91bf639902152764a34bf8","observation_id":"9a223249-f3da-42a3-af03-839e912aeace","resolution":{"observed_at":"2026-05-12T10:36:30.448614Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2605.18904","last_updated":"2026-05-17T13:36:53Z","snapshot_observed_at":"2026-07-31T21:47:41.038897Z","submitted_at":"2026-05-17T13:36:53Z","title":"Dynamic Model Merging Made Slim","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-20T15:16:24.651868Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2605.18904"},"observation_digest":"sha256:b0e0ac53b3a75a9c1ac6be41b9edb8673391ab685e7f551e8683d4779eeb986e","observation_id":"696d60da-b03f-4d11-a459-80b296cf68c3","resolution":{"observed_at":"2026-05-20T15:18:25.408077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2606.07289","last_updated":"2026-06-05T14:00:47Z","snapshot_observed_at":"2026-08-01T07:32:32.007503Z","submitted_at":"2026-06-05T14:00:47Z","title":"Closed-Form Spectral Regularization for Multi-Task Model Merging","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-06-27T22:40:00.510742Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2606.07289"},"observation_digest":"sha256:e63be4bf70d55b1a5085a3d9262c4683fa09ac2da3bc8de5eb9f08fb37937fb9","observation_id":"54e5d202-bf23-46d1-98fb-d3bd45514b1f","resolution":{"observed_at":"2026-07-02T16:27:09.379995Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2606.10533","last_updated":"2026-06-09T08:04:06Z","snapshot_observed_at":"2026-08-02T06:11:11.082949Z","submitted_at":"2026-06-09T08:04:06Z","title":"Audio-Visual Exchange-Aware Token Pruning for Efficient Audio-Visual Captioning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T13:53:53.520545Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2606.10533"},"observation_digest":"sha256:e02f7ea5d026303e17d3db9bee80783078ab4a8a444df341add63f0b51cb098b","observation_id":"3b7dfae4-d4b9-41b7-8a07-ff1bc762f762","resolution":{"observed_at":"2026-07-03T04:27:36.879950Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":142,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:b79a2427aeb596c70f3920f874c54739e7e7f773b180546ad9efc302fdae958e","observation_id":"c2a7f144-34cd-4dad-9773-a3100e589982","resolution":{"observed_at":"2026-07-03T10:48:02.979640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2606.22352","last_updated":"2026-06-21T06:20:55Z","snapshot_observed_at":"2026-08-02T14:40:23.827146Z","submitted_at":"2026-06-21T06:20:55Z","title":"On the Sparsity-Storage-Accuracy Tradeoff in Parsimoniously Activated Dictionary Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T11:13:49.266859Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2606.22352"},"observation_digest":"sha256:fbee2a656655845522c501cdc05ae2e5b2906359af03c7ceb0e13c4ba391e992","observation_id":"0b1ceda6-c948-4963-b7a4-e89a65659738","resolution":{"observed_at":"2026-07-04T08:39:42.125759Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2606.25325","last_updated":"2026-07-20T13:20:39Z","snapshot_observed_at":"2026-08-02T10:17:41.360200Z","submitted_at":"2026-06-24T02:43:26Z","title":"Omni-Perception Policy Optimization for Multimodal Emotion Reasoning","version":1},"reference_index":135,"source":"arxiv_source","source_observed_at":"2026-06-25T21:31:38.450382Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2606.25325"},"observation_digest":"sha256:a38b532765774d50e166753efb10a6637d369a023b8755c0d47779c6e570d1a0","observation_id":"2bf24e0f-0851-454d-97e7-f1d6c87a3583","resolution":{"observed_at":"2026-07-04T19:20:06.411854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2607.01117","last_updated":"2026-07-01T16:04:24Z","snapshot_observed_at":"2026-08-01T19:51:36.300993Z","submitted_at":"2026-07-01T16:04:24Z","title":"MoHallBench: A Benchmark for Motion Hallucination in Video Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-02T13:44:48.250838Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2607.01117"},"observation_digest":"sha256:7bf70a197b71ad0b2729bd848267bb929ac22db283c8326dbbc2aaa53a193af2","observation_id":"c1801018-9997-4953-8a27-fcc10b024224","resolution":{"observed_at":"2026-07-02T13:46:58.685914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2306.07207/citation-record","integrity":"/paper/2306.07207/integrity","json":"/paper/2306.07207/citation-record.json","paper":"/paper/2306.07207"},"outbound":[],"paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 27 inbound Pith citation observations for arXiv:2306.07207."}