{"as_of":"2026-08-12T12:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:edf2a10f6243210a8c0fae8c4f4e1c0be3afd4e1145b31d6bc42b12281840ac0","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:03:10.621431Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T21:55:17.388570Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T20:06:13.285932Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2412.11391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.11391","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Temporal contrastive learning for video temporal reasoning in large vision-language models","venue":null,"work_id":"f623b181-f4e1-4c91-bff6-698612b4236a","year":2024},"citing_paper":{"arxiv_id":"2605.06185","last_updated":"2026-05-07T13:01:28Z","snapshot_observed_at":"2026-08-11T17:06:47.265433Z","submitted_at":"2026-05-07T13:01:28Z","title":"Event-Causal RAG: A Retrieval-Augmented Generation Framework for Long Video Reasoning in Complex Scenarios","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T10:15:15.129358Z"},"links":{"cited_paper":"/paper/2412.11391","citing_paper":"/paper/2605.06185"},"observation_digest":"sha256:b3f26b3b20d2e49f19943e31679e79fae2271ebd7c1dcd7b3024be08ed62f5c0","observation_id":"8e505cdf-3815-43b9-b414-1c01695c8cb7","resolution":{"observed_at":"2026-05-11T20:06:13.287967Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11391","snapshot_observed_at":"2026-07-31T21:55:17.388570Z","title":"arXiv preprint arXiv:2412.11391 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27967","last_updated":"2026-07-30T10:14:24Z","snapshot_observed_at":"2026-08-05T12:14:09.489312Z","submitted_at":"2026-07-30T10:14:24Z","title":"MARS-RA: Rank Aggregation for Credit Assignment via Multimodal Comparisons in Embodied Multi-Agent Cooperation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-07-31T21:55:17.388570Z"},"links":{"cited_paper":"/paper/2412.11391","citing_paper":"/paper/2607.27967"},"observation_digest":"sha256:d89f5abb40e5502b4e04eacafd96f3fd31605887930c853e8eadf9d9b3d00941","observation_id":"f830223a-3a6f-4c7d-a475-893a5c70b8d8","resolution":{"observed_at":"2026-07-31T21:55:17.388570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.11391/citation-record","integrity":"/paper/2412.11391/integrity","json":"/paper/2412.11391/citation-record.json","paper":"/paper/2412.11391"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:03:11.156284Z","title":"Improving cross-modal alignment fo r text- guided image inpainting,","venue":null,"work_id":"64587854-4386-4997-bebc-e3180f250ff3","year":2023},"citing_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T15:03:10.492695Z"},"links":{"citing_paper":"/paper/2412.11391"},"observation_digest":"sha256:d38571c0629471126560b3f495857ab56ec0937634babfa37b5187b6ec36fbb0","observation_id":"530b7ad4-bc9f-49a5-8cfd-dba9fa042326","resolution":{"observed_at":"2026-08-11T15:03:11.161173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:03:11.142300Z","title":"Visual semantic role labeling for video understanding,","venue":null,"work_id":"5a9cf463-0b5f-4170-b468-10972e99c1c8","year":2021},"citing_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T15:03:10.497875Z"},"links":{"citing_paper":"/paper/2412.11391"},"observation_digest":"sha256:3efe4cba54b44da8cf4060bbe54da6ade584761672601c5d90de6c18cda491e8","observation_id":"4b571c40-358a-438a-84ad-99db03fbd50b","resolution":{"observed_at":"2026-08-11T15:03:11.146367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:03:10.501895Z","title":"Learning transferable visual models from na tural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T15:03:10.501895Z"},"links":{"citing_paper":"/paper/2412.11391"},"observation_digest":"sha256:4678fc7e85a2a1f8091a2e14cf741803addf58da8ca1100adf5dbfb0440e2d0d","observation_id":"f4e8022b-8435-4489-814f-c3b5f11a9ff7","resolution":{"observed_at":"2026-08-11T15:03:10.501895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06430","last_updated":"2023-03-02T08:24:23Z","snapshot_observed_at":"2026-08-10T14:43:14.788178Z","submitted_at":"2022-09-14T05:47:02Z","title":"CLIP-ViP: Adapting Pre-trained Image-Text Model to Video-Language Representation Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06430","snapshot_observed_at":"2026-08-11T15:03:10.506035Z","title":"Cli p-vip: Adapting pre-trained image-text model to video-language r epresentation alignment,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T15:03:10.506035Z"},"links":{"cited_paper":"/paper/2209.06430","citing_paper":"/paper/2412.11391"},"observation_digest":"sha256:872795aa608e618a8d613945def6b72713a2266d97d0b4c528459fb93db3d07b","observation_id":"e91f26dc-2b2c-4e74-bb65-af1488614639","resolution":{"observed_at":"2026-08-11T15:03:10.506035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:03:11.120423Z","title":"Video-llava: Learning united visual representation by al ignment before projection,","venue":null,"work_id":"0ec1837a-9e04-430f-905c-8b97ba83b235","year":2024},"citing_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T15:03:10.510994Z"},"links":{"citing_paper":"/paper/2412.11391"},"observation_digest":"sha256:3413347dd2f374e37f2025489019d7e8d0e0a883c30c72a19ae322acca24b0b2","observation_id":"a03d22b1-0641-482d-b3d2-473d1fd811a5","resolution":{"observed_at":"2026-08-11T15:03:11.124505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19732","last_updated":"2024-12-20T16:19:17Z","snapshot_observed_at":"2026-08-03T16:04:58.991344Z","submitted_at":"2024-10-25T17:59:09Z","title":"Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19732","snapshot_observed_at":"2026-08-11T15:03:10.515704Z","title":"Rethinking visual de pendency in long-context reasoning for large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T15:03:10.515704Z"},"links":{"cited_paper":"/paper/2410.19732","citing_paper":"/paper/2412.11391"},"observation_digest":"sha256:e58c8c79ae03452cc386be726d7c5458f27b541d09ad3176b7d73bbc4135d6de","observation_id":"609e8ad4-1268-4d79-a882-7571ce8c09f2","resolution":{"observed_at":"2026-08-11T15:03:10.515704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:03:11.107275Z","title":"Visual in-context le arning for large vision-language models,","venue":null,"work_id":"b505cd7e-0678-47d4-8e84-fb11f2d3ffdc","year":2024},"citing_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T15:03:10.520540Z"},"links":{"citing_paper":"/paper/2412.11391"},"observation_digest":"sha256:f33eed681b134fa5b064934b4ea15e1f553b00afef396ebf8c843a01a0b139cf","observation_id":"5165f5d6-26ab-4088-baea-38512f4dd074","resolution":{"observed_at":"2026-08-11T15:03:11.111691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-08-11T09:47:06.410749Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-11T15:03:10.525269Z","title":"An introduction to vision- language modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T15:03:10.525269Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2412.11391"},"observation_digest":"sha256:fbb56189aa1cd04421a75afa77b06cb9dce71cb39e1e84a0bb7e8aaed7a25edd","observation_id":"7b85c097-d117-4282-bc78-9a6cf8be69cd","resolution":{"observed_at":"2026-08-11T15:03:10.525269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:03:11.091644Z","title":"Triple sequence generativ e adversarial nets for unsupervised image captioning,","venue":null,"work_id":"3801c90c-27cf-4990-b73b-5df7decf59c0","year":2021},"citing_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T15:03:10.530307Z"},"links":{"citing_paper":"/paper/2412.11391"},"observation_digest":"sha256:d0bae145b5e62b5e13db55b2d6fcff42c314164c368c770a80555aeddb202054","observation_id":"a6ba79b8-b211-4aff-9698-fd29df02bdbe","resolution":{"observed_at":"2026-08-11T15:03:11.097325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10292","last_updated":"2024-10-07T19:13:47Z","snapshot_observed_at":"2026-07-06T18:15:24.541427Z","submitted_at":"2024-05-16T17:50:19Z","title":"Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10292","snapshot_observed_at":"2026-08-11T15:03:10.534778Z","title":"Fine-tuning large vision-language models as decision-making agents via rein forcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T15:03:10.534778Z"},"links":{"cited_paper":"/paper/2405.10292","citing_paper":"/paper/2412.11391"},"observation_digest":"sha256:61381cf9ca7326a005ca402eec1c65f8c96394391ff38d2c5d86065d8b14323f","observation_id":"13e4d032-0556-4830-963c-ac3152413ad6","resolution":{"observed_at":"2026-08-11T15:03:10.534778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:03:10.539315Z","title":"Style-aware contrastive learning for multi-style image captioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T15:03:10.539315Z"},"links":{"citing_paper":"/paper/2412.11391"},"observation_digest":"sha256:364adf1c1fc2117b6b20d42ed0f6a09e975b6b096af1cc01ea25cb047fd7274d","observation_id":"2845fadf-6512-4b6d-a673-60fa1db1973d","resolution":{"observed_at":"2026-08-11T15:03:10.539315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:03:10.544086Z","title":"Sketch storytelling,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T15:03:10.544086Z"},"links":{"citing_paper":"/paper/2412.11391"},"observation_digest":"sha256:b4d8a41caec155578e8d572156e3232ca6c24c6eccdb6294d3646163d9477930","observation_id":"3a129508-079c-4be8-b8be-12d100853811","resolution":{"observed_at":"2026-08-11T15:03:10.544086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-08-11T15:03:10.548291Z","title":"Moe-llava: Mixture of experts for large vision -language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T15:03:10.548291Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2412.11391"},"observation_digest":"sha256:a23c9226cfab961b10a99a6eeeceb7f1049e6db47e5fb63b0edc175682b11f4a","observation_id":"bb20cf11-9596-484d-8e78-98dcd360342c","resolution":{"observed_at":"2026-08-11T15:03:10.548291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","snapshot_observed_at":"2026-08-12T05:43:02.656333Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05261","snapshot_observed_at":"2026-08-11T15:03:10.552828Z","title":"Texthawk2: A large vi sion- language model excels in bilingual OCR and grounding with 16 x fewer tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T15:03:10.552828Z"},"links":{"cited_paper":"/paper/2410.05261","citing_paper":"/paper/2412.11391"},"observation_digest":"sha256:679fa85abbb2cc940c3b34d2df2620c460f7e63bead364984aed46cf189e0db0","observation_id":"6280c8fe-0ba1-4b28-a26b-5b53566389d8","resolution":{"observed_at":"2026-08-11T15:03:10.552828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12801","last_updated":"2024-03-19T15:01:19Z","snapshot_observed_at":"2026-07-06T17:47:02.560132Z","submitted_at":"2024-03-19T15:01:19Z","title":"RelationVLM: Making Large Vision-Language Models Understand Visual Relations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12801","snapshot_observed_at":"2026-08-11T15:03:10.557467Z","title":"Relationvlm: Making large vision-language models unders tand visual relations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T15:03:10.557467Z"},"links":{"cited_paper":"/paper/2403.12801","citing_paper":"/paper/2412.11391"},"observation_digest":"sha256:c7fb41b130a2694c538e3c1e3e2e15c5789fae252e61fbdbcee00aef0a085fbb","observation_id":"cfec1ed5-b8aa-42b3-97f2-4f04d3fbab7c","resolution":{"observed_at":"2026-08-11T15:03:10.557467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:03:11.056395Z","title":"Multimodal event transformer for i mage-guided story ending generation,","venue":null,"work_id":"96e2bac1-0b55-4234-901f-76d99b36b8be","year":2023},"citing_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T15:03:10.561787Z"},"links":{"citing_paper":"/paper/2412.11391"},"observation_digest":"sha256:f7693ef7cf87f930c9c4e95f9371cc28ec4f1903d9a39d322b659302500919cc","observation_id":"df81e3f0-51c2-4e88-8ccf-aa11e3bbb0b7","resolution":{"observed_at":"2026-08-11T15:03:11.061766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:03:11.041661Z","title":"Multimod al large language models: A survey,","venue":null,"work_id":"b47879e5-c967-436f-98b1-451d06195075","year":2023},"citing_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:03:10.565867Z"},"links":{"citing_paper":"/paper/2412.11391"},"observation_digest":"sha256:35a8a3a7a5f34cc8ecf758d74778a33272b2151d5cf129184551461711f19b16","observation_id":"028d54c5-aad0-4a89-a7ed-b0f224fa0b34","resolution":{"observed_at":"2026-08-11T15:03:11.046464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08734","last_updated":"2023-11-15T06:54:44Z","snapshot_observed_at":"2026-08-06T23:57:01.440666Z","submitted_at":"2023-11-15T06:54:44Z","title":"Thread of Thought Unraveling Chaotic Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08734","snapshot_observed_at":"2026-08-11T15:03:10.570064Z","title":"Thread of thought unraveling chaotic contexts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T15:03:10.570064Z"},"links":{"cited_paper":"/paper/2311.08734","citing_paper":"/paper/2412.11391"},"observation_digest":"sha256:475aaea206bec7efe3429b6e0313fe800b2694310b15437f5e34daf036ec616f","observation_id":"2955da0a-9076-4f0e-b18b-bdea223b1209","resolution":{"observed_at":"2026-08-11T15:03:10.570064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-09T21:58:00.683460Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-11T15:03:10.575147Z","title":"Temporalbench: Benchmarking ﬁne-grained temporal under standing for multimodal video models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T15:03:10.575147Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2412.11391"},"observation_digest":"sha256:03a59dbc7e7d98bdafb47d63b30ed9636c0735241fb8a2f92e150bf8545d5303","observation_id":"bd4773ee-68fa-4ec1-8340-d4322bef8daa","resolution":{"observed_at":"2026-08-11T15:03:10.575147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18478","last_updated":"2026-06-10T12:39:23Z","snapshot_observed_at":"2026-07-06T19:23:11.128586Z","submitted_at":"2024-09-27T06:37:47Z","title":"Temporal2Seq: A Unified Framework for Temporal Video Understanding Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18478","snapshot_observed_at":"2026-08-11T15:03:10.581269Z","title":"Temporal2seq: A uniﬁed f ramework for temporal video understanding tasks,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T15:03:10.581269Z"},"links":{"cited_paper":"/paper/2409.18478","citing_paper":"/paper/2412.11391"},"observation_digest":"sha256:901add715f6d932558da418c27360aa622f4c71b7c7aff42b06ebad553c963be","observation_id":"83b130a2-be03-470a-953b-9dcad23c942c","resolution":{"observed_at":"2026-08-11T15:03:10.581269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:03:10.591551Z","title":"TESTA: temporal-spatial token aggregation for long-form video-l anguage understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T15:03:10.591551Z"},"links":{"citing_paper":"/paper/2412.11391"},"observation_digest":"sha256:1bde4f3791792553b80486f36e4a23367ee6dc6294917bf125abd6c3b03e419c","observation_id":"51f9acce-d756-4f12-b611-3ee2ed4b045a","resolution":{"observed_at":"2026-08-11T15:03:10.591551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:03:11.025707Z","title":"Electrophysiological responses i n the ventral temporal cortex during reading of numerals and calculation ,","venue":null,"work_id":"0a5ceaea-6117-42d1-bdc2-b00e61c2458a","year":2017},"citing_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T15:03:10.596776Z"},"links":{"citing_paper":"/paper/2412.11391"},"observation_digest":"sha256:80d6ac4f381fec7d4b933ad92884312786bfe0f0248a1ff38e96968762badd4f","observation_id":"ea147321-d0f4-4ff8-8735-cbc5263c3825","resolution":{"observed_at":"2026-08-11T15:03:11.031554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18211","last_updated":"2024-11-27T10:45:40Z","snapshot_observed_at":"2026-08-12T11:22:17.935650Z","submitted_at":"2024-11-27T10:45:40Z","title":"TimeMarker: A Versatile Video-LLM for Long and Short Video Understanding with Superior Temporal Localization Ability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18211","snapshot_observed_at":"2026-08-11T15:03:10.601232Z","title":"Timemarker: A versatile video-llm for long and short video understanding with super ior temporal localization ability,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T15:03:10.601232Z"},"links":{"cited_paper":"/paper/2411.18211","citing_paper":"/paper/2412.11391"},"observation_digest":"sha256:b40daaca786aa88ef78fdaf6f7b5875694c43c8379ecd2b20912535c68ef9266","observation_id":"e421dcfb-d0e2-4719-8a6b-74238e67754a","resolution":{"observed_at":"2026-08-11T15:03:10.601232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:03:10.605001Z","title":"Enhancing video-language representations with structur al spatio- temporal alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T15:03:10.605001Z"},"links":{"citing_paper":"/paper/2412.11391"},"observation_digest":"sha256:e31aff9362c8bf4f5de6afb792b29b4f5598bec7a0803f0398a6e7b6e779d123","observation_id":"cb7e6470-1192-4b0f-92d1-2a9f66ea954f","resolution":{"observed_at":"2026-08-11T15:03:10.605001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08071","last_updated":"2023-03-13T13:55:30Z","snapshot_observed_at":"2026-08-12T11:11:15.889734Z","submitted_at":"2022-01-20T09:10:20Z","title":"Temporal Sentence Grounding in Videos: A Survey and Future Directions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08071","snapshot_observed_at":"2026-08-11T15:03:10.608963Z","title":"The elements of temporal sentence grounding in videos: A survey and futur e directions,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T15:03:10.608963Z"},"links":{"cited_paper":"/paper/2201.08071","citing_paper":"/paper/2412.11391"},"observation_digest":"sha256:4f33e0cb9b5381fe65267010423264b396acbd5b2601100c8176d855d57d6e7a","observation_id":"6649c21a-592f-445a-b08e-a77b3f96058c","resolution":{"observed_at":"2026-08-11T15:03:10.608963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01863","last_updated":"2025-03-05T16:27:57Z","snapshot_observed_at":"2026-08-10T05:36:16.206955Z","submitted_at":"2024-06-04T00:30:37Z","title":"Towards Effective Time-Aware Language Representation: Exploring Enhanced Temporal Understanding in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01863","snapshot_observed_at":"2026-08-11T15:03:10.613345Z","title":"Towards effective time- aware language representation: Exploring enhanced temporal und erstanding in language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T15:03:10.613345Z"},"links":{"cited_paper":"/paper/2406.01863","citing_paper":"/paper/2412.11391"},"observation_digest":"sha256:f64206ba18edb8360727b928852a8c7ac786b0e2968fe5e6c2728e10e32139c0","observation_id":"ced600e6-8623-4ccf-81d1-c6fb5dabc37c","resolution":{"observed_at":"2026-08-11T15:03:10.613345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06166","last_updated":"2024-10-08T16:10:29Z","snapshot_observed_at":"2026-08-07T05:06:22.564018Z","submitted_at":"2024-10-08T16:10:29Z","title":"Temporal Reasoning Transfer from Text to Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06166","snapshot_observed_at":"2026-08-11T15:03:10.621431Z","title":"Temporal reasoning transfer from text to video,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T15:03:10.621431Z"},"links":{"cited_paper":"/paper/2410.06166","citing_paper":"/paper/2412.11391"},"observation_digest":"sha256:48d9b57bd42968a5f2311217a562452270aa842f02170f10f1da6add34c55efc","observation_id":"c32036d5-1ebe-4b68-b961-09da0f4f71f6","resolution":{"observed_at":"2026-08-11T15:03:10.621431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18478","last_updated":"2026-06-10T12:39:23Z","snapshot_observed_at":"2026-07-06T19:23:11.128586Z","submitted_at":"2024-09-27T06:37:47Z","title":"Temporal2Seq: A Unified Framework for Temporal Video Understanding Tasks","version":2},"cited_work":{"arxiv_id":"2409.18478","doi":"10.48550/arxiv.2409.18478","metadata_source":"pith","pith_arxiv_id":"2409.18478","snapshot_observed_at":"2026-08-11T18:16:15.004306Z","title":"Temporal2Seq: A Unified Framework for Temporal Video Understanding Tasks","venue":"cs.CV","work_id":"58d7a918-3dec-4c5d-8aa3-c5a0b255a851","year":2024},"citing_paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T15:03:10.586265Z"},"links":{"cited_paper":"/paper/2409.18478","citing_paper":"/paper/2412.11391"},"observation_digest":"sha256:8020adce607cd2b22a298727eba03d8165c2251380a78f50a3d340ef007c1919","observation_id":"ebd473bb-d232-4b56-9282-6d7b0b9e27b6","resolution":{"observed_at":"2026-08-11T15:03:10.709172Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.11391","last_updated":"2024-12-16T02:37:58Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T14:56:51.979372Z","submitted_at":"2024-12-16T02:37:58Z","title":"Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 2 inbound Pith citation observations for arXiv:2412.11391."}