{"as_of":"2026-08-04T10:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:85b59dc787d537828b8cb48f2d14602b707a0983551328c77845384289d68f31","coverage":[{"denominator":109,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T00:37:31.858728Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T02:10:27.595446Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-12T02:11:15.529838Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"cited_work":{"arxiv_id":"2604.21718","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.21718","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Building a Precise Video Language with Human-AI Oversight","venue":"cs.CV","work_id":"913cad0e-93fc-480b-bdc5-08ae164d8cdb","year":2026},"citing_paper":{"arxiv_id":"2605.09433","last_updated":"2026-05-10T09:13:40Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T09:13:40Z","title":"Offline Preference Optimization for Rectified Flow with Noise-Tracked Pairs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T02:10:27.595446Z"},"links":{"cited_paper":"/paper/2604.21718","citing_paper":"/paper/2605.09433"},"observation_digest":"sha256:9a8fac587b7a27ab087f34c7f5080b9886b3c07b72bbe521c2f0fb7691def868","observation_id":"0deed888-ebdf-4f65-b6a6-ab5d3db5e0b2","resolution":{"observed_at":"2026-05-12T02:11:15.531611Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.21718/citation-record","integrity":"/paper/2604.21718/integrity","json":"/paper/2604.21718/citation-record.json","paper":"/paper/2604.21718"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":"2408.11791","doi":"10.48550/arxiv.2408.11791","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Critique-out-loud reward models","venue":null,"work_id":"adbb5d79-de43-49c4-abd5-ad004e77abea","year":2024},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:99cc28403e2c58f8874b5b0a759edc3ba60fc97e99c60a42d81085b79af18c9d","observation_id":"e9eedcf7-ea0e-4e25-a36b-53136ad5baff","resolution":{"observed_at":"2026-05-11T13:46:04.566261Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cycle consistency as reward: Learning image-text alignment without human preferences","venue":null,"work_id":"e29b9d83-dc80-42dc-9b03-cf4da3a90d61","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:45ab3fbee04732e0458c967d406b7033af121426852462afb7c10f338bf55715","observation_id":"a15b36a9-931e-4aae-af9e-b21bc85e7a8c","resolution":{"observed_at":"2026-05-23T10:57:53.594783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-11T01:17:45.013705Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:e8bbc068654bd3c7731bc66aba3bde1002ae56d9261cac1b3f3859e9435783a6","observation_id":"06f4607a-d2a0-41d7-9c47-5a6e580fd043","resolution":{"observed_at":"2026-05-11T13:46:04.578883Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving image generation with better captions.https://cdn.openai","venue":null,"work_id":"4670fdbe-5ec0-429f-bf7f-b8f04aec288d","year":2023},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:3371e9fb5026caa3bcc33b8dd61be4951db671e91920b6433dc2fd9634f1e190","observation_id":"ec221864-2935-4a42-aa07-75563e7a935b","resolution":{"observed_at":"2026-05-23T10:57:53.762533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.03540","last_updated":"2022-11-11T20:17:18Z","snapshot_observed_at":"2026-07-06T14:15:17.474527Z","submitted_at":"2022-11-04T17:03:49Z","title":"Measuring Progress on Scalable Oversight for Large Language Models","version":2},"cited_work":{"arxiv_id":"2211.03540","doi":"10.48550/arxiv.2211.03540","metadata_source":"pith","pith_arxiv_id":"2211.03540","snapshot_observed_at":"2026-07-10T18:37:31.166799Z","title":"Measuring Progress on Scalable Oversight for Large Language Models","venue":"cs.HC","work_id":"e7f92eb1-2050-4e60-bc27-82c94d7694c5","year":2022},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2211.03540","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:0520cd63b869de857165418d79873cd11f137baa7d84fb208634e39c237d6466","observation_id":"50419c15-4d9e-43c2-949d-5d1335d125af","resolution":{"observed_at":"2026-05-17T15:01:41.422297Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-07-06T21:50:55.182461Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"cited_work":{"arxiv_id":"2507.01368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01368","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Activation reward models for few-shot model alignment","venue":null,"work_id":"db3a0e4f-5eeb-4e1a-abe6-6e203f8fc277","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2507.01368","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:921751f0a51bf807549a026934a93368a8e4bf1ca365f9e2a5d7ae079ddef14e","observation_id":"c697a69a-b83f-45aa-8222-9158dc93e9e7","resolution":{"observed_at":"2026-05-11T13:46:04.573192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-07-06T19:27:25.061335Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":"2410.03051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-07-04T15:09:54.928668Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":"3c75ba15-49f8-4ea3-87a8-6c357f825176","year":2024},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:ac32b62bddaa62fd4264daa0c976af46de164324ca8df56fa6744ae5aa29d1b6","observation_id":"9fdf966d-545e-41f9-a686-acde1a8d4700","resolution":{"observed_at":"2026-05-11T13:46:04.576239Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.26555","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:40:00.935896Z","title":"Agneet Chatterjee, Rahim Entezari, Maksym Zhuravinskyi, Maksim Lapin, Reshinth Adithyan, Amit Raj, Chitta Baral, Yezhou Yang, and Varun Jampani","venue":null,"work_id":"d9a989f2-39d7-4b02-a845-8c4dc9ae8de5","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:bff163e8040add2b3db12d91c7b2fea6975401a82521e7181707406d3a697fca","observation_id":"31541708-eb04-487d-9adf-4426ebe3b289","resolution":{"observed_at":"2026-05-11T13:46:04.581628Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How people use chatgpt","venue":null,"work_id":"e6429db7-4d8d-4d67-903d-73ec5cd4d3a3","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:5136ba0312d52360be5d4ccdbe2ac169f6b78ab43b08ab02c0b482ad39b4a6bc","observation_id":"c00a7c3a-e33c-4d74-beb9-b97b8187c1d4","resolution":{"observed_at":"2026-05-23T10:57:53.622035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2506.13585","doi":"10.1109/tkde.2022.3168611","metadata_source":"pith","pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","venue":"cs.CL","work_id":"c59fbe20-f41e-4140-a81c-40a12e7e8364","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:2560a4640b41f63e406d716c09d4ca528f2b4698b660f10aefee7c6b1826bb37","observation_id":"d81cc469-82bb-4da0-ba32-304f0a53c70f","resolution":{"observed_at":"2026-05-12T09:28:16.586976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13074","last_updated":"2025-04-21T10:34:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T16:37:27Z","title":"SkyReels-V2: Infinite-length Film Generative Model","version":3},"cited_work":{"arxiv_id":"2504.13074","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.13074","snapshot_observed_at":"2026-07-10T01:46:41.058772Z","title":"SkyReels-V2: Infinite-length Film Generative Model","venue":"cs.CV","work_id":"2ce11350-273e-4f0d-ae78-292aa3151060","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2504.13074","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:c0ae0322cc59037ef3eb7beea83f22d2695d8ad13d7db03d960e3bff5a447fce","observation_id":"1b03c787-31d2-4f1f-ab7c-09ba1e959249","resolution":{"observed_at":"2026-05-14T20:23:04.486750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sharegpt4video: Improving video understanding and generation with better captions.Advances in Neural Information Processing Systems, 37:19472–19495","venue":null,"work_id":"fdd39249-4f61-408e-87d8-294ba92e6a0a","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:8abc1abf0004d22478be16b756a88337029af30b3eea85b9096db0c6750cc1aa","observation_id":"8d6fb856-8573-444f-8a44-1678397164f0","resolution":{"observed_at":"2026-05-23T10:57:53.606384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Panda-70m: Captioning 70m videos with multiple cross- modality teachers","venue":null,"work_id":"e3899ff7-b21f-401a-906b-65c42d5cbeb6","year":2024},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:e315c9f1654a01e0ac45a7af55c3523767b43f1188979373519003394b4388cd","observation_id":"c5d467a7-3f64-48a8-8920-ed7d4b1e35a8","resolution":{"observed_at":"2026-05-23T10:57:53.742056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dress: Instructing large vision-language models to align and interact with humans via natural lan- guage feedback","venue":null,"work_id":"8a890cd6-24f3-455d-9f38-4fe6902f0f43","year":2024},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:48ee2cee62976e7abd9107c751d881ff0d5444fd93149862c22960148e78e163","observation_id":"0e9efa01-f19c-43b2-af33-481834f54bb4","resolution":{"observed_at":"2026-05-23T10:57:53.746356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-01T20:25:06.490113Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":"2504.13180","doi":"10.48550/arxiv.2504.13180","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":null,"work_id":"e81d25ef-bd13-473f-8fc5-0cf3dc3af528","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:e92cc922cb66c43ebe5a8d27834a71ec281bd941f37625d02799b4451a21da58","observation_id":"90b75ce0-2758-4e5f-b709-91725c335095","resolution":{"observed_at":"2026-05-11T13:46:04.390564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:a364316235b3986f595343fdcb280fe38f99bfb692971c47bff684d51f044f69","observation_id":"401c45f7-e49b-406c-bab4-dd2801b4cc3f","resolution":{"observed_at":"2026-05-11T13:46:04.491750Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.00835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Synpo: Synergizing descriptiveness and preference optimization for video detailed captioning","venue":null,"work_id":"b77bf67f-ba04-4e0c-b981-730c8495664e","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:d3eeff1fad86538a7c35e5cd688b3694cd1ff1bc5566d532f725268c22125446","observation_id":"1d78293f-a1b4-4659-b132-aec9bab34279","resolution":{"observed_at":"2026-05-11T13:46:04.488544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ties mat- ter: Meta-evaluating modern metrics with pairwise accuracy and tie calibration","venue":null,"work_id":"e90f3199-22cc-4957-866b-306500adc5f8","year":2023},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:52cd1665a4ea6cc1e8eb64f13465c33b705207b1a5011dbc2241aeb8deb4d1a1","observation_id":"a6a72b4d-aad8-4f9e-a7fb-06cdb0c0d91c","resolution":{"observed_at":"2026-05-23T10:57:53.750340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.01674","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:19:47.482370Z","title":"Mo- tionsight: Boosting fine-grained motion understanding in multimodal llms","venue":null,"work_id":"b1c00f0f-c893-4d42-8592-2f8136497c17","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:5c559f492506ef978926ba3df8d2cb1e5d1ca61001334438f1f49282ea87a6d0","observation_id":"ed2839be-4249-4b15-8cd0-bcfac256da9c","resolution":{"observed_at":"2026-05-11T13:46:04.474762Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving clip training with language rewrites","venue":null,"work_id":"0a38eab5-0f2e-4173-a3b3-1af7f27b9020","year":2023},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:c8fb045adab96d4c5706e8d7bea141989ef24e19afcb11a4c25e422d5fb5af19","observation_id":"1a3dc349-b33e-4776-859b-94bd6403d8a1","resolution":{"observed_at":"2026-05-23T10:57:53.766452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07631","last_updated":"2025-06-09T10:57:26Z","snapshot_observed_at":"2026-07-06T21:38:59.043196Z","submitted_at":"2025-06-09T10:57:26Z","title":"Unblocking Fine-Grained Evaluation of Detailed Captions: An Explaining AutoRater and Critic-and-Revise Pipeline","version":1},"cited_work":{"arxiv_id":"2506.07631","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07631","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Un- blocking fine-grained evaluation of detailed captions: An explaining autorater and critic-and-revise pipeline","venue":null,"work_id":"39ae64c5-a0d9-497f-958e-b5d27987b97b","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2506.07631","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:f632a06fa44c8f2e85733ba9e4c6cf80bef544c5f78f72a5397eeb8f10cd830c","observation_id":"2e6f6cf1-5234-48f3-8b61-d07c1bd0f19d","resolution":{"observed_at":"2026-05-11T13:46:04.497600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:50a6b3a0e282c01fb2a9d273eeca8b153a7b31e9245918740835abacf50187e8","observation_id":"1e91b538-f976-4b34-a3de-f53d3bdf5476","resolution":{"observed_at":"2026-05-11T13:46:04.444596Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Captioning images taken by people who are blind","venue":null,"work_id":"2cb0f217-c89c-4303-8598-dd714d87fa64","year":2020},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:c7fc919d2752b52846f2edab1dcb3ac016ead1cee0d7a25e007989a914edf431","observation_id":"4eab8fb4-88dc-4e4d-a727-82e952cacafe","resolution":{"observed_at":"2026-05-23T10:57:53.610019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Miradata: A large-scale video dataset with long durations and structured captions.Advances in Neural Information Processing Systems, 37:48955–48970","venue":null,"work_id":"7de85e56-000d-4d89-b757-5fe59fdd4538","year":2024},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:ff4853a1caee9d4f2e996e0c46a356bc3a13e8d47606cf7ce464665d3cf8431d","observation_id":"d8a87605-6d4d-45aa-8f76-c29c9c799c21","resolution":{"observed_at":"2026-05-23T10:57:53.629694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-07-06T21:30:42.185904Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"cited_work":{"arxiv_id":"2505.20124","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20124","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tuna: Comprehensive fine-grained temporal understanding evaluation on dense dynamic videos","venue":null,"work_id":"bd5ebac4-eb10-44a4-a280-08c6e10954ef","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2505.20124","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:cc16e4bdb0db7f91d28eda1d9b4dd96272219d001770c822845d97e36a0b95d9","observation_id":"4a43f467-6b72-4538-8332-b8e9ab49a570","resolution":{"observed_at":"2026-05-11T13:46:04.355382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dense-captioning events in videos","venue":null,"work_id":"f06c4c96-f52a-41c7-9acd-e5a3dff8eb03","year":2017},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:fe2a4224f0475a2475c38adbe90f522a751061415bb8d55b87e48c125adecc66","observation_id":"d76ca6e1-d434-4986-8296-1874eb0f27f6","resolution":{"observed_at":"2026-05-23T10:57:53.625831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.14096","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videopasta: 7k preference pairs that matter for video-llm alignment","venue":null,"work_id":"2c94291d-842e-4ce6-8a9f-1f8cd4c9502a","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:740aca72d1de85fc165121d3984bfb5cb9ee88bca48e04e51d3415a15be72642","observation_id":"ae0e9b7c-b088-4cc8-b11e-3f19f7350c8d","resolution":{"observed_at":"2026-05-11T13:46:04.362744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21268","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:29:57.255855Z","title":"Mmr1: Enhancing multimodal reasoning with variance-aware sampling and open resources","venue":null,"work_id":"ab34c4ee-e920-4745-ba3f-3cac237082a2","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:7a10fe6c98533aa0d884347e2bae29045bc908d8622b215736773208ed70a995","observation_id":"116576c4-bd88-43ba-8753-b4f5db295734","resolution":{"observed_at":"2026-05-11T13:46:04.449001Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluating and improving compositional text-to-visual generation","venue":null,"work_id":"5427bea8-b11d-4835-a8a6-87a80d5dbc8e","year":2024},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:91152a6047b74430b35cd81c815ecfec26b25d1e9de4452dbc7af318d557f073","observation_id":"ac5efaae-6185-4e1b-870f-79d132f06187","resolution":{"observed_at":"2026-05-23T10:57:53.738018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Naturalbench: Evalu- ating vision-language models on natural adversarial samples","venue":null,"work_id":"9eb462f4-2069-4299-b6a4-9cad5c940f53","year":2024},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:ae1248ef266bc12e775e572d3f81b2a794680f35a5ca0b02b991f5fcd50bbbac","observation_id":"bc7a5f59-65ab-48d1-8a02-19a18dca9090","resolution":{"observed_at":"2026-05-23T10:57:53.618555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fire: A dataset for feedback integration and refinement evalu- ation of multimodal models.Advances in Neural Information Processing Systems, 37:101618–101640","venue":null,"work_id":"0ab52c81-01af-43c0-9e15-d5288fa36899","year":2024},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:0c9b0a309ea019b0293ccb3cd748f66bf03322d4737351b9b4138aaf9c78d0b7","observation_id":"d56732cd-baac-4ee8-89e9-ba0e76b85cfc","resolution":{"observed_at":"2026-05-23T10:57:53.659959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16072","last_updated":"2025-04-22T17:51:41Z","snapshot_observed_at":"2026-07-06T21:13:09.093282Z","submitted_at":"2025-04-22T17:51:41Z","title":"Describe Anything: Detailed Localized Image and Video Captioning","version":1},"cited_work":{"arxiv_id":"2504.16072","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.16072","snapshot_observed_at":"2026-07-07T16:03:57.317950Z","title":"Describe anything: Detailed localized image and video captioning.ArXiv, abs/2504.16072","venue":"cs.CV","work_id":"855b8d4f-6054-459d-8a73-40538eb946ac","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2504.16072","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:c3ed4d14e7cd9877ca819be92a203ce1d99f15296015601180dedf5d4d280a55","observation_id":"1da19f52-9a29-4949-acb7-04330ab36821","resolution":{"observed_at":"2026-05-11T13:46:04.395869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodality helps unimodality: Cross- modal few-shot learning with multimodal models","venue":null,"work_id":"9a18464b-1b5a-4848-a8b0-be86265714da","year":2023},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:a22547ed00462c73b673507f96b0959db2db2748e534536d734c2ca6813e604c","observation_id":"b5f31781-152d-4b68-9fe1-3bff1c292f0c","resolution":{"observed_at":"2026-05-23T10:57:53.614146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01879","last_updated":"2024-05-15T07:15:05Z","snapshot_observed_at":"2026-07-06T15:37:23.958419Z","submitted_at":"2023-06-02T19:19:43Z","title":"Revisiting the Role of Language Priors in Vision-Language Models","version":4},"cited_work":{"arxiv_id":"2306.01879","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.01879","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2306.01879 , year =","venue":null,"work_id":"f0169c48-9cfc-469a-b88f-5d8912aec5f4","year":null},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2306.01879","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:729524e89c656dd64c29c1af103ccdca22da550bf7e58367bcf5fa20b3b4c8e4","observation_id":"ed0e9454-7441-4148-89dd-c43c9464f95d","resolution":{"observed_at":"2026-05-11T13:46:04.507451Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":"2404.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-07-08T05:54:33.534825Z","title":"Evaluating text-to-visual generation with image-to-text models.preprint","venue":"cs.CV","work_id":"f52d17a0-d6dd-4514-beb8-49201dfe0e89","year":2024},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:e8500bf2387bcc6047a3719e25ca81252fac45ff555114d07c17e06c81097394","observation_id":"610a4531-40be-463b-9e7c-4064aefe9996","resolution":{"observed_at":"2026-05-11T13:46:04.455477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards un- derstanding camera motions in any video","venue":null,"work_id":"3ae1ed50-eee2-4bc7-b11b-ff59d321a9db","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:a11b6e479f633b606455f7ddacd40e073a5be221545e48bef8a131ac5ccb34c2","observation_id":"d78503c1-5dde-4e15-bf05-6da70b76daa8","resolution":{"observed_at":"2026-05-23T10:57:53.754022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05950","last_updated":"2024-05-14T03:20:42Z","snapshot_observed_at":"2026-08-03T16:34:14.242126Z","submitted_at":"2023-09-12T04:03:41Z","title":"Language Models as Black-Box Optimizers for Vision-Language Models","version":5},"cited_work":{"arxiv_id":"2309.05950","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05950","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models as black-box optimizers for vision-language models","venue":null,"work_id":"6d768f91-528a-4ce3-b81c-70c207d7a6fc","year":2023},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2309.05950","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:555d4f58cad38ff51867a2df723af09d909977c36e8e916767446cecaef42659","observation_id":"02e83265-309d-4208-9ee6-014d57a575ba","resolution":{"observed_at":"2026-05-11T13:46:04.380042Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.02495","doi":"10.48550/arxiv.2504.02495","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Inference-time scaling for generalist reward modeling","venue":null,"work_id":"be1aa439-dad2-4f1c-b107-a8c1d5a94e91","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:f3806dff5f811d549e179f655f799539f74de66b4c17930d7b95eb1f5a855716","observation_id":"920dda8b-60d4-4540-ae58-5e2bcc7c36d2","resolution":{"observed_at":"2026-05-11T13:46:04.366143Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.14914","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T16:14:53.362875Z","title":"Liu, C.-W","venue":null,"work_id":"0e60e07e-7a36-407f-8e7e-d69a5a87b05e","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:0c94e1446da71ad907eb1e4a8bd16fa057d102c005f3edfa53db899089556416","observation_id":"0ced2900-fdf0-48fe-bf91-46c0cb81480e","resolution":{"observed_at":"2026-05-11T13:46:04.458720Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.12720","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:19:47.960326Z","title":"Omni-captioner: Data pipeline, mod- els, and benchmark for omni detailed perception","venue":null,"work_id":"45c714fa-2889-45f5-8032-5201e7b58b2d","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:15e3bcfd1707b9e7d24a1e7d68971e747683d885776893f0ed0edfe253fddb68","observation_id":"aaae4784-7ddb-47e9-b285-17460b58f9c0","resolution":{"observed_at":"2026-05-11T13:46:04.423071Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-refine: It- erative refinement with self-feedback.Advances in Neural Information Processing Systems, 36:46534–46594","venue":null,"work_id":"8fa1513f-1ced-4c66-8437-af369980faa2","year":2023},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:34cc19d8a0fa4612f8163cf3603fe6f18ed02252d9e706047288971fd074c6be","observation_id":"555fbe6a-3994-4b86-8d91-31d91fd74cb3","resolution":{"observed_at":"2026-05-23T10:57:53.640879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Native language pro- motes access to visual consciousness.Psychological Science, 29(11):1757–1772","venue":null,"work_id":"77b56a98-4527-4374-8532-d008839b91a2","year":2018},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:ff48d61753b9f837557c13eaa7902fb3a137cad0eab02ba276face611f9a8976","observation_id":"b357e0b2-48e4-4405-bdae-47f7827693cb","resolution":{"observed_at":"2026-05-23T10:57:53.584261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":"2407.00215","doi":"10.48550/arxiv.2407.00215","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"LLM Critics Help Catch LLM Bugs","venue":null,"work_id":"e730c1aa-4c9b-48f3-923b-47ddc0a4e6d8","year":2024},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:6312866ba1e27fdbee0d51917e0ba4a25e90dc043f82185d05658e597cfd28cb","observation_id":"a5806370-9914-4158-9a1a-0b5fc8847c67","resolution":{"observed_at":"2026-05-11T13:46:04.557005Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-07-06T21:35:03.439393Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"cited_work":{"arxiv_id":"2506.01725","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01725","snapshot_observed_at":"2026-07-04T17:40:00.934274Z","title":"Videocap-r1: Enhancing mllms for video captioning via structured thinking","venue":null,"work_id":"cad9c21e-f29f-40a6-affe-ab87ea23cffe","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2506.01725","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:999358e442e77a1182458d39f16182f6daa72032e632558e1c32cf7c18c7202b","observation_id":"36e73833-b17f-49e4-9a20-48e792f14e45","resolution":{"observed_at":"2026-05-11T13:46:04.484250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enhancing few- shot vision-language classification with large multimodal model features","venue":null,"work_id":"e7eb2244-c63e-42ad-9f30-fdc46a511820","year":null},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:aef5cad163ac2265b5d422e4a9c0d8ee9b0bac0f658aa4c7e657b548da63cd43","observation_id":"642668d0-5545-4f39-b802-9518ff0dcce8","resolution":{"observed_at":"2026-05-23T10:57:53.703165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language can shape the perception of oriented objects","venue":null,"work_id":"4551d5ea-7f3d-4f14-8d88-f0781c41ca2e","year":2020},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:a0acdcffe7d8d953cf162b394ebd9fbe4a7e649c98176d57abcea1499dc35b43","observation_id":"d0ecbb6b-09db-4cb7-b11d-87f97e9d8521","resolution":{"observed_at":"2026-05-23T10:57:53.652518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Docci: De- scriptions of connected and contrasting images","venue":null,"work_id":"763eb4af-de25-490a-9c90-1424261dd522","year":null},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:17eb8dd4b25ff829a0141d4fe956f26671517211d6f8a897f5ab8286a40ddb53","observation_id":"c91a6621-de1f-48c0-8eb9-48ac08e1dac3","resolution":{"observed_at":"2026-05-23T10:57:53.730074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:ffcc08384911e20e20fc7b8cf798a3b555fa971eeb1648db70b2e47ad086f95f","observation_id":"cce94aa3-61de-4abd-bcf8-78fd22ff39a1","resolution":{"observed_at":"2026-05-11T13:46:04.494657Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training language models to follow instructions with human feedback.Advances in Neural Information Processing Systems, 35:27730–27744","venue":null,"work_id":"a9d349a5-4c36-4ab9-b06b-24d1ad240e21","year":null},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:128df91df8c89ae6653b6b73622d582965c26f4a4ae3ef58b337f207735f59c1","observation_id":"fab64950-2ef3-416f-8252-261540142da0","resolution":{"observed_at":"2026-05-23T10:57:53.722707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12425","last_updated":"2024-05-22T16:29:58Z","snapshot_observed_at":"2026-07-06T17:19:08.136109Z","submitted_at":"2024-01-23T01:25:00Z","title":"The Neglected Tails in Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2401.12425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.12425","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The neglected tails of vision-language models","venue":null,"work_id":"c7865779-036e-4903-bb16-79b4379dd14e","year":2024},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2401.12425","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:e1db9bb3d3c139ac97d7cc0aab2a0bf3045dad5179f68d8fa220d499a3424749","observation_id":"09d4df88-1d67-471a-bf52-5a46939c7e47","resolution":{"observed_at":"2026-05-11T13:46:04.553346Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Direct prefer- ence optimization: Your language model is secretly a reward model.Advances in neural information processing systems, 36:53728–53741","venue":null,"work_id":"74e6b06d-d37e-400a-a18c-c17bd0e03b1e","year":2023},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:1319291b20de93656b0cf7a620096aa1b32cdcec071bfa3d97bc4565422d5f78","observation_id":"6a627dc3-bee6-48ab-98de-cd8fc0408b04","resolution":{"observed_at":"2026-05-23T10:57:53.637352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Moodio: Making anyone a professional video studio","venue":null,"work_id":"c628848f-f5e4-45e0-ade1-fb96b2fd4969","year":2026},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:cce7189281fba81fdd8349ed1357d8cb5e5b1abec04c4e6b4dfb2735cb30a615","observation_id":"43039de7-bff4-4315-9231-b565572fde46","resolution":{"observed_at":"2026-05-23T10:57:53.633332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.05802","last_updated":"2022-06-14T01:16:24Z","snapshot_observed_at":"2026-07-06T13:19:58.934755Z","submitted_at":"2022-06-12T17:40:53Z","title":"Self-critiquing models for assisting human evaluators","version":2},"cited_work":{"arxiv_id":"2206.05802","doi":"10.48550/arxiv.2206.05802","metadata_source":"pith","pith_arxiv_id":"2206.05802","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Self-critiquing models for assisting human evaluators","venue":"cs.CL","work_id":"3fcefdd1-22ab-4648-a683-cb1555e7a50e","year":2022},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2206.05802","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:1a3273c70761925b70fe7c9783ad66714d97cc1630d674b1b14e4416e6b91dce","observation_id":"abe315a5-7067-4893-ad38-89e05322cd72","resolution":{"observed_at":"2026-05-16T20:25:41.981797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:cad2bca2a0298eaac2ea82d6bdf80b9c392f7d7efd43ee9a943ae0bce04ad329","observation_id":"f404c9b1-1fe6-4cf1-abb8-991087306050","resolution":{"observed_at":"2026-05-11T13:46:04.374998Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transnet v2: An effective deep network architecture for fast shot transition detection","venue":null,"work_id":"fe383251-c34b-4e3e-9735-6a933a10026c","year":2024},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:a2eb6daf56d9ad84b1cf0b8ad9857445833829c1d90fa424638b2a9cab61ab2d","observation_id":"3638098c-5729-459b-afa4-0a1fd9a4fc43","resolution":{"observed_at":"2026-05-23T10:57:53.784433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Univ of California Press","venue":null,"work_id":"02fc916a-65c8-48ac-b8b0-cc1f73c56f62","year":1969},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:8ec176af3baacea3937397106468dbcfb2c3f15d952203e1689bda45fed561b6","observation_id":"3f1654f2-972b-4eba-9820-27121f0a7708","resolution":{"observed_at":"2026-05-23T10:57:53.719004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Going beyond one-size- fits-all image descriptions to satisfy the information wants of people who are blind or have low vision","venue":null,"work_id":"3573ffde-12d6-4741-93a9-6b4c3d2b51dd","year":2021},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:6ee313b900b43c7c9cf179bf464bc36ae9c5eb065a3e363c4e8f44c51bc8792a","observation_id":"1fdf3072-c114-448c-b7b4-a0eaf1dd41b5","resolution":{"observed_at":"2026-05-23T10:57:53.663455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.15220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:49:57.281790Z","title":"video-SALMONN 2: Caption-enhanced audio-visual large language models","venue":null,"work_id":"a6dea8e4-6736-44e5-b9d0-6e036ce7a7c0","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:2c9f213ae37e528d9bb91939fa3a08cd9b13385589017c6c912d2df309977708","observation_id":"a1876222-65cd-496b-a2f7-0b2893d96e6d","resolution":{"observed_at":"2026-05-11T13:46:04.532001Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09927","last_updated":"2025-02-14T05:36:32Z","snapshot_observed_at":"2026-07-06T20:36:26.822412Z","submitted_at":"2025-02-14T05:36:32Z","title":"Granite Vision: a lightweight, open-source multimodal model for enterprise Intelligence","version":1},"cited_work":{"arxiv_id":"2502.09927","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09927","snapshot_observed_at":"2026-07-03T00:37:30.128596Z","title":"arXiv preprint arXiv:2502.09927 , year=","venue":null,"work_id":"91452475-e89a-4a74-911c-a0e4f03f3ca7","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2502.09927","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:a0d3c793c09762ee46ed99b219bdc8c6f02bd07155524d8763153be103032360","observation_id":"7c73f769-4a9d-49d2-aae9-80d07f013e11","resolution":{"observed_at":"2026-05-11T13:46:04.406418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:b0d1c0b430c73cfd696d0c48e40c05e473c5c94464a2849a398d1ea5838133fc","observation_id":"e991aa20-8fa8-414d-8276-9af26d05fb64","resolution":{"observed_at":"2026-05-11T13:46:04.437267Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-07-06T18:39:03.315371Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":"2407.00634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-04T17:40:00.906584Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":"bf38f75f-fbc4-4c6d-ab2a-6e1bcbc38485","year":2024},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:d3a7f2ac07c17e70b6359b7df943bb677a30877a18c81554a933eb4d9b29a7cb","observation_id":"3b876ced-1ea4-4dad-ac02-ba66176a193c","resolution":{"observed_at":"2026-05-11T13:46:04.401243Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.09676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T07:56:04.737468Z","title":"Spatialvid: A large-scale video dataset with spatial annotations.arXiv preprint arXiv:2509.09676, 2025a","venue":null,"work_id":"fa42660a-b999-4c7f-80c9-2b72151c3399","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:a9c937435ccd97e3eb40cf0f8c976b4c3a09c28f773f687e38afa84ef494d75b","observation_id":"7c85acd8-b1ef-479b-8583-72beb5f4d15a","resolution":{"observed_at":"2026-05-11T13:46:04.527564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":"2508.18265","doi":"10.48550/arxiv.2508.18265","metadata_source":"pith","pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","venue":"cs.CV","work_id":"b8f5e260-fff5-444e-bcf5-2c42cfefd83d","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:afc0f64937fed3abc466ef7ce6cd240f67597a577dea9fd271756f2a751d0be5","observation_id":"2ac2a1e3-f852-4bfd-a894-90c20f47c1a1","resolution":{"observed_at":"2026-05-11T13:46:04.471178Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":"2203.11171","doi":"10.1101/2025.04.03.646459","metadata_source":"pith","pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","venue":"cs.CL","work_id":"8c6d5a6b-b5cc-4105-9c84-9c34bb9375bb","year":2022},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:e8a49f6f40566ce11e4776205f5852cc14d7634471b24a915ffa8867c3915cec","observation_id":"17f1de07-8b54-4c5f-8b14-063ac5ec519a","resolution":{"observed_at":"2026-05-11T13:46:04.500300Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07934","last_updated":"2025-05-30T15:53:16Z","snapshot_observed_at":"2026-07-06T21:07:29.062389Z","submitted_at":"2025-04-10T17:49:05Z","title":"SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement","version":3},"cited_work":{"arxiv_id":"2504.07934","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.07934","snapshot_observed_at":"2026-07-04T16:29:57.248099Z","title":"Sota with less: Mcts-guided sample selection for data-efficient visual reasoning self-improvement","venue":null,"work_id":"3af2dc47-c7ba-4654-9a4e-89fdcbfa9bc0","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2504.07934","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:18d9a3ec8043a67cbf2fac6306db9bae2384d8fec9dcfd4a113c40e4b148dbc7","observation_id":"06990ab1-b734-4eab-9a9e-73a7c6db852f","resolution":{"observed_at":"2026-05-11T13:46:04.410651Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17703","last_updated":"2025-03-29T15:21:55Z","snapshot_observed_at":"2026-07-06T20:27:55.860626Z","submitted_at":"2025-01-29T15:20:30Z","title":"Critique Fine-Tuning: Learning to Critique is More Effective than Learning to Imitate","version":4},"cited_work":{"arxiv_id":"2501.17703","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.17703","snapshot_observed_at":"2026-07-08T17:55:20.815322Z","title":"Critique fine-tuning: Learning to critique is more effective than learning to imitate.arXiv preprint arXiv:2501.17703, 2025b","venue":"cs.CL","work_id":"4d553c59-1475-446a-9584-d19f823ffa39","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2501.17703","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:c75108f384f7f7f67733cf5d6c741497c668deb4bc60a661299178bbb30381f6","observation_id":"d92826e6-801a-40ec-8eb5-c169f641af7b","resolution":{"observed_at":"2026-05-11T13:46:04.441298Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07165","last_updated":"2025-04-09T17:59:02Z","snapshot_observed_at":"2026-07-06T21:06:54.998194Z","submitted_at":"2025-04-09T17:59:02Z","title":"Perception in Reflection","version":1},"cited_work":{"arxiv_id":"2504.07165","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.07165","snapshot_observed_at":"2026-07-04T19:30:06.782252Z","title":"Perception in reflection","venue":null,"work_id":"f0edeb30-a645-4bb5-acd3-5fea91b08a59","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2504.07165","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:2fa5b670aca64ecd3a65bcccd41cc579876e7d659a3ae21930825189f74b617c","observation_id":"67b79438-5040-4fcf-bf0e-f45dcbcbc217","resolution":{"observed_at":"2026-05-11T13:46:04.452323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Russian blues reveal effects of language on color discrimination.Proceedings of the national academy of sciences, 104(19):7780–7785","venue":null,"work_id":"a0fba61b-68d4-46aa-82e6-61c2f226138c","year":2007},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:5030258e57b9ba69e02ac360c76b88676e886cbcf582acf7e9eeef59cfa779f4","observation_id":"5b274cdf-a283-410d-8051-6404ee0f3811","resolution":{"observed_at":"2026-05-23T10:57:53.649141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tractatus logico-philosophicus","venue":null,"work_id":"a33901d2-36d7-441d-8e27-04439284e4ac","year":1922},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:b9d4d2b09e83329126346725a1412a8f447422ba0eadaea1478855218951b8d3","observation_id":"6f3619df-454b-4890-9bdd-b361fc6f3df6","resolution":{"observed_at":"2026-05-23T10:57:53.726613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.11336","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T16:38:39.639632Z","title":"UGC-VideoCaptioner : An omni ugc video detail caption model and new benchmarks","venue":null,"work_id":"3c348e09-df51-45d9-aade-df844c77a187","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:0ab910cc2ce82af1527c5f3d54128a9f914e559ddd7f675b888523e1ebe20f40","observation_id":"f4b0ca41-deb5-4562-8a85-b082ccdc5040","resolution":{"observed_at":"2026-05-11T13:46:04.428524Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visco: Benchmarking 12 fine-grained critique and correction towards self-improvement in visual reasoning","venue":null,"work_id":"03b264a7-d4d6-44b8-95d6-a551c41acfad","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:136161e69dc3c59f2c8171a98a7dcbcda3940a55465c5e2e306505a430de9a49","observation_id":"3cc8b25a-e96a-4bff-9df5-1e7b0918f531","resolution":{"observed_at":"2026-05-23T10:57:53.715516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"362a5f74-c578-44db-b0c0-e382b4f5302d","year":2016},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:efaa904f6d293deeec26bf4b296c67c295f8573666ff904cdd68f05360a8504c","observation_id":"986a1ed0-7cae-4c83-9a50-51d8501ef1e2","resolution":{"observed_at":"2026-05-23T10:57:53.644783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13691","last_updated":"2025-06-16T16:52:52Z","snapshot_observed_at":"2026-07-06T21:43:03.415527Z","submitted_at":"2025-06-16T16:52:52Z","title":"UltraVideo: High-Quality UHD Video Dataset with Comprehensive Captions","version":1},"cited_work":{"arxiv_id":"2506.13691","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13691","snapshot_observed_at":"2026-07-03T00:37:29.766378Z","title":"Ultravideo: High-quality uhd video dataset with comprehensive captions","venue":null,"work_id":"f144864c-025a-4d4b-87d7-3ead6d1a80dc","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2506.13691","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:b7154a6f4e870123ebeaca3733452b49c392f4f6aac76c95a5031a5c8e873631","observation_id":"aae24a09-cf0d-4e5a-b627-1f12c7a66bfe","resolution":{"observed_at":"2026-05-11T13:46:04.545079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:40:00.889311Z","title":"Videochat-r1","venue":null,"work_id":"8d2957eb-c24e-46b9-8bef-c978f7c5f0e6","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:9e6290b5e9c37db400d1a202dd337f1ed7ffc3e556e59320455a37271818a253","observation_id":"b6976d6d-24d1-4bf3-8451-2e2fd8e87daf","resolution":{"observed_at":"2026-05-11T13:46:04.515301Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:23aaaa3ed026db5cff64c6b16d2bfc4e4cb895eab5c2d157661bfabc5e03eac1","observation_id":"cdc0f7b5-e307-49ef-99c0-3247e225d0e2","resolution":{"observed_at":"2026-05-11T13:46:04.385125Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-07-06T22:21:48.714597Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Kwai keye-vl 1.5 technical report","venue":null,"work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:ddaba9b0523391181ba2600a9044eed13f6fa016b7fa34818c2b2872b3acf63d","observation_id":"41e5262b-1c59-46c4-a7c8-f586ef0ccd47","resolution":{"observed_at":"2026-05-11T13:46:04.503586Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vript: A video is worth thousands of words.Advances in Neural Information Processing Systems, 37:57240–57261","venue":null,"work_id":"efe0a38c-acd4-4cc0-9a29-a461aa7bfd65","year":2024},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:059a1908318583db65161b8f03d1cf5cc759dedba66a6f817db3e284b1b72fee","observation_id":"c70b1334-2a5e-4107-8010-c0a8cfe02d17","resolution":{"observed_at":"2026-05-23T10:57:53.675429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14191","last_updated":"2025-02-20T01:48:13Z","snapshot_observed_at":"2026-07-06T20:39:33.620222Z","submitted_at":"2025-02-20T01:48:13Z","title":"Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models","version":1},"cited_work":{"arxiv_id":"2502.14191","doi":"10.48550/arxiv.2502.14191","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.14191","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Multimodal rewardbench: Holistic evaluation of reward models for vision language models","venue":null,"work_id":"bc36790d-ed2b-48af-a57b-4a8399efb59a","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2502.14191","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:f0ff5fbe5d397d2caeff1e7632b4a01464f337e5eba7aa2a566520b11126ec4f","observation_id":"0301289b-53ba-42bb-a78a-9253bb63f7ef","resolution":{"observed_at":"2026-05-11T13:46:04.512494Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.15870","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:49:57.263774Z","title":"Omnivinci: Enhancing architecture and data for omni-modal understanding llm","venue":null,"work_id":"6179c0bb-4911-4be4-89c8-a387d39c8459","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:a377b8d219a01975d9035d0f915fa540d79ec69c392a0e964f5e16199446644f","observation_id":"446f8eea-975c-4e69-9a51-32bf8ecbe9a6","resolution":{"observed_at":"2026-05-11T13:46:04.541934Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-11T03:07:50.815080Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:080f06a53ab835a16709f4a5999841fe49b4e84b593ab26adad63df5d994fee8","observation_id":"a0d3fcfe-5e05-4f60-a8bf-6992b3793198","resolution":{"observed_at":"2026-05-11T13:46:04.550286Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback","venue":null,"work_id":"2307083c-e9c6-43d1-ba1e-fec29b24f9c7","year":2024},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:007d51730027592216dd12111da79c9149e0b85f62bcfc85ef9e4a344e9d4c86","observation_id":"b9131628-ea5e-4c0b-a9be-d8164d89402e","resolution":{"observed_at":"2026-05-23T10:57:53.671283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diverse ai feedback for large language model alignment.Transactions of the Association for Computational Linguistics, 13:392–407","venue":null,"work_id":"b9e84710-360c-4554-8aa0-07cfc8ffa989","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:aea3d92b00ee556c8525e11d62ad29304063a5d09764ac5aafb0a78545c1fbc9","observation_id":"470b0ebe-bbbc-4c34-b282-3575218a909c","resolution":{"observed_at":"2026-05-23T10:57:53.707689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16646","last_updated":"2025-02-09T07:53:38Z","snapshot_observed_at":"2026-07-06T19:56:43.637339Z","submitted_at":"2024-11-25T18:28:26Z","title":"Self-Generated Critiques Boost Reward Modeling for Language Models","version":3},"cited_work":{"arxiv_id":"2411.16646","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.16646","snapshot_observed_at":"2026-07-01T12:25:43.079840Z","title":"Self-Generated Critiques Boost Reward Modeling for Language Models","venue":null,"work_id":"35fd66a4-c45a-4002-8ba6-c412520fee56","year":2024},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2411.16646","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:bb9f318d51f4ed77a7a9ad8daff12b15fc9b06dad2a9d1bf6152ac207597f1ea","observation_id":"58c58590-3bd8-48e6-b25b-a0b1448d2c79","resolution":{"observed_at":"2026-05-11T13:46:04.461763Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.00598","last_updated":"2022-05-27T17:52:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-01T17:43:13Z","title":"Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language","version":2},"cited_work":{"arxiv_id":"2204.00598","doi":"10.48550/arxiv.2204.00598","metadata_source":"pith","pith_arxiv_id":"2204.00598","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language","venue":"cs.CV","work_id":"6c2a6dd5-9b0f-4d86-a291-b605ebdfde6c","year":2022},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2204.00598","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:7d7f7360c541d6cb823daa181e1fdebb3c546114c08304d21c802cd25991f681","observation_id":"64567a72-0e1e-4f4b-9842-6764df4e8f78","resolution":{"observed_at":"2026-05-16T09:50:01.041344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Critic-v: Vlm critics help catch vlm errors in multimodal reasoning","venue":null,"work_id":"2ee7fa34-57f3-42d2-9ad4-bae156097553","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:7e83efdc4016c70a65d52674a1343d4a33c14f22de944a5817f9b5a2f93a8d70","observation_id":"1240c1d5-88f3-4bf3-b071-43b958528b03","resolution":{"observed_at":"2026-05-23T10:57:53.679253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01258","last_updated":"2024-04-02T12:47:49Z","snapshot_observed_at":"2026-07-06T17:54:03.923842Z","submitted_at":"2024-04-01T17:28:16Z","title":"Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward","version":2},"cited_work":{"arxiv_id":"2404.01258","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.01258","snapshot_observed_at":"2026-07-03T10:48:02.987489Z","title":"Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward","venue":null,"work_id":"535c0def-a885-4b3e-92ab-cd729cc55a1f","year":2024},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2404.01258","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:3a827ed94b75b0918f5f3d1959f78943a59c018798904f06646ee259147e9e7f","observation_id":"c4bf2f72-1de4-411c-b375-54d1efc47545","resolution":{"observed_at":"2026-05-11T13:46:04.359535Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-07-06T21:32:57.510891Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"cited_work":{"arxiv_id":"2505.23484","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23484","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vcapsbench: A large-scale fine-grained benchmark for video caption quality evaluation","venue":null,"work_id":"54c3bc77-819b-4cb0-82b7-f7884f34c492","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2505.23484","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:dbe9d5a241d784136d77a6502a8408152f39144b44575c153c5d58f24b6bd327","observation_id":"567f4ded-f209-43b9-981a-2df0fcec0af6","resolution":{"observed_at":"2026-05-11T13:46:04.547812Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-07-06T20:36:45.378436Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"cited_work":{"arxiv_id":"2502.10391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10391","snapshot_observed_at":"2026-07-03T04:27:37.082400Z","title":"Mm-rlhf: The next step forward in multimodal llm alignment","venue":null,"work_id":"2340ee70-ebab-4848-a408-9945d419b322","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2502.10391","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:04ce54a90cc43b513442b3fa6d3d0347be068d03e71efef5f0b8cca05d6d524c","observation_id":"dd93ae88-6690-4b52-b09e-642ad95b154e","resolution":{"observed_at":"2026-05-11T13:46:04.467982Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18411","last_updated":"2025-03-01T03:09:28Z","snapshot_observed_at":"2026-07-06T20:42:33.518153Z","submitted_at":"2025-02-25T18:05:14Z","title":"OmniAlign-V: Towards Enhanced Alignment of MLLMs with Human Preference","version":2},"cited_work":{"arxiv_id":"2502.18411","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18411","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Omnialign-v: To- wards enhanced alignment of mllms with human preference","venue":null,"work_id":"01ea1f1a-1f54-4995-b809-4e56caf1892f","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2502.18411","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:c171db753ec70ccfbc8d6989eac20bdf6a75db43fa36c3137783d65c7dc41fae","observation_id":"59e1817f-572d-48ce-b27c-881f952ef19c","resolution":{"observed_at":"2026-05-11T13:46:04.414865Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18634","last_updated":"2025-08-27T03:53:24Z","snapshot_observed_at":"2026-07-06T22:18:40.868747Z","submitted_at":"2025-08-26T03:18:34Z","title":"OwlCap: Harmonizing Motion-Detail for Video Captioning via HMD-270K and Caption Set Equivalence Reward","version":2},"cited_work":{"arxiv_id":"2508.18634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18634","snapshot_observed_at":"2026-07-03T16:38:39.639869Z","title":"describe the subject, background, mo- tion, and camera in detail","venue":null,"work_id":"aa7808c8-b0d6-456e-8680-7e5b982823f8","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2508.18634","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:d34505c78827411d8aa40fc754e2159c2b620d4adb686378fc403661e07db89e","observation_id":"642faeba-3ec0-4052-a2a4-953c14d80d2d","resolution":{"observed_at":"2026-05-11T13:46:04.477814Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"bird’s-eye view","venue":null,"work_id":"d6ff7d82-fe8b-41ca-937c-d3c7627643ed","year":null},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:da360cfd370e7710dbcce96daf572389543ccb3bac9eff011712503ed9c8f969","observation_id":"ba0644b0-a956-4225-9c19-6a4fc48eabad","resolution":{"observed_at":"2026-05-23T10:57:53.682997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Roughly one sentence may need addition, modification, or deletion","venue":null,"work_id":"2033ef43-fc42-47f4-9b46-1a15f0a963f1","year":null},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:b90cf572a4d3743a7b034c2ae4854e09eb1362a9d68946f755b5ac38440badef","observation_id":"fe87bb66-a9f6-41aa-aae5-bf6fb200a33f","resolution":{"observed_at":"2026-05-23T10:57:53.691451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c4a6894f-04a3-4fa3-b9c5-7613b9adbe28","year":null},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:48bce1f1f9353b95429485423c910cb25c8e167f37e6d919e86160782138a146","observation_id":"77b4effc-78f4-44a0-8048-dcce58e74724","resolution":{"observed_at":"2026-05-23T10:57:53.777110Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c57c9c5d-0449-4a91-a855-13b5ba019467","year":null},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:fa00727ae5ee9413f58fea11c6c0308fdd3572f094d2c7ff81a232505fc0a0f7","observation_id":"f1bef335-57cd-4d22-b89d-6447275cb736","resolution":{"observed_at":"2026-05-23T10:57:53.780646Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"conveying changes in actions, behaviors, environments, states and attributes of objects, and camera movements between adjacent frames","venue":null,"work_id":"32610b0c-b008-43c8-af8a-a1e685d88830","year":2016},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:6f5ba944ab67af6c56162b8601505503318eed7cf2b6afa24c71e2deebc86454","observation_id":"94537efb-c622-4f5c-82cc-d70971f8815c","resolution":{"observed_at":"2026-05-23T10:57:53.687474Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e2acbf3e-b404-4ce8-9e4b-ad51d49508d1","year":null},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:3bab55ec59a31a12166c5802979ff976bbe61f60809fdf1b3a699978bb00aca8","observation_id":"48330530-902c-4040-b965-af0d8c596305","resolution":{"observed_at":"2026-05-23T10:57:53.602156Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"50dcf789-3a7d-4a42-a09f-09e2bffbaa65","year":null},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:c588a0960c25d41a3e348999c23cc933b080acb8e15e852b23934eb2300236db","observation_id":"8f109f96-40cd-453e-be17-b4d4c78d26c5","resolution":{"observed_at":"2026-05-23T10:57:53.711652Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"78d7fc35-8bbf-4778-8a70-f5342aabc8df","year":null},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:73c2aa9a81f9577984892fa18a3beaf84c811fe1ba25e3cdc8b3de502b9d74d6","observation_id":"57f7b7a2-bcb2-414d-8bb9-bdb056cc7933","resolution":{"observed_at":"2026-05-23T10:57:53.656327Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b6fbe98a-1636-4877-af76-0ca26b9a79ac","year":null},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:97b1bf91d3fd167edbe1f5e184fe3ce84084f821e5588c6b03c15683dd49e7a3","observation_id":"5611d61e-26f7-413a-9b26-6e87c13383c8","resolution":{"observed_at":"2026-05-23T10:57:53.733996Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b20130d7-fdbe-4b6d-8259-8867fb9852be","year":null},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:deb18f78654e226e1f67fea105fa8eff5ec20f40046883b615e0cbfe83dec600","observation_id":"0b17e300-459f-46b3-8ac2-73fb3146fc98","resolution":{"observed_at":"2026-05-23T10:57:53.787950Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":7,"verified_exact":53,"verified_fuzzy":37},"total_outbound_references":109},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 100 of 109 outbound references and 1 inbound Pith citation observation for arXiv:2604.21718."}