{"as_of":"2026-08-09T05:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9c0f22021fa91a7352031c8658b97860de5cea75c54e26d2122c1855a3b267a1","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:40:57.860880Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:29:11.589395Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T17:40:00.934274Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01725","snapshot_observed_at":"2026-08-05T20:29:11.589395Z","title":"Meng et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-07T18:23:08.889281Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":292,"source":"arxiv_source","source_observed_at":"2026-08-05T20:29:11.589395Z"},"links":{"cited_paper":"/paper/2506.01725","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:c1ad76290ce3b7d4b64e7241803c263cdf390593241446bddb59e6fc77fbdd01","observation_id":"e5b183dd-b5a6-4e41-9796-1db3ffebe5ec","resolution":{"observed_at":"2026-08-05T20:29:11.589395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"cited_work":{"arxiv_id":"2506.01725","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01725","snapshot_observed_at":"2026-07-04T17:40:00.934274Z","title":"Videocap-r1: Enhancing mllms for video captioning via structured thinking","venue":null,"work_id":"cad9c21e-f29f-40a6-affe-ab87ea23cffe","year":2025},"citing_paper":{"arxiv_id":"2511.11113","last_updated":"2026-04-20T07:37:36Z","snapshot_observed_at":"2026-07-31T14:35:45.739240Z","submitted_at":"2025-11-14T09:42:42Z","title":"VIDEOP2R: Video Understanding from Perception to Reasoning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-17T22:24:41.760120Z"},"links":{"cited_paper":"/paper/2506.01725","citing_paper":"/paper/2511.11113"},"observation_digest":"sha256:afec25710968c07a0c1582ee60b8a544127da8ee3a11f12714e3f5c706946964","observation_id":"4ff98ddf-19d9-4d22-a939-46b89e999320","resolution":{"observed_at":"2026-05-17T22:25:22.561845Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"cited_work":{"arxiv_id":"2506.01725","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01725","snapshot_observed_at":"2026-07-04T17:40:00.934274Z","title":"Videocap-r1: Enhancing mllms for video captioning via structured thinking","venue":null,"work_id":"cad9c21e-f29f-40a6-affe-ab87ea23cffe","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2506.01725","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:2ba9b57ec7da3038d2967a405092888052e2b1174b93b0d25547e83efefaf557","observation_id":"36e73833-b17f-49e4-9a20-48e792f14e45","resolution":{"observed_at":"2026-05-11T13:46:04.484250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"cited_work":{"arxiv_id":"2506.01725","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01725","snapshot_observed_at":"2026-07-04T17:40:00.934274Z","title":"Videocap-r1: Enhancing mllms for video captioning via structured thinking","venue":null,"work_id":"cad9c21e-f29f-40a6-affe-ab87ea23cffe","year":2025},"citing_paper":{"arxiv_id":"2605.28023","last_updated":"2026-05-27T06:27:04Z","snapshot_observed_at":"2026-08-02T21:20:31.316522Z","submitted_at":"2026-05-27T06:27:04Z","title":"VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T13:13:57.599970Z"},"links":{"cited_paper":"/paper/2506.01725","citing_paper":"/paper/2605.28023"},"observation_digest":"sha256:593f68da6d443a0c58ae782fd49208b881cbdf37966bf3bcd52fc1e72fe4fa24","observation_id":"ef22b1aa-0882-4abb-b11b-72a052fbcb76","resolution":{"observed_at":"2026-06-29T13:23:28.493845Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"cited_work":{"arxiv_id":"2506.01725","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01725","snapshot_observed_at":"2026-07-04T17:40:00.934274Z","title":"Videocap-r1: Enhancing mllms for video captioning via structured thinking","venue":null,"work_id":"cad9c21e-f29f-40a6-affe-ab87ea23cffe","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2506.01725","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:4e94d2195163d836c0d94bccfbc576089f6f4a59541e7766dd869dcf9f565d0b","observation_id":"c8439cfd-3612-4e2a-a1f4-fcd335241947","resolution":{"observed_at":"2026-07-02T17:27:15.755390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"cited_work":{"arxiv_id":"2506.01725","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01725","snapshot_observed_at":"2026-07-04T17:40:00.934274Z","title":"Videocap-r1: Enhancing mllms for video captioning via structured thinking","venue":null,"work_id":"cad9c21e-f29f-40a6-affe-ab87ea23cffe","year":2025},"citing_paper":{"arxiv_id":"2606.24636","last_updated":"2026-06-23T14:29:40Z","snapshot_observed_at":"2026-08-07T23:34:44.066451Z","submitted_at":"2026-06-23T14:29:40Z","title":"CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-25T23:29:24.520537Z"},"links":{"cited_paper":"/paper/2506.01725","citing_paper":"/paper/2606.24636"},"observation_digest":"sha256:dd2eb7bc7e7effa7dfe1090b45c26a1fb1f14c49f730d91c1a10000636b67858","observation_id":"b6a4f68f-becd-49ee-a3bc-6334f5766267","resolution":{"observed_at":"2026-07-04T17:40:00.935800Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"cited_work":{"arxiv_id":"2506.01725","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01725","snapshot_observed_at":"2026-07-04T17:40:00.934274Z","title":"Videocap-r1: Enhancing mllms for video captioning via structured thinking","venue":null,"work_id":"cad9c21e-f29f-40a6-affe-ab87ea23cffe","year":2025},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":194,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2506.01725","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:d5be0d949cf45c5b24d44f223dd7a57257b330fd111dab13447ca5b7a60eaac3","observation_id":"9066af67-d826-4a5c-b0d1-5ef885e470a5","resolution":{"observed_at":"2026-07-04T15:09:54.942635Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01725","snapshot_observed_at":"2026-08-02T01:27:22.196718Z","title":"Videocap-r1: Enhancing mllms for video captioning via structured thinking.arXiv preprint arXiv:2506.01725, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14681","last_updated":"2026-07-16T07:43:27Z","snapshot_observed_at":"2026-08-06T12:57:36.194341Z","submitted_at":"2026-07-16T07:43:27Z","title":"ReBind: Multi-Reference Video Editing via Structured Instructions with Explicit Reference Relationships","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:22.196718Z"},"links":{"cited_paper":"/paper/2506.01725","citing_paper":"/paper/2607.14681"},"observation_digest":"sha256:1fafcd9d3d1f6f7d80d6ef8377509c87be15f975cbf077547ad6c82c23780f53","observation_id":"b32ac67e-4cd7-421b-a1e9-b83d10d18411","resolution":{"observed_at":"2026-08-02T01:27:22.196718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01725","snapshot_observed_at":"2026-08-01T10:02:03.207694Z","title":"Videocap-r1: Enhancing mllms for video captioning via structured thinking.CoRR, abs/2506.01725, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20389","last_updated":"2026-07-22T17:17:33Z","snapshot_observed_at":"2026-08-07T12:38:32.377959Z","submitted_at":"2026-07-22T17:17:33Z","title":"PercepCap: Video Captioner with Structured Spatio-Temporal Perception","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T10:02:03.207694Z"},"links":{"cited_paper":"/paper/2506.01725","citing_paper":"/paper/2607.20389"},"observation_digest":"sha256:c2fa4c1cec6a613f9343a74585c43d58a810c3363e418721e27eb8d910492b6f","observation_id":"32461e25-5782-49b6-a010-1cc41b265953","resolution":{"observed_at":"2026-08-01T10:02:03.207694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01725/citation-record","integrity":"/paper/2506.01725/integrity","json":"/paper/2506.01725/citation-record.json","paper":"/paper/2506.01725"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T11:39:54.001986Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:54.001986Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:a91ce976e990a299083f54cd966b2656f0a886690205886f3e5d9064b6095db7","observation_id":"a15c7f71-a533-4b6f-90c3-a2dca39bc095","resolution":{"observed_at":"2026-08-07T11:39:54.001986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:08.019749Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:08.019749Z"},"links":{"citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:c1c7c4e9d52e9a828a4c627d2d62dba4fe42501fec2ab362152c4711ec4bbbde","observation_id":"be9052c9-8e93-4861-a699-4f87d8bb6797","resolution":{"observed_at":"2026-08-07T11:40:08.019749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:59.463259Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":"7ac2bad2-7863-4896-9d02-80b9847325ed","year":null},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:08.047640Z"},"links":{"citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:5ea0ef235107615e02b4006ab74452ae6b4a67a1a1db9594d55c099243ef46f5","observation_id":"b9c0c257-e40d-4a50-9b57-4793d2ddcc92","resolution":{"observed_at":"2026-08-07T11:40:59.563025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:09.643118Z","title":"M3-embedding: Multi-linguality, multi-functionality, multi-granularity text embeddings through self-knowledge dis- tillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:09.643118Z"},"links":{"citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:9dcd14a0252a03301b7b02f5e31755014628d543c9ff1541aea8b91dbb91d342","observation_id":"87d10cb7-bbce-4570-894c-48ea936d37e7","resolution":{"observed_at":"2026-08-07T11:40:09.643118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-07T11:40:09.778162Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:09.778162Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:6a9fd046bb02fbf82b5d4bddc49da325ec79f213499534d2b478feb8896cebc4","observation_id":"2ef9d158-91d2-4043-b920-430cefab504d","resolution":{"observed_at":"2026-08-07T11:40:09.778162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T11:40:09.868692Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:09.868692Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:4c710e91aa281c7e20de14b4d42e407d1bbc25df29e6f1269fe158ff7d026107","observation_id":"03135c81-6c8b-4354-b373-5950dd5531e4","resolution":{"observed_at":"2026-08-07T11:40:09.868692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-07T11:40:09.908851Z","title":"Video-r1: Reinforcing video reasoning in mllms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:09.908851Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:d5050ad8ab6a0c9b5b914163135ab35b53b7ef54144971345c630e623b861042","observation_id":"eb22eed1-3201-432c-9962-4d3ab340b08f","resolution":{"observed_at":"2026-08-07T11:40:09.908851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T11:40:09.939333Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:09.939333Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:032b0a182a275a63361b48dd5b17e66cf5101b240558494a890f359f641a3745","observation_id":"41784efd-54cd-4147-bb3a-2519b8b8319b","resolution":{"observed_at":"2026-08-07T11:40:09.939333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:59.251928Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":"f5c272b9-f49b-40a9-85d2-a6d466ba428c","year":2017},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:10.032618Z"},"links":{"citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:1388a6c8827662ec811c86c9614891d5d923ab0b3cc8153e037fa66ec9bcaa96","observation_id":"83d9c79d-4ff8-4bf6-a9f4-4936233864b4","resolution":{"observed_at":"2026-08-07T11:40:59.301041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:59.217254Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":"cd288e47-f36a-41eb-b497-70790b3ab5bc","year":2023},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:11.502809Z"},"links":{"citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:15087351796c8f8fbbe97098fe2740a846ab1633196a40e1e573fb9b3843dbd7","observation_id":"02ca2843-d1a7-4209-ba52-dea0399d67e4","resolution":{"observed_at":"2026-08-07T11:40:59.223294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T11:40:11.701653Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:11.701653Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:0871ebb2d5ea199386b07091ef9a500bdee561b44779d2c9f31dbb466f561399","observation_id":"7c245ae2-6d72-4855-8bec-7c8f7ad09bc5","resolution":{"observed_at":"2026-08-07T11:40:11.701653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10300","last_updated":"2025-02-05T09:57:59Z","snapshot_observed_at":"2026-07-06T17:03:56.263404Z","submitted_at":"2023-12-16T03:17:30Z","title":"Shot2Story: A New Benchmark for Comprehensive Understanding of Multi-shot Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10300","snapshot_observed_at":"2026-08-07T11:40:11.807797Z","title":"Shot2story20k: A new benchmark for comprehensive understanding of multi-shot videos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:11.807797Z"},"links":{"cited_paper":"/paper/2312.10300","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:cc417bcf5b5e1212f63047457c769fb9cfdc42f7a729e16120ab83f3aea81e32","observation_id":"5eead944-f033-4430-97d5-61140c8c3ef9","resolution":{"observed_at":"2026-08-07T11:40:11.807797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T11:40:11.883387Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:11.883387Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:4e0285d180529079b0c6927f61688394963847391d39fb9be0456bef098497a0","observation_id":"68037354-34b0-40c7-954e-572ffe521b97","resolution":{"observed_at":"2026-08-07T11:40:11.883387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13826","snapshot_observed_at":"2026-08-07T11:40:11.956199Z","title":"Video-mmmu: Evaluating knowledge acquisition from multi-discipline professional videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:11.956199Z"},"links":{"cited_paper":"/paper/2501.13826","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:40a650b1774f84601e9468a3bb4df93b4d35dec77c6b6cbe77aaa308494fc7ec","observation_id":"5a3b0e9d-49b5-48eb-889e-a442eaca222c","resolution":{"observed_at":"2026-08-07T11:40:11.956199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T11:40:11.978948Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:11.978948Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:799e5e6ed61e1d39dad45bf180b1ddcfbe0d2da398f86760bff606d7fa466325","observation_id":"903b84b7-4c7b-4e9a-ba12-15ed97a07435","resolution":{"observed_at":"2026-08-07T11:40:11.978948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T11:40:11.995527Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:11.995527Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:ff163893a217bf23ee7c6fc18b735a476ee3a13ac35ca915d39f985070cb8b90","observation_id":"9b7bb67e-93e3-4e1f-9da3-d259de55f54a","resolution":{"observed_at":"2026-08-07T11:40:11.995527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-07T11:40:12.012820Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:12.012820Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:9916149ecc46ea75a6484889ce59c1c08d704d93c0a3e4bcf1c55c470332460a","observation_id":"8c2b9347-9f47-422d-8df5-d5a7eaa3ad00","resolution":{"observed_at":"2026-08-07T11:40:12.012820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:59.133250Z","title":"A shortest augmenting path algorithm for dense and sparse linear assignment problems","venue":null,"work_id":"4e61d859-bce5-443a-878d-b45973bb0e1e","year":1988},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:12.037643Z"},"links":{"citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:9c0d0062abaa9986a54f6151009a901a4344f9fad40794cf277b1a5439fe8c92","observation_id":"ff83fa10-ffe1-48b6-9b70-6a8e139e6a8c","resolution":{"observed_at":"2026-08-07T11:40:59.184267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T11:40:12.061896Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:12.061896Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:3ce3dd0c71be198612cc6fc9b0158ae9776dfb5cddb2d2a285443c39cb3df18f","observation_id":"3210f0e7-20a3-4d2f-9319-37e1bc1b2cad","resolution":{"observed_at":"2026-08-07T11:40:12.061896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:59.008144Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":"a0725bcf-690c-4e0c-a9be-e08351d0c43d","year":2024},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:12.097371Z"},"links":{"citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:c9157bf6190a245589481d8bd4bb9119062282002e675ed14f7487f100f087c9","observation_id":"64cd84fb-ff43-4cac-9c69-120eafb54e01","resolution":{"observed_at":"2026-08-07T11:40:59.084921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T11:40:12.120821Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:12.120821Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:51185ae248ca2a221f45d6c9d56468e6e0e07209c09992f1dbb150200594179d","observation_id":"00491f7a-f816-44ec-89d2-873dd68e7f75","resolution":{"observed_at":"2026-08-07T11:40:12.120821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:12.167318Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:12.167318Z"},"links":{"citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:936212c2f050bb2dc800963a9dffe75bbe9cdb4e71df3525fa51deb9a60959f2","observation_id":"e54b9f27-0590-4e6d-b7d4-57ac29bbd53b","resolution":{"observed_at":"2026-08-07T11:40:12.167318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T11:40:12.227193Z","title":"Visual-rft: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:12.227193Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:e312b26c9c3acba92d6cbb034c90c8e0b5804c902f56a3c1baf3399219d208b5","observation_id":"e962be59-6051-4662-b6ca-b4f3a45d3b9e","resolution":{"observed_at":"2026-08-07T11:40:12.227193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T11:40:12.317088Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:12.317088Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:bbc94dd6a0f7ec09c5ec7668f1cfd3b1008b2ef4f6f573f586a53b5bcc880cc6","observation_id":"929c53b7-30e9-4924-bd77-7fa1adf09ad0","resolution":{"observed_at":"2026-08-07T11:40:12.317088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-09T01:06:58.674891Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-07T11:40:23.084340Z","title":"Mm-eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:23.084340Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:a1d2e477231ae4175b7bba2da327c31d302dc987798017c3eb1e538424316126","observation_id":"463aad97-165e-47ee-95e4-5c492569d533","resolution":{"observed_at":"2026-08-07T11:40:23.084340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:58.816900Z","title":"Introducing gemini 2.0: our new ai model for the agentic era, 2024","venue":null,"work_id":"af6279d1-cfec-4494-be6d-caef824a0236","year":2024},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:23.398842Z"},"links":{"citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:77b96048a08a032b5eefd83e6cda1d9c819fcaf9b5c0bcdfa03782f1a23a76aa","observation_id":"c097e315-49c3-4fed-a816-21edd16b6721","resolution":{"observed_at":"2026-08-07T11:40:58.900706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T11:40:23.659852Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:23.659852Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:3040ba664f4684888cdc2c660fdec0233059cb653e2ced43c5ca49abfed2eabe","observation_id":"69971c8d-693e-4318-ba6c-b3316bc9db5f","resolution":{"observed_at":"2026-08-07T11:40:23.659852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T11:40:24.131641Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:24.131641Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:6958b93936a1a25068f49eb331225c6e291f4a84dd134dde801a78ae577aaccb","observation_id":"f77a72e1-7acc-4f7a-a6fb-89a92ca927ce","resolution":{"observed_at":"2026-08-07T11:40:24.131641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T11:40:31.437137Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:31.437137Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:2d00d1ac8ba8b6e8ea952ce351ebe308f51c2fd1d6ca8ce1f304dc7299c6f087","observation_id":"9e13b280-d600-4202-a8e2-37e22e721598","resolution":{"observed_at":"2026-08-07T11:40:31.437137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T11:40:32.880469Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:32.880469Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:8c3644f5c802cede2b3771dfaeca341301a14a79996c7b8723b4d1008cf74c74","observation_id":"ecbc943e-6897-4c25-9e4d-093006c3b49f","resolution":{"observed_at":"2026-08-07T11:40:32.880469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T11:40:34.931386Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:34.931386Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:fca7b08a1b590e94299b7bae9172c827fafd24cf1aaf041e047e36fa31b19a5c","observation_id":"077385f6-de87-4489-81d0-4e9c4156c2e3","resolution":{"observed_at":"2026-08-07T11:40:34.931386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06186","last_updated":"2025-01-10T18:59:51Z","snapshot_observed_at":"2026-07-06T20:19:26.003822Z","submitted_at":"2025-01-10T18:59:51Z","title":"LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06186","snapshot_observed_at":"2026-08-07T11:40:35.727219Z","title":"Llamav-o1: Rethinking step-by-step visual reasoning in llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:35.727219Z"},"links":{"cited_paper":"/paper/2501.06186","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:610b6565ffdeccfd5e6848c26c0a9a18809739a5af8664117f0a49c932cc741c","observation_id":"ce95458a-a9b4-41d5-8105-9a804e398998","resolution":{"observed_at":"2026-08-07T11:40:35.727219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-07T00:13:25.095002Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-07T11:40:35.885400Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:35.885400Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:7acfc25c3863c257b27abeb77a5c09406c61af64c9cebe129b2d6ee5590000ce","observation_id":"c314e2d9-ad47-490c-a7b0-549e292d25e3","resolution":{"observed_at":"2026-08-07T11:40:35.885400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T11:40:35.947370Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:35.947370Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:4a1d17b780d60b9112f8e353b30fc32f8d7833cec493d3ec0dad9387eb8ba39d","observation_id":"835dc834-d0d0-4557-bfba-38afbae77af2","resolution":{"observed_at":"2026-08-07T11:40:35.947370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-07T11:40:36.023507Z","title":"Timezero: Temporal video grounding with reasoning-guided lvlm","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:36.023507Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:c43a089a78f93597ddd213d2f556d29a2411f86eedbd3ea5a2f53282d1b7b50d","observation_id":"c1befbf9-e216-4ae7-bb19-6a771e49d146","resolution":{"observed_at":"2026-08-07T11:40:36.023507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-07T11:40:36.060722Z","title":"Llava-o1: Let vision language models reason step-by-step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:36.060722Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:50089ce40d44dc75ce30a259347ab936e4281ddf20f9e58eb52d9f8374679203","observation_id":"7be61c09-24ad-45a7-95ff-96a0817528a3","resolution":{"observed_at":"2026-08-07T11:40:36.060722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00513","last_updated":"2025-03-18T16:01:24Z","snapshot_observed_at":"2026-07-06T20:15:13.182552Z","submitted_at":"2024-12-31T15:53:50Z","title":"CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00513","snapshot_observed_at":"2026-08-07T11:40:45.357734Z","title":"Fine-grained video-text retrieval: A new benchmark and method","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:45.357734Z"},"links":{"cited_paper":"/paper/2501.00513","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:9735e0c6cfe11fdda18e7491a61f850ec31609f41fc4371713ddb3d5554365e8","observation_id":"c42b6749-3580-4a62-b6eb-d81860a6ce66","resolution":{"observed_at":"2026-08-07T11:40:45.357734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T11:40:53.234744Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:53.234744Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:602736759540a84546d187350d0da9fca56256cfa5ad84262d459cd8d364f252","observation_id":"84cb20a6-1314-4606-881c-7b4d6619932a","resolution":{"observed_at":"2026-08-07T11:40:53.234744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:58.668979Z","title":"Vript: A video is worth thousands of words","venue":null,"work_id":"262b3402-7d1d-413f-b804-89482ba96b71","year":2024},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:54.882956Z"},"links":{"citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:3dd36bb50bed9a0c648456492ab3f7e548b4cc6102004d9f943f9e5f1ab5f562","observation_id":"e19a02cd-8847-4a5b-b60b-5160165c8c7f","resolution":{"observed_at":"2026-08-07T11:40:58.725983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-07T11:40:55.543904Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces.arXiv preprint arXiv:2412.14171, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:55.543904Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:07add2854a04b7c1bda01cdb984c1c0f58c9620828f8dd725f47e30a0c3cd518","observation_id":"cfe4d595-bfd2-4502-834d-9b58e82f605a","resolution":{"observed_at":"2026-08-07T11:40:55.543904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18319","last_updated":"2024-12-31T07:41:30Z","snapshot_observed_at":"2026-08-08T00:04:35.299538Z","submitted_at":"2024-12-24T10:07:51Z","title":"Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18319","snapshot_observed_at":"2026-08-07T11:40:55.873734Z","title":"Mulberry: Empowering mllm with o1-like reasoning and reflection via collective monte carlo tree search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:55.873734Z"},"links":{"cited_paper":"/paper/2412.18319","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:a4aef8a45c8a0759eac551b0b210118024c4811944a1a8629d9da5d62d6e823a","observation_id":"11382a79-e212-483d-acee-0e4633d8e18a","resolution":{"observed_at":"2026-08-07T11:40:55.873734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:55.915232Z","title":"Modeling context in referring expressions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:55.915232Z"},"links":{"citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:bf6aeec72355d6b2147e864ade4fb444279c51c8c03123c21aa1f91496a88223","observation_id":"b38cb08a-7b3d-4787-9fca-3455a433d275","resolution":{"observed_at":"2026-08-07T11:40:55.915232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-07-06T20:20:47.146343Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-07T11:40:55.923555Z","title":"Tarsier2: Advancing large vision-language models from detailed video description to comprehensive video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:55.923555Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:af13f95b578b0286bc569a9cd6ae537add8c26cdd40010a1816f4a178236188a","observation_id":"71e9c9c5-ee26-4ec7-af1a-7aa1e7509853","resolution":{"observed_at":"2026-08-07T11:40:55.923555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:58.546703Z","title":"7b model and 8k examples: Emerging reasoning with reinforcement learning is both effective and efficient","venue":null,"work_id":"c97d30aa-1059-4878-8420-43e8348bb7b8","year":2025},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:55.953394Z"},"links":{"citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:9fd073f0cec0697179dc2da5a253e3400d2f72daeb172879aed3493d15a88e3a","observation_id":"02b25c7c-7ad1-44a4-891f-fc297f035177","resolution":{"observed_at":"2026-08-07T11:40:58.644904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:56.019147Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision, pages 169–186","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:56.019147Z"},"links":{"citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:1b6db512217dad9a9885b1eea1ad8eba77f1a63f7aee0150c42964f36b64ced2","observation_id":"b58ff38f-0a06-422c-942e-7381f7305b9d","resolution":{"observed_at":"2026-08-07T11:40:56.019147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16198","last_updated":"2024-10-21T17:00:06Z","snapshot_observed_at":"2026-08-08T03:30:51.616377Z","submitted_at":"2024-10-21T17:00:06Z","title":"Improve Vision Language Model Chain-of-thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16198","snapshot_observed_at":"2026-08-07T11:40:57.064569Z","title":"Improve vision language model chain-of-thought reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:57.064569Z"},"links":{"cited_paper":"/paper/2410.16198","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:e41efa37f8cf5b17491136d1e2d5ba59c9c9fedac9cd18e82d1f2e86f07d5f28","observation_id":"f26bff47-1afe-46bf-aed8-1efb8589414e","resolution":{"observed_at":"2026-08-07T11:40:57.064569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T11:40:57.687621Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:57.687621Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:7a44ba16756fae67ece561d70d5e6325ec83ae373d5a19b7e1b186d19c38748d","observation_id":"19ab9372-e3a4-457d-8ffd-1ef64bb7114f","resolution":{"observed_at":"2026-08-07T11:40:57.687621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05379","last_updated":"2025-03-10T07:11:14Z","snapshot_observed_at":"2026-08-07T21:57:26.595540Z","submitted_at":"2025-03-07T12:46:42Z","title":"R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05379","snapshot_observed_at":"2026-08-07T11:40:57.733558Z","title":"R1-omni: Explainable omni-multimodal emotion recognition with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:57.733558Z"},"links":{"cited_paper":"/paper/2503.05379","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:d703b65c10f7532df2ba50118330f7c22496f8a8934ce426da75c74890b9f389","observation_id":"bfc7a347-b255-43b6-97df-b3e9738fef0d","resolution":{"observed_at":"2026-08-07T11:40:57.733558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-08-07T11:40:57.775507Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:57.775507Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:d4fe8fa2a69fe89024bfc77abaa723f32ac57f0dc51b299aa3087a65293115d4","observation_id":"568a8494-8f7a-48f4-b86c-3834ef178039","resolution":{"observed_at":"2026-08-07T11:40:57.775507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05517","last_updated":"2025-05-19T06:50:53Z","snapshot_observed_at":"2026-08-05T14:11:37.629456Z","submitted_at":"2024-08-10T11:00:13Z","title":"SWIFT:A Scalable lightWeight Infrastructure for Fine-Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05517","snapshot_observed_at":"2026-08-07T11:40:57.810477Z","title":"Swift:a scalable lightweight infrastructure for fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:57.810477Z"},"links":{"cited_paper":"/paper/2408.05517","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:13aa00f5b9ca08c21637e9620b725d08f96927a78bf8edae56f00a50135601ab","observation_id":"c016390e-52e4-4925-aa35-151145ec6a97","resolution":{"observed_at":"2026-08-07T11:40:57.810477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05132","last_updated":"2025-03-10T01:52:08Z","snapshot_observed_at":"2026-07-06T20:48:18.268075Z","submitted_at":"2025-03-07T04:21:47Z","title":"R1-Zero's \"Aha Moment\" in Visual Reasoning on a 2B Non-SFT Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05132","snapshot_observed_at":"2026-08-07T11:40:57.860880Z","title":"aha moment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:57.860880Z"},"links":{"cited_paper":"/paper/2503.05132","citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:4f73aa37fd7c1a0032b6230eac3579197872d84d5bbface73a61997d28f041dd","observation_id":"48094e61-f3c6-4174-be5d-b770a4d99ebe","resolution":{"observed_at":"2026-08-07T11:40:57.860880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:59.377180Z","title":null,"venue":null,"work_id":"5c03ced1-6f57-4869-a0eb-fa05903d761d","year":null},"citing_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:09.314893Z"},"links":{"citing_paper":"/paper/2506.01725"},"observation_digest":"sha256:78145e79f74cfc2cf7b842e5b7ed4dc5866dc37e0e86a51f7bc021173d23f4d0","observation_id":"eb5ca7e3-48c9-404b-97c0-cf111daead75","resolution":{"observed_at":"2026-08-07T11:40:59.416096Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 9 inbound Pith citation observations for arXiv:2506.01725."}