{"as_of":"2026-08-07T16:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c79b430036d2fc77de6f734ef45fd67b0c6ef25c1163fccf64fd942f30b23543","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:26:47.320450Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T02:11:48.455492Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T08:17:45.840937Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"cited_work":{"arxiv_id":"2506.07971","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07971","snapshot_observed_at":"2026-07-03T08:17:45.840937Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding.arXiv preprint arXiv:2506.07971, 2025","venue":null,"work_id":"e071dfb1-d529-4453-a51c-aa0401f03ea3","year":2025},"citing_paper":{"arxiv_id":"2606.06294","last_updated":"2026-06-21T07:27:04Z","snapshot_observed_at":"2026-08-04T09:48:32.503414Z","submitted_at":"2026-06-04T15:31:22Z","title":"Towards One-to-Many Temporal Grounding","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-28T02:11:48.455492Z"},"links":{"cited_paper":"/paper/2506.07971","citing_paper":"/paper/2606.06294"},"observation_digest":"sha256:21d064af554f560b2a0ae1a1018fa1433eb8a07bbca0c4a8eb9c69ed916384a2","observation_id":"eae3f730-7ef9-40ac-8040-03d74213e13a","resolution":{"observed_at":"2026-07-02T12:16:57.682594Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"cited_work":{"arxiv_id":"2506.07971","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07971","snapshot_observed_at":"2026-07-03T08:17:45.840937Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding.arXiv preprint arXiv:2506.07971, 2025","venue":null,"work_id":"e071dfb1-d529-4453-a51c-aa0401f03ea3","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":229,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2506.07971","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:e0c5f1732f45d0d17890d76185cbd99e37533285e0c5cb4c25634e640fd9bc39","observation_id":"74dd834b-6366-4786-b43c-4902ac52591b","resolution":{"observed_at":"2026-07-02T17:27:15.514528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"cited_work":{"arxiv_id":"2506.07971","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07971","snapshot_observed_at":"2026-07-03T08:17:45.840937Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding.arXiv preprint arXiv:2506.07971, 2025","venue":null,"work_id":"e071dfb1-d529-4453-a51c-aa0401f03ea3","year":2025},"citing_paper":{"arxiv_id":"2606.08231","last_updated":"2026-06-06T15:39:29Z","snapshot_observed_at":"2026-07-06T23:47:43.942733Z","submitted_at":"2026-06-06T15:39:29Z","title":"Test-Time Scaling in Multimodal Foundation Models: A Comprehensive Survey of Generation and Reasoning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-27T19:36:57.231932Z"},"links":{"cited_paper":"/paper/2506.07971","citing_paper":"/paper/2606.08231"},"observation_digest":"sha256:464ed15cb718417166eef4f13d4a638d9a65a42cea183bcfd070cedeb430283d","observation_id":"13131be7-d41c-4a63-b60c-6d48758620dd","resolution":{"observed_at":"2026-07-02T21:37:25.298267Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"cited_work":{"arxiv_id":"2506.07971","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07971","snapshot_observed_at":"2026-07-03T08:17:45.840937Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding.arXiv preprint arXiv:2506.07971, 2025","venue":null,"work_id":"e071dfb1-d529-4453-a51c-aa0401f03ea3","year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"cited_paper":"/paper/2506.07971","citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:cae2c7232f341776b248c56267adbedcf183124043b0c187caedb85bc8f86ccc","observation_id":"bec2ef43-3501-4268-ade0-ea680fe68fe0","resolution":{"observed_at":"2026-07-03T08:17:45.842398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07971/citation-record","integrity":"/paper/2506.07971/integrity","json":"/paper/2506.07971/citation-record.json","paper":"/paper/2506.07971"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-07T05:26:46.991810Z","title":"Critique-out-loud reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:46.991810Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:3f559c04ae4d735dd7e6b612aa47048b3f4635c9e978841c66832aa614278271","observation_id":"b7185dab-cc29-44f0-aed7-77af05663516","resolution":{"observed_at":"2026-08-07T05:26:46.991810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:48.513565Z","title":"Claude Team","venue":null,"work_id":"396d1223-7a96-47bf-af0a-902241789584","year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:46.997671Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:82133464299fec2ac8fc4b4c4324d92ffdd5816e338d020d0e68685dcbbc9e2c","observation_id":"5e3845e7-e9b5-42bb-816b-bb375d6c6faf","resolution":{"observed_at":"2026-08-07T05:26:48.518617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:47.003174Z","title":"An introduction to cybernetics","venue":null,"work_id":null,"year":1956},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.003174Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:7165f06bb078082f4c5134e6a86d232bd17003ce7072e316ad10af3173c299d1","observation_id":"e740239e-8ac9-486c-9fa1-c8791206aeee","resolution":{"observed_at":"2026-08-07T05:26:47.003174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T05:26:47.008776Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.008776Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:c1e9c9d2d489f9623108ff210f35ea10f4d65cc5e274baebba0cd113fc10ea0c","observation_id":"2929c73e-7163-4694-b270-508417fda755","resolution":{"observed_at":"2026-08-07T05:26:47.008776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T05:26:47.014066Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.014066Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:74835f55019e227b38d25baf3ce15fabc1f73e2d5cc85047653298b7ee854ad0","observation_id":"c4de9698-e180-4017-8a64-20932ec07567","resolution":{"observed_at":"2026-08-07T05:26:47.014066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09078","last_updated":"2025-04-01T12:48:43Z","snapshot_observed_at":"2026-07-06T20:05:46.205005Z","submitted_at":"2024-12-12T09:01:18Z","title":"Forest-of-Thought: Scaling Test-Time Compute for Enhancing LLM Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09078","snapshot_observed_at":"2026-08-07T05:26:47.019699Z","title":"Forest-of-thought: Scaling test-time compute for enhancing llm reasoning.arXiv preprint arXiv:2412.09078, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.019699Z"},"links":{"cited_paper":"/paper/2412.09078","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:44e19f50fdb519473308e97360f3ad357557129569fd8ac9554a978658279e44","observation_id":"18dedfcc-cf37-4917-9de4-ba0fdaf51c54","resolution":{"observed_at":"2026-08-07T05:26:47.019699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-07T05:26:47.025491Z","title":"Large language monkeys: Scaling inference compute with repeated sampling.arXiv preprint arXiv:2407.21787, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.025491Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:3825a3dc8b8ecc4846b859636a2aedeef977cc726f2ecb335adcacfd802a498b","observation_id":"994a85ef-f28d-40c1-95b8-db86e8829a82","resolution":{"observed_at":"2026-08-07T05:26:47.025491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:48.487272Z","title":"On the importance of being emergent.Constructivist Foundations, 5(2):89, March 2010","venue":null,"work_id":"dfd59503-dbe0-4b84-ac42-b8be23169e39","year":2010},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.030997Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:b74c63280e7c9c67db943fa19efa670ecdf8a9edc44a25782d2501134d6f5291","observation_id":"58bd6a79-63cc-4f58-8fa3-bbd7fae87bb7","resolution":{"observed_at":"2026-08-07T05:26:48.492129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T05:26:47.036084Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.036084Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:f524afa566d67348bd59478ef981ecc9cc8b51980bc88100affd9bbdf50d4c22","observation_id":"6c5ab84d-8850-40dd-9b20-a4b9d5966bee","resolution":{"observed_at":"2026-08-07T05:26:47.036084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:47.041414Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.041414Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:057511a48f7a98e28886bbb567ec189c952485bd5ec203d91889ca130c660aa2","observation_id":"b4960047-268e-4d75-b7d9-b582d9ccbe2f","resolution":{"observed_at":"2026-08-07T05:26:47.041414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:47.046212Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.046212Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:694fda833795d028d7b71bdaf845f93ae978f6c0f75b90be6589a74b93d84a40","observation_id":"eba9dc51-6926-4f79-af91-9d81a4c118ce","resolution":{"observed_at":"2026-08-07T05:26:47.046212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T05:26:47.051059Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.051059Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:f545647c51031bfff2f050cf02b8762dc7df8a9a25ec99ff6e2139f626941dee","observation_id":"bf7bc706-83ea-43bc-ae03-0ce04f6be90c","resolution":{"observed_at":"2026-08-07T05:26:47.051059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:48.452669Z","title":"Video-of-thought: step-by-step video reasoning from perception to cognition","venue":null,"work_id":"109052a3-9811-444f-998b-4335a1ff5285","year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.056082Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:81a416a0d79c45e2244fecd5e25a7714ef769a6554f1bb1d99e70ad7cc5a8c50","observation_id":"6438f68a-91c3-4f0e-b688-9341f1f30ad5","resolution":{"observed_at":"2026-08-07T05:26:48.457539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-07T05:26:47.060972Z","title":"Video-r1: Reinforcing video reasoning in mllms.arXiv preprint arXiv:2503.21776, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.060972Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:a18205e3e059dfdd82b5602390d6b604634057b8c3ee5c586340c5905025952d","observation_id":"f1438cd1-b6b3-4387-894d-4246da694cb6","resolution":{"observed_at":"2026-08-07T05:26:47.060972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14257","last_updated":"2025-02-08T12:50:42Z","snapshot_observed_at":"2026-07-06T19:53:52.079055Z","submitted_at":"2024-11-21T16:05:58Z","title":"Do I Know This Entity? Knowledge Awareness and Hallucinations in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14257","snapshot_observed_at":"2026-08-07T05:26:47.066169Z","title":"Do i know this entity? knowledge awareness and hallucinations in language models.arXiv preprint arXiv:2411.14257, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.066169Z"},"links":{"cited_paper":"/paper/2411.14257","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:efb6e51335be71e95a4ee28e143a6ce31a77f9ad807f83870b7e6f65dd737458","observation_id":"f693478b-31f6-475c-856e-3a13988d1d50","resolution":{"observed_at":"2026-08-07T05:26:47.066169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:48.437698Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":"8d956698-e3ca-4fe0-beed-efacbc30bf3f","year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.071269Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:021adb4094ac2a3ed6f6279d9b76af5f184c103c1aaf275443b6ba7aa9fdae8c","observation_id":"cf788293-7850-47ac-bab6-645d0779f3b9","resolution":{"observed_at":"2026-08-07T05:26:48.442495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1386/tear.5.1.15_1","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:47.418992Z","title":"The boat/helmsman","venue":null,"work_id":"eaf639fa-7144-4b20-b4a5-7f8f16e21f6c","year":2007},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.076321Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:4f77dce87bdffcb5957219e7341474fceab942ce76b2ed70b8400f08f92a99f9","observation_id":"747e27cb-f39e-420e-8639-33ce86441252","resolution":{"observed_at":"2026-08-07T05:26:47.424258Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:48.421990Z","title":"Stream of search (sos): Learning to search in language","venue":null,"work_id":"13ef0c34-6caf-41c6-a3fb-ecbb39e395c4","year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.081254Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:049bfe51354c7e1940a95c4f56f6649586f8cc4a0e9d426d2770df6378feed59","observation_id":"11f49cd3-e5d7-4800-b667-df25200b3118","resolution":{"observed_at":"2026-08-07T05:26:48.427236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T05:26:47.085969Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.085969Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:eb489eba760cba65efaedfd933c1bac5d8e70590e75951dc8db194a6056517fd","observation_id":"fdb91667-117e-485c-b3d7-bd685ac7f5c9","resolution":{"observed_at":"2026-08-07T05:26:47.085969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13139","last_updated":"2025-05-17T13:22:07Z","snapshot_observed_at":"2026-07-06T20:53:55.745087Z","submitted_at":"2025-03-17T13:07:34Z","title":"Logic-in-Frames: Dynamic Keyframe Search via Visual Semantic-Logical Verification for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13139","snapshot_observed_at":"2026-08-07T05:26:47.091033Z","title":"Logic-in-frames: Dynamic keyframe search via visual semantic-logical verification for long video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.091033Z"},"links":{"cited_paper":"/paper/2503.13139","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:c6f29fdef0e75a4a073d32db9644f748434351ac2ff9142e3defb45a67d0ac0d","observation_id":"1e477a11-c3be-4f89-8374-03516e599b7e","resolution":{"observed_at":"2026-08-07T05:26:47.091033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10441","last_updated":"2024-10-16T09:45:06Z","snapshot_observed_at":"2026-08-04T03:48:44.723741Z","submitted_at":"2024-10-14T12:35:12Z","title":"Free Video-LLM: Prompt-guided Visual Perception for Efficient Training-free Video LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10441","snapshot_observed_at":"2026-08-07T05:26:47.096138Z","title":"Free video-llm: Prompt-guided visual perception for efficient training-free video llms.arXiv preprint arXiv:2410.10441, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.096138Z"},"links":{"cited_paper":"/paper/2410.10441","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:4b0b4035701b20fc503ccd70ac7cd673f0ffa3cc74f412bdfa8626507b406ad9","observation_id":"52664408-8232-4b51-b2a6-1494f9cc6290","resolution":{"observed_at":"2026-08-07T05:26:47.096138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04326","snapshot_observed_at":"2026-08-07T05:26:47.101151Z","title":"Worldsense: Evaluating real-world omnimodal understanding for multimodal llms.arXiv preprint arXiv:2502.04326, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.101151Z"},"links":{"cited_paper":"/paper/2502.04326","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:7dd2cb854e14358c20cf6f5c44ed0f2c2807932e0fa6413f0435b0538fd91d54","observation_id":"c4593a06-0e96-4413-bcfb-bf733a9b9095","resolution":{"observed_at":"2026-08-07T05:26:47.101151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:48.406490Z","title":"Following clues, approaching the truth: Explainable micro-video rumor detection via chain-of-thought reasoning","venue":null,"work_id":"5a12a03c-22c9-4768-8ead-d6f30a61f5fb","year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.106051Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:0e35295257fb28d250dea2c637d18a54e1ab4b24a69aa1a7e22a7607e342a9dd","observation_id":"ae032cd7-8015-47c5-ab16-ab4aea6e38d8","resolution":{"observed_at":"2026-08-07T05:26:48.411597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06428","last_updated":"2025-02-11T14:59:25Z","snapshot_observed_at":"2026-08-03T22:34:50.903495Z","submitted_at":"2025-02-10T13:03:05Z","title":"CoS: Chain-of-Shot Prompting for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06428","snapshot_observed_at":"2026-08-07T05:26:47.111365Z","title":"Cos: Chain-of-shot prompting for long video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.111365Z"},"links":{"cited_paper":"/paper/2502.06428","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:6671cc2767b21d47b13a811620adee7be87f317e00c3c91bc36d2b63c37e4df1","observation_id":"86481275-9056-4f32-9893-441e6d675a85","resolution":{"observed_at":"2026-08-07T05:26:47.111365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13826","snapshot_observed_at":"2026-08-07T05:26:47.116523Z","title":"Video-mmmu: Evaluating knowledge acquisition from multi-discipline professional videos.arXiv preprint arXiv:2501.13826, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.116523Z"},"links":{"cited_paper":"/paper/2501.13826","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:72fbfed92bffb460d176c5eef86abad1c9040060b65a2082419b98705a7a2c49","observation_id":"3afe48cc-0bfa-4fef-b495-e4872d0f038f","resolution":{"observed_at":"2026-08-07T05:26:47.116523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.09200","last_updated":"2020-11-10T08:29:39Z","snapshot_observed_at":"2026-07-06T09:39:18.086556Z","submitted_at":"2020-07-17T19:32:48Z","title":"Neural Networks with Recurrent Generative Feedback","version":2},"cited_work":{"arxiv_id":"2007.09200","doi":"10.48550/arxiv.2007.09200","metadata_source":"pith","pith_arxiv_id":"2007.09200","snapshot_observed_at":"2026-08-07T06:16:28.064256Z","title":"Neural Networks with Recurrent Generative Feedback","venue":"cs.LG","work_id":"485c1916-fa83-4fc3-9f9c-bb8576437bf4","year":2020},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.121891Z"},"links":{"cited_paper":"/paper/2007.09200","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:81db6ab0e74028e832fd41e9c1d021a2985e023f4819a7dba4a9c0cb36bd6fd3","observation_id":"e8f6dcc4-cdb6-4b49-9c46-79f8f5a8da40","resolution":{"observed_at":"2026-08-07T05:26:47.407547Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05615","last_updated":"2024-05-09T08:23:20Z","snapshot_observed_at":"2026-08-07T04:07:58.370340Z","submitted_at":"2024-05-09T08:23:20Z","title":"Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05615","snapshot_observed_at":"2026-08-07T05:26:47.126961Z","title":"Memory-space visual prompting for efficient vision-language fine-tuning.arXiv preprint arXiv:2405.05615, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.126961Z"},"links":{"cited_paper":"/paper/2405.05615","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:c0fdd190b025627a06452fd76325554f1660a3b4885267f28395958d2d8f70c2","observation_id":"0f4d2b99-c812-4e5e-8f72-6dee08f56bee","resolution":{"observed_at":"2026-08-07T05:26:47.126961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16377","last_updated":"2024-12-07T22:50:41Z","snapshot_observed_at":"2026-08-05T11:33:45.483902Z","submitted_at":"2024-10-21T18:00:06Z","title":"A Simple Model of Inference Scaling Laws","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16377","snapshot_observed_at":"2026-08-07T05:26:47.132278Z","title":"A simple model of inference scaling laws.arXiv preprint arXiv:2410.16377, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.132278Z"},"links":{"cited_paper":"/paper/2410.16377","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:d9dd906e006c181711f0d4e297e6e21556505107ffa7b5d8d5c33feab804c2b6","observation_id":"e179b3d8-d236-4c49-a55c-6fc28c022fd3","resolution":{"observed_at":"2026-08-07T05:26:47.132278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T05:26:47.137280Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.137280Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:f434e927b48002ffe0314a5e0b0a0342f3bfa088edc452f064a70e40051c1efd","observation_id":"851b920e-39c9-4bc9-b8b4-ddee8a6e5fc0","resolution":{"observed_at":"2026-08-07T05:26:47.137280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T05:26:47.142398Z","title":"Aria: An open multimodal native mixture-of-experts model.arXiv preprint arXiv:2410.05993, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.142398Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:a42c5d7e2b0c61153cd90385e54282cc796d3bb52fd7b72c29e13c19fccf3213","observation_id":"b92b4578-1639-44c9-8c4e-488ab0c0a9d5","resolution":{"observed_at":"2026-08-07T05:26:47.142398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:47.148333Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.148333Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:174f308b514508ba48b6529e5ffc4d89b9cced269e726d3d1e6f520f4efc58c3","observation_id":"013a7f46-5688-41ee-8cbc-19d60450485c","resolution":{"observed_at":"2026-08-07T05:26:47.148333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:47.152919Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.152919Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:1ef0448b745c71c006e443db49957974e84e94effd2ba39bd7f6bba1ed74552f","observation_id":"ae133fc9-d4c1-43ea-8968-351acf771948","resolution":{"observed_at":"2026-08-07T05:26:47.152919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T05:26:47.157304Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning.arXiv preprint arXiv:2504.06958, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.157304Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:a48a6760b1b12c8d281cee1d963e0726dbf28e1c2beb2f32992a7fbd5a681e8f","observation_id":"af25d190-2708-432b-b466-11303fba6d59","resolution":{"observed_at":"2026-08-07T05:26:47.157304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:47.162872Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.162872Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:88217542b5d3a50f570c056bad0acbb9d56c8a19640ab021e3a7ddbc208b1623","observation_id":"ba96c21b-1485-4d4c-a140-b80e1b4c14e3","resolution":{"observed_at":"2026-08-07T05:26:47.162872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:48.359398Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"290858f8-7df1-4715-9f35-21a033072097","year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.167582Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:578dbd309d88393c0bf1062f74ac1745cba84364621a7bf7f6992a9311e4d95f","observation_id":"cd4414fc-f965-40d8-988c-edcd08c27348","resolution":{"observed_at":"2026-08-07T05:26:48.364823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-05T04:32:32.994993Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-07T05:26:47.172225Z","title":"Can 1b llm surpass 405b llm? rethinking compute-optimal test-time scaling.arXiv preprint arXiv:2502.06703, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.172225Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:04eeac2be3a789ad33dd6aab8af38ba1e98bf07440004cecdb5bb4da03674bcb","observation_id":"70bd4eff-189c-4e66-ba8b-fcf6c0b35422","resolution":{"observed_at":"2026-08-07T05:26:47.172225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-07T05:26:47.176832Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language models.arXiv preprint arXiv:2403.03003, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.176832Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:5aa80077ab4442a26483a2ad3cc2bb9e27aa0848ee01d7d91fc891e923a55bd8","observation_id":"8f9db7db-44f9-475e-9bfc-ce67c36f08ea","resolution":{"observed_at":"2026-08-07T05:26:47.176832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20502","last_updated":"2025-03-30T03:54:36Z","snapshot_observed_at":"2026-08-07T16:35:40.970337Z","submitted_at":"2025-03-26T12:42:37Z","title":"MLLM-Selector: Necessity and Diversity-driven High-Value Data Selection for Enhanced Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20502","snapshot_observed_at":"2026-08-07T05:26:47.181794Z","title":"Mllm-selector: Necessity and diversity-driven high-value data selection for enhanced visual instruction tuning.arXiv preprint arXiv:2503.20502, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.181794Z"},"links":{"cited_paper":"/paper/2503.20502","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:6206952b73130dca0ff36c185bd15de3e668f9ddff058774cc34f247c44b6c3c","observation_id":"5caae8b8-9813-4dcc-bd72-5340ec991c81","resolution":{"observed_at":"2026-08-07T05:26:47.181794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:47.186636Z","title":"McCulloch and Walter Pitts","venue":null,"work_id":null,"year":1943},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.186636Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:3a4266fc46a2abb3c7ac3b7c430d2892d2987c6d4b85c6fcaf377cb0b876cbdf","observation_id":"50ab3f98-e34b-4872-8763-610baf0a67b7","resolution":{"observed_at":"2026-08-07T05:26:47.186636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T05:26:47.191423Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.191423Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:0013721a769cea98544ccdfc2e4d2e86f15371beb1dcb620a51564f3050a9cc4","observation_id":"cb5e8886-3922-4cf0-987d-c1b25fd2cdf1","resolution":{"observed_at":"2026-08-07T05:26:47.191423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:48.343179Z","title":"Hello gpt4-o.https://openai.com/index/hello-gpt-4o/, 2024","venue":null,"work_id":"c2c5a76f-cb26-425b-9e91-a1c688382774","year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.196230Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:6a8262046c356e8fdb1e52ba7c40f4483b40bbba97b8a1ea04c15c9e3322fc1e","observation_id":"72efaefc-21fd-4b76-99fe-2c3972bdbaef","resolution":{"observed_at":"2026-08-07T05:26:48.348109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:47.201026Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.201026Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:1e1852a1a2ce6062db6596bbc562ed7706ed21081917241eff92f89d41f8e2bd","observation_id":"22e546a7-2917-49a5-8cf7-7d55f3900988","resolution":{"observed_at":"2026-08-07T05:26:47.201026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-03T16:12:52.104741Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04322","snapshot_observed_at":"2026-08-07T05:26:47.205836Z","title":"Eve: Efficient multimodal vision language models with elastic visual experts.arXiv preprint arXiv:2501.04322, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.205836Z"},"links":{"cited_paper":"/paper/2501.04322","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:4f22f3ea65038835e01ce66f13e43dba73954a5bc80d09ee47ea6ec03be457ca","observation_id":"b049d93d-4725-4e24-8888-2c87fa20c840","resolution":{"observed_at":"2026-08-07T05:26:47.205836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T05:26:47.210761Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.210761Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:5552be1dd32745af4777fb31ddb8867c4cb69e737f8029654678a1160dd74f49","observation_id":"e4785098-977e-4d34-b28f-be95bb55213d","resolution":{"observed_at":"2026-08-07T05:26:47.210761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T05:26:47.215800Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.215800Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:0cdc351d5d68067cbdee52fbe5c2e43a4d2dc06db8e764bceb3157cb139229bb","observation_id":"325e25aa-5e79-44e0-979d-8720389223f2","resolution":{"observed_at":"2026-08-07T05:26:47.215800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:47.220900Z","title":"Long-vita: Scaling large multi-modal models to 1 million tokens with leading short-context accuray.arXiv preprint arXiv:2502.05177, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.220900Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:8646aa2123f059c99f0a45443c73ae06f3a152e88b8c065d83da73f8fa441658","observation_id":"236dae6e-f37c-4689-a97e-850002edef3b","resolution":{"observed_at":"2026-08-07T05:26:47.220900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-07T05:26:47.226160Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding.arXiv preprint arXiv:2409.14485, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.226160Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:d7d886cae204c72a7dfdbbfee82dfa790537f58fac00a9fb1454942d1872f20f","observation_id":"e951b058-651e-41cb-82f6-f9ca968c09dd","resolution":{"observed_at":"2026-08-07T05:26:47.226160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T05:26:47.231346Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters.arXiv preprint arXiv:2408.03314, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.231346Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:d7b7f83f054947b750c00f440544e4fab1f469b9b77c9398b84af4790b9a5946","observation_id":"0df38b86-7c5b-4f31-af4f-94f8719d72c9","resolution":{"observed_at":"2026-08-07T05:26:47.231346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T05:26:47.236163Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.236163Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:7932b5fb0360da19247096786278da85e4584e98252a352674fb4e8146c948a4","observation_id":"81506776-cb69-4f53-9508-b66c1acd9ec1","resolution":{"observed_at":"2026-08-07T05:26:47.236163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-07T05:26:47.241336Z","title":"Solving math word problems with process-and outcome-based feedback.arXiv preprint arXiv:2211.14275, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.241336Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:82e5abc84214ccbe41f8643398e93e6da4c3d3ffd23043ded8dc3127d25c6c12","observation_id":"7e2787e1-62d6-4daf-9d48-12cc9422ec2c","resolution":{"observed_at":"2026-08-07T05:26:47.241336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:48.317468Z","title":"Cybernetics: Circular causal and feedback mechanisms in biological and social systems","venue":null,"work_id":"9f046296-4424-4434-acf9-024cb7844ec6","year":1952},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.246193Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:0fb940fc7451cd4502438e396a4265d88503d8096a6944a66338beb046914daa","observation_id":"3437d662-c6b0-46cd-8d70-479da2f81a49","resolution":{"observed_at":"2026-08-07T05:26:48.322834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T05:26:47.250907Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.250907Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:7086b8e02c4480a438997e93c0246969c8ff14f528abac8079dca8c9b9e777a2","observation_id":"91d4ed42-b3c9-4384-8bf2-7cad3e7b3fa4","resolution":{"observed_at":"2026-08-07T05:26:47.250907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:48.302286Z","title":"Visionllm: Large language model is also an open-ended decoder for vision-centric tasks","venue":null,"work_id":"040476b3-48a7-49d4-9698-c57ebbbeccfb","year":2023},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.256164Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:1755b584f8f5d9cc21ad8cd759768b5b54bc30c1a84d33e5ee9f72a314a3239f","observation_id":"f55b0907-0362-4df1-8774-85ba73fb327e","resolution":{"observed_at":"2026-08-07T05:26:48.307116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:47.261813Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.261813Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:8730e1df19b71a8b7117f850ada4268a457ea085c3aed575ebd590261e18e9ba","observation_id":"0ffe3b2b-39e2-4b0e-9b9e-e069d30f6c33","resolution":{"observed_at":"2026-08-07T05:26:47.261813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-07T05:26:47.266447Z","title":"Internvideo2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.266447Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:3e4ed22b856d6c0bf615d88cd4f98377e40a5775a08ee0e89953228f27adfa73","observation_id":"61606932-3186-4d92-91fb-d4541afcc799","resolution":{"observed_at":"2026-08-07T05:26:47.266447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:48.276223Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"e3278dd9-0f44-4090-acf2-cb065770bbef","year":2022},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.271373Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:6b81048f86b3e92deb5773f8373b6d154206d46aee1b63ffc179ea0cf4066f0a","observation_id":"16060295-c0bd-46b4-a319-e377a229e929","resolution":{"observed_at":"2026-08-07T05:26:48.281545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:48.260113Z","title":"Cybernetics or Control and Communication in the Animal and the Machine","venue":null,"work_id":"2b5e3fda-176b-4abb-a433-cc9180c541a0","year":1948},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.275958Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:e89d9e32badada34acc91ab25bf41b1b47c6fd6c787ce2b2312e474ba7da31a4","observation_id":"49ed97e7-5fef-42f6-8de4-acd32a68c974","resolution":{"observed_at":"2026-08-07T05:26:48.265217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:48.244432Z","title":"Controlmllm: Training-free visual prompt learning for multimodal large language models","venue":null,"work_id":"5ad7873e-68ad-4e61-a86b-59bb111a00cd","year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.280559Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:6b2cca19e3a6e0ddcdef0d2019e8f4a0395c7f9a54a36f54724a410cf08181b0","observation_id":"0e4ced83-f7b3-4205-89b5-5186abd780c4","resolution":{"observed_at":"2026-08-07T05:26:48.249410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14333","last_updated":"2024-05-23T09:03:42Z","snapshot_observed_at":"2026-07-06T18:18:25.746022Z","submitted_at":"2024-05-23T09:03:42Z","title":"DeepSeek-Prover: Advancing Theorem Proving in LLMs through Large-Scale Synthetic Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14333","snapshot_observed_at":"2026-08-07T05:26:47.285294Z","title":"Deepseek-prover: Advancing theorem proving in llms through large-scale synthetic data.arXiv preprint arXiv:2405.14333, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.285294Z"},"links":{"cited_paper":"/paper/2405.14333","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:3129874865411ed0afb8c9cc2ee0704074e89ef0ee1c9426ab3307238da0eb81","observation_id":"d98e0f41-98b9-4c0d-b213-7bde18df4df7","resolution":{"observed_at":"2026-08-07T05:26:47.285294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-07T05:26:47.290148Z","title":"Videollama 3: Frontier multimodal foundation models for image and video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.290148Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:82b6108e7517e9182975ea91b2cba47db337bb09fefd5249372f1d0e92f05752","observation_id":"29ae9f45-2e00-4a5d-9cbd-fea763364b39","resolution":{"observed_at":"2026-08-07T05:26:47.290148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:26:48.229366Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":"a4c27394-cc32-4201-8bfa-53128adad2af","year":2023},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.295054Z"},"links":{"citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:3f30a720b5fed47ff40648f688dd511e05c6ecc28f421993eae12230961d348a","observation_id":"2ebd99f9-284f-456e-9fb2-5a0f7fc30cb0","resolution":{"observed_at":"2026-08-07T05:26:48.233970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T05:26:47.299651Z","title":"Long context transfer from language to vision.arXiv preprint arXiv:2406.16852, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.299651Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:2a1b873cd9f96c14e52dcbe3bb2144d4e02c18e9828a59a136373f024121cc27","observation_id":"cf0663c6-07a0-424d-a475-16f65e101b6b","resolution":{"observed_at":"2026-08-07T05:26:47.299651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17176","last_updated":"2024-05-03T08:24:12Z","snapshot_observed_at":"2026-08-02T19:09:39.899901Z","submitted_at":"2023-09-29T12:16:19Z","title":"AdaRefiner: Refining Decisions of Language Models with Adaptive Feedback","version":3},"cited_work":{"arxiv_id":"2309.17176","doi":"10.48550/arxiv.2309.17176","metadata_source":"pith","pith_arxiv_id":"2309.17176","snapshot_observed_at":"2026-08-07T06:16:28.064256Z","title":"AdaRefiner: Refining Decisions of Language Models with Adaptive Feedback","venue":"cs.AI","work_id":"f3784c90-8c5b-4f30-bcfc-11bfc95a7ddc","year":2023},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.304566Z"},"links":{"cited_paper":"/paper/2309.17176","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:c12d43dcfd41b002e201cc3fc1bb410a819b75a4a39bc6cf8d4ed26fda56dcd9","observation_id":"d55a354c-3fae-4341-b0c8-0637b6366ea6","resolution":{"observed_at":"2026-08-07T05:26:47.371796Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09641","last_updated":"2025-04-13T16:32:49Z","snapshot_observed_at":"2026-08-07T16:06:07.704352Z","submitted_at":"2025-04-13T16:32:49Z","title":"TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09641","snapshot_observed_at":"2026-08-07T05:26:47.309529Z","title":"Tinyllava-video-r1: Towards smaller lmms for video reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.309529Z"},"links":{"cited_paper":"/paper/2504.09641","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:02f07efa11270ca8dc60c317b2fd2b855ea731263aab6398a0374dc9c5d17f96","observation_id":"6b93e37e-a4f1-4806-a581-13cf263521b9","resolution":{"observed_at":"2026-08-07T05:26:47.309529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T05:26:47.315568Z","title":"Video instruction tuning with synthetic data.arXiv preprint arXiv:2410.02713, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.315568Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:89128e0a872173db92aaef30bdc473a3a81dc774716b399709afa9dfb25ca5e7","observation_id":"0ac43119-00d2-4316-80ae-1ac7c5cda771","resolution":{"observed_at":"2026-08-07T05:26:47.315568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T05:26:47.320450Z","title":"Add key frames","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.320450Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:bd053fe996f21c84465b27c664e6ef069611156bb6bcd7c13ccc0516bc8fb704","observation_id":"482ffa6f-a7bc-4d60-aff8-32ef23cb0176","resolution":{"observed_at":"2026-08-07T05:26:47.320450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T05:18:58.015674Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":49,"verified_exact":2,"verified_fuzzy":14},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 4 inbound Pith citation observations for arXiv:2506.07971."}