Pith. sign in

Paper Citation Record · LEDGER

CyberV: Cybernetics for Test-time Scaling in Video Understanding

As of 7 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 4 inbound Pith citation observations for arXiv:2506.07971.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.07971 v1

Coverage vector

measured 66 of 66 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T05:26:47.320450Z

measured 70 of 70 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-28T02:11:48.455492Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-03T08:17:45.840937Z

Reference resolution

66 of 66 outbound references displayed

  • verified exact2
  • verified fuzzy14
  • unresolved49
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation b7185dab-cc29-44f0-aed7-77af05663516 · outbound

This paper cites Critique-out-Loud Reward Models.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Critique-out-Loud Reward Models

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:46.991810Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:46.991810Z digest=sha256:3f559c04ae4d735dd7e6b612aa47048b3f4635c9e978841c66832aa614278271

Observation 5e3845e7-e9b5-42bb-816b-bb375d6c6faf · outbound

This paper cites Claude Team.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Claude Team

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.518617Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:26:46.997671Z digest=sha256:82133464299fec2ac8fc4b4c4324d92ffdd5816e338d020d0e68685dcbbc9e2c

Observation e740239e-8ac9-486c-9fa1-c8791206aeee · outbound

This paper cites An introduction to cybernetics.

CyberV: Cybernetics for Test-time Scaling in Video Understanding An introduction to cybernetics

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.003174Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.003174Z digest=sha256:7165f06bb078082f4c5134e6a86d232bd17003ce7072e316ad10af3173c299d1

Observation 2929c73e-7163-4694-b270-508417fda755 · outbound

This paper cites Qwen Technical Report.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Qwen Technical Report

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.008776Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.008776Z digest=sha256:c1e9c9d2d489f9623108ff210f35ea10f4d65cc5e274baebba0cd113fc10ea0c

Observation c4de9698-e180-4017-8a64-20932ec07567 · outbound

This paper cites Qwen2.5-VL Technical Report.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Qwen2.5-VL Technical Report

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.014066Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.014066Z digest=sha256:74835f55019e227b38d25baf3ce15fabc1f73e2d5cc85047653298b7ee854ad0

Observation 18dedfcc-cf37-4917-9de4-ba0fdaf51c54 · outbound

This paper cites Forest-of-Thought: Scaling Test-Time Compute for Enhancing LLM Reasoning.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Forest-of-Thought: Scaling Test-Time Compute for Enhancing LLM Reasoning

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.019699Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.019699Z digest=sha256:44e19f50fdb519473308e97360f3ad357557129569fd8ac9554a978658279e44

Observation 994a85ef-f28d-40c1-95b8-db86e8829a82 · outbound

This paper cites Large Language Monkeys: Scaling Inference Compute with Repeated Sampling.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Large Language Monkeys: Scaling Inference Compute with Repeated Sampling

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.025491Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.025491Z digest=sha256:3825a3dc8b8ecc4846b859636a2aedeef977cc726f2ecb335adcacfd802a498b

Observation 58bd6a79-63cc-4f58-8fa3-bbd7fae87bb7 · outbound

This paper cites On the importance of being emergent.Constructivist Foundations, 5(2):89, March 2010.

CyberV: Cybernetics for Test-time Scaling in Video Understanding On the importance of being emergent.Constructivist Foundations, 5(2):89, March 2010

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.492129Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:26:47.030997Z digest=sha256:b74c63280e7c9c67db943fa19efa670ecdf8a9edc44a25782d2501134d6f5291

Observation 6c5ab84d-8850-40dd-9b20-a4b9d5966bee · outbound

This paper cites Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.036084Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.036084Z digest=sha256:f524afa566d67348bd59478ef981ecc9cc8b51980bc88100affd9bbdf50d4c22

Observation b4960047-268e-4d75-b7d9-b582d9ccbe2f · outbound

This paper cites How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.

CyberV: Cybernetics for Test-time Scaling in Video Understanding How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.041414Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.041414Z digest=sha256:057511a48f7a98e28886bbb567ec189c952485bd5ec203d91889ca130c660aa2

Observation eba9dc51-6926-4f79-af91-9d81a4c118ce · outbound

This paper cites Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.046212Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.046212Z digest=sha256:694fda833795d028d7b71bdaf845f93ae978f6c0f75b90be6589a74b93d84a40

Observation bf7bc706-83ea-43bc-ae03-0ce04f6be90c · outbound

This paper cites VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs.

CyberV: Cybernetics for Test-time Scaling in Video Understanding VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.051059Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.051059Z digest=sha256:f545647c51031bfff2f050cf02b8762dc7df8a9a25ec99ff6e2139f626941dee

Observation 6438f68a-91c3-4f0e-b688-9341f1f30ad5 · outbound

This paper cites Video-of-thought: step-by-step video reasoning from perception to cognition.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Video-of-thought: step-by-step video reasoning from perception to cognition

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.457539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:26:47.056082Z digest=sha256:81a416a0d79c45e2244fecd5e25a7714ef769a6554f1bb1d99e70ad7cc5a8c50

Observation f1438cd1-b6b3-4387-894d-4246da694cb6 · outbound

This paper cites Video-R1: Reinforcing Video Reasoning in MLLMs.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Video-R1: Reinforcing Video Reasoning in MLLMs

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.060972Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.060972Z digest=sha256:a18205e3e059dfdd82b5602390d6b604634057b8c3ee5c586340c5905025952d

Observation f693478b-31f6-475c-856e-3a13988d1d50 · outbound

This paper cites Do I Know This Entity? Knowledge Awareness and Hallucinations in Language Models.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Do I Know This Entity? Knowledge Awareness and Hallucinations in Language Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.066169Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.066169Z digest=sha256:efb6e51335be71e95a4ee28e143a6ce31a77f9ad807f83870b7e6f65dd737458

Observation cf788293-7850-47ac-bab6-645d0779f3b9 · outbound

This paper cites Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.442495Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:26:47.071269Z digest=sha256:021adb4094ac2a3ed6f6279d9b76af5f184c103c1aaf275443b6ba7aa9fdae8c

Observation 747e27cb-f39e-420e-8639-33ce86441252 · outbound

This paper cites The boat/helmsman.

CyberV: Cybernetics for Test-time Scaling in Video Understanding The boat/helmsman

Reference 17

Resolution
verified exact
doi, observed 2026-08-07T05:26:47.424258Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:26:47.076321Z digest=sha256:4f77dce87bdffcb5957219e7341474fceab942ce76b2ed70b8400f08f92a99f9

Observation 11f49cd3-e5d7-4800-b667-df25200b3118 · outbound

This paper cites Stream of search (sos): Learning to search in language.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Stream of search (sos): Learning to search in language

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.427236Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:26:47.081254Z digest=sha256:049bfe51354c7e1940a95c4f56f6649586f8cc4a0e9d426d2770df6378feed59

Observation fdb91667-117e-485c-b3d7-bd685ac7f5c9 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

CyberV: Cybernetics for Test-time Scaling in Video Understanding DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.085969Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.085969Z digest=sha256:eb489eba760cba65efaedfd933c1bac5d8e70590e75951dc8db194a6056517fd

Observation 1e477a11-c3be-4f89-8374-03516e599b7e · outbound

This paper cites Logic-in-Frames: Dynamic Keyframe Search via Visual Semantic-Logical Verification for Long Video Understanding.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Logic-in-Frames: Dynamic Keyframe Search via Visual Semantic-Logical Verification for Long Video Understanding

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.091033Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.091033Z digest=sha256:c6f29fdef0e75a4a073d32db9644f748434351ac2ff9142e3defb45a67d0ac0d

Observation 52664408-8232-4b51-b2a6-1494f9cc6290 · outbound

This paper cites Free Video-LLM: Prompt-guided Visual Perception for Efficient Training-free Video LLMs.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Free Video-LLM: Prompt-guided Visual Perception for Efficient Training-free Video LLMs

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.096138Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.096138Z digest=sha256:4b0b4035701b20fc503ccd70ac7cd673f0ffa3cc74f412bdfa8626507b406ad9

Observation c4593a06-0e96-4413-bcfb-bf733a9b9095 · outbound

This paper cites WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs.

CyberV: Cybernetics for Test-time Scaling in Video Understanding WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.101151Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.101151Z digest=sha256:7dd2cb854e14358c20cf6f5c44ed0f2c2807932e0fa6413f0435b0538fd91d54

Observation ae032cd7-8015-47c5-ab16-ab4aea6e38d8 · outbound

This paper cites Following clues, approaching the truth: Explainable micro-video rumor detection via chain-of-thought reasoning.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Following clues, approaching the truth: Explainable micro-video rumor detection via chain-of-thought reasoning

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.411597Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:26:47.106051Z digest=sha256:0e35295257fb28d250dea2c637d18a54e1ab4b24a69aa1a7e22a7607e342a9dd

Observation 86481275-9056-4f32-9893-441e6d675a85 · outbound

This paper cites CoS: Chain-of-Shot Prompting for Long Video Understanding.

CyberV: Cybernetics for Test-time Scaling in Video Understanding CoS: Chain-of-Shot Prompting for Long Video Understanding

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.111365Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.111365Z digest=sha256:6671cc2767b21d47b13a811620adee7be87f317e00c3c91bc36d2b63c37e4df1

Observation 3afe48cc-0bfa-4fef-b495-e4872d0f038f · outbound

This paper cites Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.116523Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.116523Z digest=sha256:72fbfed92bffb460d176c5eef86abad1c9040060b65a2082419b98705a7a2c49

Observation e8f6dcc4-cdb6-4b49-9c46-79f8f5a8da40 · outbound

This paper cites Neural Networks with Recurrent Generative Feedback.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Neural Networks with Recurrent Generative Feedback

Reference 26

Resolution
metadata mismatch
local_arxiv, observed 2026-08-07T05:26:47.407547Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:26:47.121891Z digest=sha256:81db6ab0e74028e832fd41e9c1d021a2985e023f4819a7dba4a9c0cb36bd6fd3

Observation 0f4d2b99-c812-4e5e-8f72-6dee08f56bee · outbound

This paper cites Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.126961Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.126961Z digest=sha256:c0fdd190b025627a06452fd76325554f1660a3b4885267f28395958d2d8f70c2

Observation e179b3d8-d236-4c49-a55c-6fc28c022fd3 · outbound

This paper cites A Simple Model of Inference Scaling Laws.

CyberV: Cybernetics for Test-time Scaling in Video Understanding A Simple Model of Inference Scaling Laws

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.132278Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.132278Z digest=sha256:d9dd906e006c181711f0d4e297e6e21556505107ffa7b5d8d5c33feab804c2b6

Observation 851b920e-39c9-4bc9-b8b4-ddee8a6e5fc0 · outbound

This paper cites LLaVA-OneVision: Easy Visual Task Transfer.

CyberV: Cybernetics for Test-time Scaling in Video Understanding LLaVA-OneVision: Easy Visual Task Transfer

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.137280Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.137280Z digest=sha256:f434e927b48002ffe0314a5e0b0a0342f3bfa088edc452f064a70e40051c1efd

Observation b92b4578-1639-44c9-8c4e-488ab0c0a9d5 · outbound

This paper cites Aria: An Open Multimodal Native Mixture-of-Experts Model.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Aria: An Open Multimodal Native Mixture-of-Experts Model

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.142398Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.142398Z digest=sha256:a42c5d7e2b0c61153cd90385e54282cc796d3bb52fd7b72c29e13c19fccf3213

Observation 013a7f46-5688-41ee-8cbc-19d60450485c · outbound

This paper cites Mvbench: A comprehensive multi-modal video understanding benchmark.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Mvbench: A comprehensive multi-modal video understanding benchmark

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.148333Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.148333Z digest=sha256:174f308b514508ba48b6529e5ffc4d89b9cced269e726d3d1e6f520f4efc58c3

Observation ae133fc9-d4c1-43ea-8968-351acf771948 · outbound

This paper cites Mvbench: A comprehensive multi-modal video understanding benchmark.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Mvbench: A comprehensive multi-modal video understanding benchmark

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.152919Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.152919Z digest=sha256:1ef0448b745c71c006e443db49957974e84e94effd2ba39bd7f6bba1ed74552f

Observation af25d190-2708-432b-b466-11303fba6d59 · outbound

This paper cites VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning.

CyberV: Cybernetics for Test-time Scaling in Video Understanding VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.157304Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.157304Z digest=sha256:a48a6760b1b12c8d281cee1d963e0726dbf28e1c2beb2f32992a7fbd5a681e8f

Observation ba96c21b-1485-4d4c-a140-b80e1b4c14e3 · outbound

This paper cites Let’s verify step by step.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Let’s verify step by step

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.162872Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.162872Z digest=sha256:88217542b5d3a50f570c056bad0acbb9d56c8a19640ab021e3a7ddbc208b1623

Observation cd4414fc-f965-40d8-988c-edcd08c27348 · outbound

This paper cites Vila: On pre-training for visual language models.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Vila: On pre-training for visual language models

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.364823Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:26:47.167582Z digest=sha256:578dbd309d88393c0bf1062f74ac1745cba84364621a7bf7f6992a9311e4d95f

Observation 70bd4eff-189c-4e66-ba8b-fcf6c0b35422 · outbound

This paper cites Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.172225Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.172225Z digest=sha256:04eeac2be3a789ad33dd6aab8af38ba1e98bf07440004cecdb5bb4da03674bcb

Observation 8f9db7db-44f9-475e-9bfc-ce67c36f08ea · outbound

This paper cites Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.176832Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.176832Z digest=sha256:5aa80077ab4442a26483a2ad3cc2bb9e27aa0848ee01d7d91fc891e923a55bd8

Observation 5caae8b8-9813-4dcc-bd72-5340ec991c81 · outbound

This paper cites MLLM-Selector: Necessity and Diversity-driven High-Value Data Selection for Enhanced Visual Instruction Tuning.

CyberV: Cybernetics for Test-time Scaling in Video Understanding MLLM-Selector: Necessity and Diversity-driven High-Value Data Selection for Enhanced Visual Instruction Tuning

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.181794Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.181794Z digest=sha256:1243de16924762289719c79855dcf494c1fbefcb046dbd2395f826ec958488b5

Observation 50ab3f98-e34b-4872-8763-610baf0a67b7 · outbound

This paper cites McCulloch and Walter Pitts.

CyberV: Cybernetics for Test-time Scaling in Video Understanding McCulloch and Walter Pitts

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.186636Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.186636Z digest=sha256:3a4266fc46a2abb3c7ac3b7c430d2892d2987c6d4b85c6fcaf377cb0b876cbdf

Observation cb5e8886-3922-4cf0-987d-c1b25fd2cdf1 · outbound

This paper cites s1: Simple test-time scaling.

CyberV: Cybernetics for Test-time Scaling in Video Understanding s1: Simple test-time scaling

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.191423Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.191423Z digest=sha256:0013721a769cea98544ccdfc2e4d2e86f15371beb1dcb620a51564f3050a9cc4

Observation 72efaefc-21fd-4b76-99fe-2c3972bdbaef · outbound

This paper cites Hello gpt4-o.https://openai.com/index/hello-gpt-4o/, 2024.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Hello gpt4-o.https://openai.com/index/hello-gpt-4o/, 2024

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.348109Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:26:47.196230Z digest=sha256:6a8262046c356e8fdb1e52ba7c40f4483b40bbba97b8a1ea04c15c9e3322fc1e

Observation 22e546a7-2917-49a5-8cf7-7d55f3900988 · outbound

This paper cites Direct preference optimization: Your language model is secretly a reward model.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Direct preference optimization: Your language model is secretly a reward model

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.201026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.201026Z digest=sha256:1e1852a1a2ce6062db6596bbc562ed7706ed21081917241eff92f89d41f8e2bd

Observation b049d93d-4725-4e24-8888-2c87fa20c840 · outbound

This paper cites Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.205836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.205836Z digest=sha256:4f22f3ea65038835e01ce66f13e43dba73954a5bc80d09ee47ea6ec03be457ca

Observation e4785098-977e-4d34-b28f-be95bb55213d · outbound

This paper cites Proximal Policy Optimization Algorithms.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Proximal Policy Optimization Algorithms

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.210761Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.210761Z digest=sha256:5552be1dd32745af4777fb31ddb8867c4cb69e737f8029654678a1160dd74f49

Observation 325e25aa-5e79-44e0-979d-8720389223f2 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

CyberV: Cybernetics for Test-time Scaling in Video Understanding DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.215800Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.215800Z digest=sha256:0cdc351d5d68067cbdee52fbe5c2e43a4d2dc06db8e764bceb3157cb139229bb

Observation 236dae6e-f37c-4689-a97e-850002edef3b · outbound

This paper cites Long-vita: Scaling large multi-modal models to 1 million tokens with leading short-context accuray.arXiv preprint arXiv:2502.05177, 2025.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Long-vita: Scaling large multi-modal models to 1 million tokens with leading short-context accuray.arXiv preprint arXiv:2502.05177, 2025

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.220900Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.220900Z digest=sha256:8646aa2123f059c99f0a45443c73ae06f3a152e88b8c065d83da73f8fa441658

Observation e951b058-651e-41cb-82f6-f9ca968c09dd · outbound

This paper cites Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.226160Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.226160Z digest=sha256:d7d886cae204c72a7dfdbbfee82dfa790537f58fac00a9fb1454942d1872f20f

Observation 0df38b86-7c5b-4f31-af4f-94f8719d72c9 · outbound

This paper cites Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.231346Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.231346Z digest=sha256:d7b7f83f054947b750c00f440544e4fab1f469b9b77c9398b84af4790b9a5946

Observation 81506776-cb69-4f53-9508-b66c1acd9ec1 · outbound

This paper cites Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.236163Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.236163Z digest=sha256:7932b5fb0360da19247096786278da85e4584e98252a352674fb4e8146c948a4

Observation 7e2787e1-62d6-4daf-9d48-12cc9422ec2c · outbound

This paper cites Solving math word problems with process- and outcome-based feedback.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Solving math word problems with process- and outcome-based feedback

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.241336Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.241336Z digest=sha256:82e5abc84214ccbe41f8643398e93e6da4c3d3ffd23043ded8dc3127d25c6c12

Observation 3437d662-c6b0-46cd-8d70-479da2f81a49 · outbound

This paper cites Cybernetics: Circular causal and feedback mechanisms in biological and social systems.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Cybernetics: Circular causal and feedback mechanisms in biological and social systems

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.322834Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:26:47.246193Z digest=sha256:0fb940fc7451cd4502438e396a4265d88503d8096a6944a66338beb046914daa

Observation 91d4ed42-b3c9-4384-8bf2-7cad3e7b3fa4 · outbound

This paper cites Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.250907Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.250907Z digest=sha256:7086b8e02c4480a438997e93c0246969c8ff14f528abac8079dca8c9b9e777a2

Observation f55b0907-0362-4df1-8774-85ba73fb327e · outbound

This paper cites Visionllm: Large language model is also an open-ended decoder for vision-centric tasks.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Visionllm: Large language model is also an open-ended decoder for vision-centric tasks

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.307116Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:26:47.256164Z digest=sha256:1755b584f8f5d9cc21ad8cd759768b5b54bc30c1a84d33e5ee9f72a314a3239f

Observation 0ffe3b2b-39e2-4b0e-9b9e-e069d30f6c33 · outbound

This paper cites Self-consistency improves chain of thought reasoning in language models.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Self-consistency improves chain of thought reasoning in language models

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.261813Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.261813Z digest=sha256:8730e1df19b71a8b7117f850ada4268a457ea085c3aed575ebd590261e18e9ba

Observation 61606932-3186-4d92-91fb-d4541afcc799 · outbound

This paper cites InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling.

CyberV: Cybernetics for Test-time Scaling in Video Understanding InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.266447Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.266447Z digest=sha256:3e4ed22b856d6c0bf615d88cd4f98377e40a5775a08ee0e89953228f27adfa73

Observation 16060295-c0bd-46b4-a319-e377a229e929 · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large language models.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Chain-of-thought prompting elicits reasoning in large language models

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.281545Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:26:47.271373Z digest=sha256:6b81048f86b3e92deb5773f8373b6d154206d46aee1b63ffc179ea0cf4066f0a

Observation 49ed97e7-5fef-42f6-8de4-acd32a68c974 · outbound

This paper cites Cybernetics or Control and Communication in the Animal and the Machine.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Cybernetics or Control and Communication in the Animal and the Machine

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.265217Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:26:47.275958Z digest=sha256:e89d9e32badada34acc91ab25bf41b1b47c6fd6c787ce2b2312e474ba7da31a4

Observation 0e4ced83-f7b3-4205-89b5-5186abd780c4 · outbound

This paper cites Controlmllm: Training-free visual prompt learning for multimodal large language models.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Controlmllm: Training-free visual prompt learning for multimodal large language models

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.249410Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:26:47.280559Z digest=sha256:6b2cca19e3a6e0ddcdef0d2019e8f4a0395c7f9a54a36f54724a410cf08181b0

Observation d98e0f41-98b9-4c0d-b213-7bde18df4df7 · outbound

This paper cites DeepSeek-Prover: Advancing Theorem Proving in LLMs through Large-Scale Synthetic Data.

CyberV: Cybernetics for Test-time Scaling in Video Understanding DeepSeek-Prover: Advancing Theorem Proving in LLMs through Large-Scale Synthetic Data

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.285294Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.285294Z digest=sha256:3129874865411ed0afb8c9cc2ee0704074e89ef0ee1c9426ab3307238da0eb81

Observation 29ae9f45-2e00-4a5d-9cbd-fea763364b39 · outbound

This paper cites VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding.

CyberV: Cybernetics for Test-time Scaling in Video Understanding VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.290148Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.290148Z digest=sha256:82b6108e7517e9182975ea91b2cba47db337bb09fefd5249372f1d0e92f05752

Observation 2ebd99f9-284f-456e-9fb2-5a0f7fc30cb0 · outbound

This paper cites Video-llama: An instruction-tuned audio-visual language model for video understanding.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Video-llama: An instruction-tuned audio-visual language model for video understanding

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.233970Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:26:47.295054Z digest=sha256:3f30a720b5fed47ff40648f688dd511e05c6ecc28f421993eae12230961d348a

Observation cf0663c6-07a0-424d-a475-16f65e101b6b · outbound

This paper cites Long Context Transfer from Language to Vision.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Long Context Transfer from Language to Vision

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.299651Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.299651Z digest=sha256:2a1b873cd9f96c14e52dcbe3bb2144d4e02c18e9828a59a136373f024121cc27

Observation d55a354c-3fae-4341-b0c8-0637b6366ea6 · outbound

This paper cites AdaRefiner: Refining Decisions of Language Models with Adaptive Feedback.

CyberV: Cybernetics for Test-time Scaling in Video Understanding AdaRefiner: Refining Decisions of Language Models with Adaptive Feedback

Reference 63

Resolution
verified exact
local_arxiv, observed 2026-08-07T05:26:47.371796Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T05:26:47.304566Z digest=sha256:c12d43dcfd41b002e201cc3fc1bb410a819b75a4a39bc6cf8d4ed26fda56dcd9

Observation 6b93e37e-a4f1-4806-a581-13cf263521b9 · outbound

This paper cites TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning.

CyberV: Cybernetics for Test-time Scaling in Video Understanding TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.309529Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.309529Z digest=sha256:93b6f29bdb269552ae26aa55f9447f22d9b7481db5f5c84cc2632da690413bf6

Observation 0ac43119-00d2-4316-80ae-1ac7c5cda771 · outbound

This paper cites LLaVA-Video: Video Instruction Tuning With Synthetic Data.

CyberV: Cybernetics for Test-time Scaling in Video Understanding LLaVA-Video: Video Instruction Tuning With Synthetic Data

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.315568Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.315568Z digest=sha256:89128e0a872173db92aaef30bdc473a3a81dc774716b399709afa9dfb25ca5e7

Observation 482ffa6f-a7bc-4d60-aff8-32ef23cb0176 · outbound

This paper cites InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models.

CyberV: Cybernetics for Test-time Scaling in Video Understanding InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.320450Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.320450Z digest=sha256:bd053fe996f21c84465b27c664e6ef069611156bb6bcd7c13ccc0516bc8fb704

Pith citing papers

Observation eae3f730-7ef9-40ac-8040-03d74213e13a · inbound

Towards One-to-Many Temporal Grounding cites this paper.

Towards One-to-Many Temporal Grounding CyberV: Cybernetics for Test-time Scaling in Video Understanding

Reference 51

Resolution
verified exact
arxiv_id, observed 2026-07-02T12:16:57.682594Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-06-28T02:11:48.455492Z digest=sha256:21d064af554f560b2a0ae1a1018fa1433eb8a07bbca0c4a8eb9c69ed916384a2

Observation 74dd834b-6366-4786-b43c-4902ac52591b · inbound

Watch, Remember, Reason: Human-View Video Understanding with MLLMs cites this paper.

Watch, Remember, Reason: Human-View Video Understanding with MLLMs CyberV: Cybernetics for Test-time Scaling in Video Understanding

Reference 229

Resolution
verified exact
arxiv_id, observed 2026-07-02T17:27:15.514528Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-06-27T22:00:28.350003Z digest=sha256:e0c5f1732f45d0d17890d76185cbd99e37533285e0c5cb4c25634e640fd9bc39

Observation 13131be7-d41c-4a63-b60c-6d48758620dd · inbound

Test-Time Scaling in Multimodal Foundation Models: A Comprehensive Survey of Generation and Reasoning cites this paper.

Test-Time Scaling in Multimodal Foundation Models: A Comprehensive Survey of Generation and Reasoning CyberV: Cybernetics for Test-time Scaling in Video Understanding

Reference 61

Resolution
verified exact
arxiv_id, observed 2026-07-02T21:37:25.298267Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-06-27T19:36:57.231932Z digest=sha256:464ed15cb718417166eef4f13d4a638d9a65a42cea183bcfd070cedeb430283d

Observation bec2ef43-3501-4268-ade0-ea680fe68fe0 · inbound

AVIS: Adaptive Test-Time Scaling for Vision-Language Models cites this paper.

AVIS: Adaptive Test-Time Scaling for Vision-Language Models CyberV: Cybernetics for Test-time Scaling in Video Understanding

Reference 34

Resolution
verified exact
arxiv_id, observed 2026-07-03T08:17:45.842398Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-06-27T10:47:41.183211Z digest=sha256:cae2c7232f341776b248c56267adbedcf183124043b0c187caedb85bc8f86ccc