{"as_of":"2026-08-08T17:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:725d14734c4dab04d3d57717ffa8f807e94ba70cbe760d7e86db96aa92d8276d","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:36:16.371915Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:00:10.926459Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:20:06.286106Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2511.14582","last_updated":"2026-04-20T05:56:36Z","snapshot_observed_at":"2026-07-31T08:04:43.452255Z","submitted_at":"2025-11-18T15:22:32Z","title":"OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-17T20:45:37.418493Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2511.14582"},"observation_digest":"sha256:733dd5bab5d3186a6217ecb2dcddeb7e7dacc47afe790088c14de23b0af50f81","observation_id":"5254e4da-853c-4ac8-8643-6b2e024fa21e","resolution":{"observed_at":"2026-05-17T20:50:15.048217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-08-03T17:16:42.542703Z","title":"Humanomniv2: From understanding to omni- modal reasoning with context.arXiv:2506.21277, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10324","last_updated":"2026-06-22T06:41:41Z","snapshot_observed_at":"2026-08-03T17:16:35.340426Z","submitted_at":"2025-12-11T06:18:58Z","title":"EchoingPixels: Aliasing-Resistant Joint Token Reduction for Audio-Visual LLMs","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T17:16:42.542703Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2512.10324"},"observation_digest":"sha256:ebc0b8d9c42dcac30eff7dcee0528ffd02af4aca14fe9892f070a1712a74d77e","observation_id":"c9b2aa38-e488-4e17-83a9-43891b92c31f","resolution":{"observed_at":"2026-08-03T17:16:42.542703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-08-03T03:15:11.377213Z","title":"timestamp","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","snapshot_observed_at":"2026-08-08T12:42:58.671472Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T03:15:11.377213Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2602.08711"},"observation_digest":"sha256:61a877af242a2a144b585505a9a64c680b7f335bd99617d349d59ac265604514","observation_id":"95218483-f9a3-4ebb-b2e0-62ea836414ee","resolution":{"observed_at":"2026-08-03T03:15:11.377213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2604.08209","last_updated":"2026-04-09T13:09:40Z","snapshot_observed_at":"2026-07-06T22:57:22.475588Z","submitted_at":"2026-04-09T13:09:40Z","title":"OmniJigsaw: Enhancing Omni-Modal Reasoning via Modality-Orchestrated Reordering","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T17:45:51.528645Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2604.08209"},"observation_digest":"sha256:742bc4e49d57d620b37dba47bad6109d44855fbec6c611287f4cda595b94d8af","observation_id":"48f64fe9-9131-45e2-8b4d-3a57bd8dfc5c","resolution":{"observed_at":"2026-05-11T06:11:01.853846Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2604.11244","last_updated":"2026-04-15T07:55:01Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T09:50:36Z","title":"Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T15:07:45.595260Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2604.11244"},"observation_digest":"sha256:97685e5c7a1141108ac5a70bb493615b4319191473eef37c93d254e9f9a75b87","observation_id":"ad84e811-f1ba-43c7-ba5f-a6cfadc8f22f","resolution":{"observed_at":"2026-05-11T11:11:03.635645Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2604.14520","last_updated":"2026-04-16T01:21:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T01:21:14Z","title":"Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T12:05:54.551728Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2604.14520"},"observation_digest":"sha256:722153575ea66a86984f91d9e1302e9cad0a1c7b974fb19718ff0d92cf367563","observation_id":"2d070b2f-fe4b-43aa-8871-d9c741d48a2e","resolution":{"observed_at":"2026-05-10T12:10:22.096457Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2604.16617","last_updated":"2026-04-17T18:13:27Z","snapshot_observed_at":"2026-08-02T22:28:35.019925Z","submitted_at":"2026-04-17T18:13:27Z","title":"AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T08:02:53.574120Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2604.16617"},"observation_digest":"sha256:37e28e0f835fc81820ecfe46a1bb377e76b5023ea03bec8d5ca09eb4c3a22080","observation_id":"9c31247b-557b-4232-b4a8-1d464eac4536","resolution":{"observed_at":"2026-05-10T09:18:32.195070Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2605.09996","last_updated":"2026-05-11T05:11:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-11T05:11:22Z","title":"Omni-Persona: Systematic Benchmarking and Improving Omnimodal Personalization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:23.060562Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2605.09996"},"observation_digest":"sha256:1ed22a929effbfb896159397af945212b0d87428de11fac088902abaf91613ee","observation_id":"f0ea401e-48d2-42cb-97e1-5bb6bd5864e1","resolution":{"observed_at":"2026-05-12T06:46:24.087743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2605.12034","last_updated":"2026-05-13T20:38:46Z","snapshot_observed_at":"2026-07-31T22:09:03.342383Z","submitted_at":"2026-05-12T12:16:11Z","title":"Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T03:49:58.240883Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2605.12034"},"observation_digest":"sha256:f785c1e058b523739424a4298087b3935aa6ac908075fc7366918c2517b53b8e","observation_id":"6fec6123-dd93-45a8-be08-fed71f6a3750","resolution":{"observed_at":"2026-05-13T03:52:12.705531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2605.12034","last_updated":"2026-05-13T20:38:46Z","snapshot_observed_at":"2026-07-31T22:09:03.342383Z","submitted_at":"2026-05-12T12:16:11Z","title":"Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T06:06:20.658030Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2605.12034"},"observation_digest":"sha256:5fcc9c4f1b3575dd919e1560a8689b4e378058e04a570df6ab713da6bc0b3137","observation_id":"5e34008f-04ec-4570-9bde-2018ab456caa","resolution":{"observed_at":"2026-05-15T06:09:50.263174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2605.12056","last_updated":"2026-05-12T12:42:44Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:42:44Z","title":"OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-13T04:52:03.076788Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2605.12056"},"observation_digest":"sha256:164e8002546332222da655754aca18a8c7418cab33d830b909c53c6fde9c95e6","observation_id":"f2b4c485-182d-433f-a46b-7206a4820b9c","resolution":{"observed_at":"2026-05-13T04:52:16.258450Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2605.18018","last_updated":"2026-05-18T08:09:37Z","snapshot_observed_at":"2026-07-06T23:28:55.079333Z","submitted_at":"2026-05-18T08:09:37Z","title":"See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-20T12:10:54.874012Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2605.18018"},"observation_digest":"sha256:ec62347a6b5ddd107c9bd000fc39365439c10148976deab9f81918efd59fd0b9","observation_id":"f4bb1498-5f94-4c4e-9d23-241b5b30ffcb","resolution":{"observed_at":"2026-05-20T12:13:16.164422Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2605.22012","last_updated":"2026-05-21T05:18:57Z","snapshot_observed_at":"2026-08-05T07:24:30.530987Z","submitted_at":"2026-05-21T05:18:57Z","title":"LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-22T06:34:57.483234Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2605.22012"},"observation_digest":"sha256:12a7dee3fd9ebecdb43c374c4691a6e8fcc9c407a4466d74116142d0d44cd987","observation_id":"98d9eaa6-52e2-4e35-ae19-f7b6495b6242","resolution":{"observed_at":"2026-05-22T06:36:10.573414Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2606.12018","last_updated":"2026-06-10T12:44:02Z","snapshot_observed_at":"2026-08-03T20:21:32.396120Z","submitted_at":"2026-06-10T12:44:02Z","title":"MODF-SIR: A Multi-agent Omni-modal Distilled Framework for Social Intelligence Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T09:43:56.299302Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2606.12018"},"observation_digest":"sha256:02066298460f9ff1251fd413bc526118c4b826dce020a3002acdf728b2a938e8","observation_id":"b44a9268-54eb-4b16-9f84-0587a19943c4","resolution":{"observed_at":"2026-07-03T10:58:03.460392Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2606.20970","last_updated":"2026-06-18T22:17:18Z","snapshot_observed_at":"2026-08-01T20:10:55.070907Z","submitted_at":"2026-06-18T22:17:18Z","title":"CogniRoute: Learning to Route Social Evidence in Omni-Modal Models","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-06-26T17:37:11.371892Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2606.20970"},"observation_digest":"sha256:c8bda857212802fdf429acc3dcf174bd97faf6d6d8a002e4f39b1702a8176754","observation_id":"db542710-299f-4a10-8c70-18144ce331a2","resolution":{"observed_at":"2026-07-04T03:49:30.332893Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2606.25325","last_updated":"2026-07-20T13:20:39Z","snapshot_observed_at":"2026-08-02T10:17:41.360200Z","submitted_at":"2026-06-24T02:43:26Z","title":"Omni-Perception Policy Optimization for Multimodal Emotion Reasoning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-25T21:31:38.450382Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2606.25325"},"observation_digest":"sha256:d63397c9814b6be71d4df18f594929cc801dfe28d89794f82410793a2f18c2df","observation_id":"be526fec-bd7e-4d07-86f0-23097d16a4f7","resolution":{"observed_at":"2026-07-04T19:20:06.288028Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:377e7b9d8fb3f6bb668e6553ce17e5e9933df60509801d3610654509d6a80367","observation_id":"db441dfa-501f-404a-b6d7-55eb6216d76b","resolution":{"observed_at":"2026-06-29T18:23:51.450720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2607.01667","last_updated":"2026-07-02T03:47:45Z","snapshot_observed_at":"2026-08-05T09:34:18.453279Z","submitted_at":"2026-07-02T03:47:45Z","title":"Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-03T16:37:06.384435Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2607.01667"},"observation_digest":"sha256:9c54b93979b77440227008275c87caf4ba54112483d769b8edf15a835e0ef23f","observation_id":"4f5011fd-6082-4ad2-83be-cf2feec23b41","resolution":{"observed_at":"2026-07-03T16:38:39.614890Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-14T12:48:58.688011Z","title":"arXiv preprint arXiv:2506.21277 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10299","last_updated":"2026-07-11T13:04:24Z","snapshot_observed_at":"2026-08-06T08:13:12.036559Z","submitted_at":"2026-07-11T13:04:24Z","title":"Empowering Long-form Omni-modal Understanding with Robust Audio Perception","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-14T12:48:58.688011Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2607.10299"},"observation_digest":"sha256:2b904c8e0ffcc8978b39551b04a018b7680f002097d26cd1e0ac52bef91db53d","observation_id":"8890fdbd-95f2-49ea-9cb8-00dcbccba527","resolution":{"observed_at":"2026-07-14T12:48:58.688011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-08-01T18:40:15.585890Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context.arXiv preprint arXiv:2506.21277, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17243","last_updated":"2026-07-19T13:24:40Z","snapshot_observed_at":"2026-08-06T12:32:17.783608Z","submitted_at":"2026-07-19T13:24:40Z","title":"LenGuard-GPC: Length Guarding with Guided-Prompt Consistency for Spatial Reasoning Reinforce Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T18:40:15.585890Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2607.17243"},"observation_digest":"sha256:b49f766ae95c98e0b6d1f9ab40e27790b6c6bba83341e9747640d3f4e2fbbb18","observation_id":"6dedb69d-cfeb-400f-85af-d9d6873b62f4","resolution":{"observed_at":"2026-08-01T18:40:15.585890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-08-01T03:25:31.638356Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context.arXiv preprint arXiv:2506.21277, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-07T05:36:43.359157Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T03:25:31.638356Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:9823d15982a1da00fed1b41b6ff547c03c8431f53982776c096d3248167a9703","observation_id":"7602b7d7-0cd3-4c99-ad6b-1853d8bd6901","resolution":{"observed_at":"2026-08-01T03:25:31.638356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-08-04T04:02:54.515743Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context.arXiv preprint arXiv:2506.21277, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-07T05:36:43.359157Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.515743Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:ba612c3db9bc198f703ef9d877e4119bfe5fbbdaef2d13ed73ee8a0b3ba0ceb1","observation_id":"2bcccdc2-9feb-42fb-acce-f629ddb82464","resolution":{"observed_at":"2026-08-04T04:02:54.515743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-08-05T12:00:10.926459Z","title":"Humanomniv2: From understand- ing to omni-modal reasoning with context.arXiv preprint arXiv:2506.21277, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-07T23:12:31.164402Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.926459Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:458ab58524c210ebb51092471dbfb7620bf9d551c63b74daa915029dd583b734","observation_id":"5ff0a44c-6bed-496d-a2cd-b373b08cf750","resolution":{"observed_at":"2026-08-05T12:00:10.926459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.21277/citation-record","integrity":"/paper/2506.21277/integrity","json":"/paper/2506.21277/citation-record.json","paper":"/paper/2506.21277"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-06T22:36:13.100076Z","title":"Qwen2. 5-omni technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:13.100076Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:81945894b4dd749245c8b018ab8512889d34f4491ca547c1afac543dd45b9d7a","observation_id":"d9bc3846-ed5c-434e-b476-f42861c1cec7","resolution":{"observed_at":"2026-08-06T22:36:13.100076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:13.189958Z","title":"Ocean-omni: To understand the world with omni-modality,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:13.189958Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:6665c168d4e15eda6206134495b51092728eb1a8ee16ef144eee794529e8388c","observation_id":"02c0e5a7-4ff0-45df-83de-54ac2fc6f8d4","resolution":{"observed_at":"2026-08-06T22:36:13.189958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-08-06T22:36:13.250680Z","title":"Ola: Pushing the frontiers of omni-modal language model with progressive modality alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:13.250680Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:31e4e66c26921915388beb72699e3e5e7d891374c895197a837e18b422c3bec9","observation_id":"b21fc665-8563-4dac-84d1-1b4f15f5c7a2","resolution":{"observed_at":"2026-08-06T22:36:13.250680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-06T22:36:13.311095Z","title":"Vita-1.5: Towards gpt-4o level real-time vision and speech interaction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:13.311095Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:942668bea2468a94b31fbe19279c9e17772283d12845edcee6d736af1bab76cc","observation_id":"d5cdd6a8-e1dd-4942-a1e9-e3d1f4c900d9","resolution":{"observed_at":"2026-08-06T22:36:13.311095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T22:36:13.354539Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:13.354539Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:1115d0456e16191aba8262b66aaf19d3b5245ec32233807594d25335d2e4be85","observation_id":"cc1a1c1b-483e-4412-9a66-b0bac0933d76","resolution":{"observed_at":"2026-08-06T22:36:13.354539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-07-06T20:49:56.018809Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-06T22:36:13.414790Z","title":"Mm-eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:13.414790Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:de373bcd28e9689f9189358687db4bf22c1e9d6bf4bf6e4c20ae2570a606850d","observation_id":"fccec2a2-899d-4fb8-9ec7-dcb3dea65492","resolution":{"observed_at":"2026-08-06T22:36:13.414790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-06T22:36:13.542217Z","title":"Visual-rft: Visual reinforcement fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:13.542217Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:8e140d79bb711db470529c4f97859781fe5d16d102f9d3f46c4a2d109a067577","observation_id":"2017c838-81a4-459c-89f9-da640f51f34e","resolution":{"observed_at":"2026-08-06T22:36:13.542217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-06T22:36:13.605014Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:13.605014Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:2fa148f9836b7545334f984559ec567291af7d132b8b46c28ac3da7f694c8efd","observation_id":"0a69b6e7-73fe-43b2-a617-8f53fb280752","resolution":{"observed_at":"2026-08-06T22:36:13.605014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T22:36:13.642332Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:13.642332Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:0a224778e2d922939d18aef457ddf82bc22781e6fb2871ff60b7d6675c176c9b","observation_id":"83c73b5c-953f-4b72-b537-44a7165a64ef","resolution":{"observed_at":"2026-08-06T22:36:13.642332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:13.716590Z","title":"Let’s verify step by step,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:13.716590Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:ddf2f4def49320fd8eec2fb194f430b0d95c507c70368c5ef93b919382fdc3bf","observation_id":"2e8db14b-11e6-41f0-95b6-b26a32bac4a4","resolution":{"observed_at":"2026-08-06T22:36:13.716590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:13.791285Z","title":"Deep reinforcement learning from human preferences,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:13.791285Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:5eb3c2f84d8e9671c68752181bf7529a6b0b517a4394f2897118c854c16f4319","observation_id":"00094bd8-5090-4b3d-a269-be2a6a281e40","resolution":{"observed_at":"2026-08-06T22:36:13.791285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:13.854051Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:13.854051Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:0f4db05303fbe652567276dbfcebaccbdf5c05197a0b737b11f2aeda230c8574","observation_id":"c2c5ed5d-25b5-49d3-b8da-6b4715ff9d5c","resolution":{"observed_at":"2026-08-06T22:36:13.854051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:13.927417Z","title":"Daily-omni: Towards audio-visual reasoning with temporal alignment across modalities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:13.927417Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:99815f7eeb57be231c24f1fb35ea39554ac308dbab3fa25edf998a22a12802bc","observation_id":"cadeb560-c2f2-400e-90c2-e440629f71fa","resolution":{"observed_at":"2026-08-06T22:36:13.927417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04326","snapshot_observed_at":"2026-08-06T22:36:14.008552Z","title":"Worldsense: Evaluating real-world omnimodal understanding for multimodal llms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.008552Z"},"links":{"cited_paper":"/paper/2502.04326","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:1d9da3bee1e10968a9c05175d939e1fec99a7d2fbc84ab528e43fcf20ea97f9a","observation_id":"4e3c89a2-e02d-4033-8cbf-0a45e2aebf3e","resolution":{"observed_at":"2026-08-06T22:36:14.008552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15111","last_updated":"2025-01-25T07:26:37Z","snapshot_observed_at":"2026-08-07T11:56:57.969083Z","submitted_at":"2025-01-25T07:26:37Z","title":"HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15111","snapshot_observed_at":"2026-08-06T22:36:14.070930Z","title":"Hu- manomni: A large vision-speech language model for human-centric video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.070930Z"},"links":{"cited_paper":"/paper/2501.15111","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:11e452e32ed9e6231cd668d8484c4918caaff1e38f58ec446fa772145ebf0a84","observation_id":"b6abf601-e5a5-40b6-998a-9d42fbc6d159","resolution":{"observed_at":"2026-08-06T22:36:14.070930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-06T22:36:14.132504Z","title":"Minicpm-v: A gpt-4v level mllm on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.132504Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:2391e65517843a011fe495201afc98038f1e6a4558e35dde28091c524ff8c9ad","observation_id":"8fd7646a-2680-4dfc-ad4e-60c889f0c778","resolution":{"observed_at":"2026-08-06T22:36:14.132504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09596","last_updated":"2024-12-12T18:58:30Z","snapshot_observed_at":"2026-08-04T06:52:46.954992Z","submitted_at":"2024-12-12T18:58:30Z","title":"InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09596","snapshot_observed_at":"2026-08-06T22:36:14.198672Z","title":"Internlm- xcomposer2. 5-omnilive: A comprehensive multimodal system for long-term streaming video and audio interactions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.198672Z"},"links":{"cited_paper":"/paper/2412.09596","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:ae962524eef8f48af1ddc856a3f76aa00e0f3208edc97e09948df76440f5ee03","observation_id":"3ec31ea1-a90e-4493-a56b-c09be0b7b9bb","resolution":{"observed_at":"2026-08-06T22:36:14.198672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12769","last_updated":"2025-03-17T03:05:31Z","snapshot_observed_at":"2026-08-08T06:39:01.516661Z","submitted_at":"2025-03-17T03:05:31Z","title":"ViSpeak: Visual Instruction Feedback in Streaming Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12769","snapshot_observed_at":"2026-08-06T22:36:14.252623Z","title":"Vispeak: Visual instruction feedback in streaming videos,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.252623Z"},"links":{"cited_paper":"/paper/2503.12769","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:925a9287c4a56f588388385ac4ab26d41040f369f4825d6d7381e68ccde801de","observation_id":"dac0beed-5947-41bd-acb0-9d2fb423d933","resolution":{"observed_at":"2026-08-06T22:36:14.252623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13826","snapshot_observed_at":"2026-08-06T22:36:14.298315Z","title":"Video-mmmu: Evaluating knowledge acquisition from multi-discipline professional videos,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.298315Z"},"links":{"cited_paper":"/paper/2501.13826","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:f90ef37097e10d1ab93e863d7e17145d5c686e231443c4877975de5e2ec69db9","observation_id":"eb3617e0-da3f-4432-a830-7d9fd7b958eb","resolution":{"observed_at":"2026-08-06T22:36:14.298315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:18.425958Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis,","venue":null,"work_id":"ad5465b8-8186-42d1-bfc9-0caca25c3fbb","year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.371699Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:f6e55f206910224d32b48066e297ec1e5735781a2b8f0867c7b83958664d79bf","observation_id":"e1e885b5-8e18-4d07-801f-3ce16ed229f2","resolution":{"observed_at":"2026-08-06T22:36:18.497671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18152","last_updated":"2025-04-25T08:05:32Z","snapshot_observed_at":"2026-08-07T15:59:17.660418Z","submitted_at":"2025-04-25T08:05:32Z","title":"ActionArt: Advancing Multimodal Large Models for Fine-Grained Human-Centric Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18152","snapshot_observed_at":"2026-08-06T22:36:14.442972Z","title":"Actionart: Advancing multi- modal large models for fine-grained human-centric video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.442972Z"},"links":{"cited_paper":"/paper/2504.18152","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:5e79d44793a0699a16586c6366f3c1c7173d3cbb444cacd96810df9b318eb4f4","observation_id":"da4ef8b4-87b9-44b4-bb5c-c0544257c32a","resolution":{"observed_at":"2026-08-06T22:36:14.442972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:18.246018Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi,","venue":null,"work_id":"6cb1bd27-7934-4e12-905a-a46573184193","year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.506749Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:7d7a185974b21405b7a42f690de7f39a4159f2597eb418b2d9845b4a82f91d6a","observation_id":"868b216d-5934-4f50-84e1-78e86dcae62b","resolution":{"observed_at":"2026-08-06T22:36:18.346314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:14.573744Z","title":"Omnibench: Towards the future of universal omni-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.573744Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:b3fd607a6a5daefdd2d9af0a5fd7d7a990a0faf621ab751d319f80bc7c2786d9","observation_id":"0ccc3c08-c875-420a-b814-3aef9656fe1c","resolution":{"observed_at":"2026-08-06T22:36:14.573744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-06T22:36:14.648069Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.648069Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:1c69d32dfbbd49907e2ae4c8d0aeea10d50361de3a7f47acb2220f2175f8eaa4","observation_id":"7762b41f-f762-4dd8-8538-925bb04c6bbb","resolution":{"observed_at":"2026-08-06T22:36:14.648069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-06T22:36:14.709508Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.709508Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:b00ab6978e18a70041eaab05a200763865e4e2e621eea0e33a1a4f7098e50715","observation_id":"be188088-53f3-405c-8485-d3c128398b7b","resolution":{"observed_at":"2026-08-06T22:36:14.709508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14432","last_updated":"2025-05-02T16:03:31Z","snapshot_observed_at":"2026-07-06T19:53:56.407834Z","submitted_at":"2024-11-21T18:59:55Z","title":"Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14432","snapshot_observed_at":"2026-08-06T22:36:14.773345Z","title":"Insight-v: Exploring long-chain visual reasoning with multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.773345Z"},"links":{"cited_paper":"/paper/2411.14432","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:89d9eaacd7303a0d837427be08df3631804134c1db5f0d4fdcb0f8c232fc56e8","observation_id":"e3a3aa44-7bc6-4e3b-b410-5bbf810d6588","resolution":{"observed_at":"2026-08-06T22:36:14.773345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:14.841838Z","title":"Visionary-r1: Mitigating shortcuts in visual reasoning with reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.841838Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:98a0bdf29b59d936b00cf27058b4905581458dc692791aad0086b038ef5cb192","observation_id":"7acb12a4-1f90-432c-a59d-a77bcbe0afa5","resolution":{"observed_at":"2026-08-06T22:36:14.841838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-07T23:21:52.042305Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12432","snapshot_observed_at":"2026-08-06T22:36:14.896841Z","title":"Observe-r1: Unlocking reasoning abilities of mllms with dynamic progressive reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.896841Z"},"links":{"cited_paper":"/paper/2505.12432","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:47ded081d7ee0a9dfcee42c33588a9a2ad2fff0eb1ce756ae6949956d1ad649a","observation_id":"ccc0b7ab-2e2b-4db4-ad07-1df3b15e635b","resolution":{"observed_at":"2026-08-06T22:36:14.896841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05379","last_updated":"2025-03-10T07:11:14Z","snapshot_observed_at":"2026-08-07T21:57:26.595540Z","submitted_at":"2025-03-07T12:46:42Z","title":"R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05379","snapshot_observed_at":"2026-08-06T22:36:14.965189Z","title":"R1-omni: Explainable omni-multimodal emotion recognition with reinforce- ment learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.965189Z"},"links":{"cited_paper":"/paper/2503.05379","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:5677cca861b761357ca38c5eb958648ca41c2bdb913d7f61f9afea1c7b75d211","observation_id":"b5e06ef8-e5bd-4aa1-a082-be15c5a55d81","resolution":{"observed_at":"2026-08-06T22:36:14.965189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04623","snapshot_observed_at":"2026-08-06T22:36:15.038514Z","title":"Echoink-r1: Exploring audio-visual reasoning in multimodal llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.038514Z"},"links":{"cited_paper":"/paper/2505.04623","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:8884ec8ff8fc7e9f91d427d2626a8e95831a4f39f002efd7c4dda860296176e8","observation_id":"2caf0f52-2c2f-4cb8-bcf5-c365bbbc7f9b","resolution":{"observed_at":"2026-08-06T22:36:15.038514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-06T22:36:15.103448Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.103448Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:51aff256e70d85cc5b361e8903ed6ab5ef0cf57088049cd99985edd6e0c709cf","observation_id":"8f50cf77-265a-42b5-a02d-2589dfdb4edc","resolution":{"observed_at":"2026-08-06T22:36:15.103448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-08-06T22:36:15.170351Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.170351Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:80c99d00c164b1c1e8ec9fa119f5e5aa697cfe2cd1e6a4e44141564d9943c59b","observation_id":"41b50db4-1a75-499d-8957-a94752de91bb","resolution":{"observed_at":"2026-08-06T22:36:15.170351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:18.121868Z","title":"Social-iq: A question answering benchmark for artificial social intelligence,","venue":null,"work_id":"bf74e88e-25a1-48ae-a161-7ffe683ff4a3","year":2019},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.224232Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:a5edd75242b8abd6ead948f1cf21575c6037504f2d8994d3650e134ff6d890a6","observation_id":"976133f1-7b17-43e2-9abe-947893c2214f","resolution":{"observed_at":"2026-08-06T22:36:18.184139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:17.998852Z","title":"Social-iq 2.0 challenge: Benchmarking multimodal social understanding,","venue":null,"work_id":"fa1bf5cb-9a59-4e45-9f7d-3146a42dcea3","year":2023},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.295001Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:f239cfd2545e4c233c865cedca71ed6025b89eabc63541271c6fb85c0978057a","observation_id":"6f381da0-0ce4-4880-bcce-f2d97caca2c4","resolution":{"observed_at":"2026-08-06T22:36:18.047248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15401","last_updated":"2024-05-23T11:42:08Z","snapshot_observed_at":"2026-07-06T15:47:15.230195Z","submitted_at":"2023-06-27T11:54:57Z","title":"Explainable Multimodal Emotion Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15401","snapshot_observed_at":"2026-08-06T22:36:15.352601Z","title":"Explainable multimodal emotion recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.352601Z"},"links":{"cited_paper":"/paper/2306.15401","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:4f45103369ac3725ca25918b0425be8502d9b2e8e384c2834c7a0e47f96ae1a1","observation_id":"6fb568fc-47de-4fac-9f85-d4df837e52ca","resolution":{"observed_at":"2026-08-06T22:36:15.352601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12274","last_updated":"2025-06-04T03:38:02Z","snapshot_observed_at":"2026-08-08T12:42:10.938930Z","submitted_at":"2024-07-17T02:44:26Z","title":"MDPE: A Multimodal Deception Dataset with Personality and Emotional Characteristics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12274","snapshot_observed_at":"2026-08-06T22:36:15.404271Z","title":"Mdpe: A multi- modal deception dataset with personality and emotional characteristics,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.404271Z"},"links":{"cited_paper":"/paper/2407.12274","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:a7b9a4fad7a92be2ae65f5b87af8a50b3ffa4795483ed0fd23c4dadada9c3713","observation_id":"eff13216-134e-4527-abcc-8b7c9b4f2b5c","resolution":{"observed_at":"2026-08-06T22:36:15.404271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T22:36:15.530089Z","title":"Dapo: An open-source llm reinforcement learning system at scale,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.530089Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:356affad02fcdd3095ac386669689c4b80f2ce25a932cdb97bf3e1114a0ad0b2","observation_id":"0ac7f971-756b-4df0-a07a-adb9a148390e","resolution":{"observed_at":"2026-08-06T22:36:15.530089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-06T22:36:15.612633Z","title":"Understanding r1-zero-like training: A critical perspective,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.612633Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:416d675d2354491d8a988569267bc255735ff33035444d95e2cd40d7363a188a","observation_id":"6e4ade0f-7057-44cf-9251-b15672f059d8","resolution":{"observed_at":"2026-08-06T22:36:15.612633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:15.669533Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.669533Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:ee089165e20c9f181160014d0ba971963238c848640dfc86493e453437732130","observation_id":"737c5beb-ed58-4d15-bef9-3c84af483d50","resolution":{"observed_at":"2026-08-06T22:36:15.669533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:15.737016Z","title":"Rouge: A package for automatic evaluation of summaries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.737016Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:00c8028970db53db513083a928505568802816864f9dfc2016bf4b57164383b9","observation_id":"65645993-1ed6-42cb-9e0d-07efdf6be16a","resolution":{"observed_at":"2026-08-06T22:36:15.737016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-06T22:36:15.835979Z","title":"Video-r1: Reinforcing video reasoning in mllms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.835979Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:7e5672b26f5752a6dc71080f6c35e49ca5df50d2b2aebe8c7c632e9e43da73d2","observation_id":"dab78a1e-8eb2-4f93-a1f6-d2595de50d6e","resolution":{"observed_at":"2026-08-06T22:36:15.835979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:17.845196Z","title":"Gemini 2.5 pro,","venue":null,"work_id":"56abac58-cb38-4941-a9b4-de8800865ced","year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.883030Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:6a27211c50171ea0baff1b99fffa041e2d554f15ed8f6924b66d952d3879b03d","observation_id":"cc07c2b5-094e-49ea-8069-d1d9f188f4d7","resolution":{"observed_at":"2026-08-06T22:36:17.887554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:15.960063Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision language audio and action,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.960063Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:5f2abaea7e2958cde145aafc02c41442d355bf7a00f43cffb355e3fcba1f6d52","observation_id":"361cf6a6-743f-43ea-9829-93aa50d84b9a","resolution":{"observed_at":"2026-08-06T22:36:15.960063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T22:36:16.021781Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:16.021781Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:e294674d535bb204bf2c3eb933ee46cbdb354bb67d53796e8818c00b7d46474d","observation_id":"dd9cc03c-bc9a-42bf-9f5a-a2e6bf2ac43f","resolution":{"observed_at":"2026-08-06T22:36:16.021781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:17.712256Z","title":"Introducing the next generation of Claude,","venue":null,"work_id":"2136a641-6864-476a-b8c7-2ef0dfad3d61","year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:16.124771Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:4fd193df980adeca62c1994e1f3b57ec12109f0384147965231bc8c20196493f","observation_id":"a0a0d3ee-7351-42c2-8670-9c7d5b0507d0","resolution":{"observed_at":"2026-08-06T22:36:17.754014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T22:36:16.173667Z","title":"Gpt-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:16.173667Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:da1926a32e9c8cdbad7644d263bf61c3f988243caeb05d1a7321ffad48d16a65","observation_id":"41a5225d-a5b5-4634-887a-413f92aba628","resolution":{"observed_at":"2026-08-06T22:36:16.173667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T22:36:16.270052Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:16.270052Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:83b2d9e89a7f7859a3554aaf42250576dbfc112576e6349759436d9a21d10b84","observation_id":"942a1024-803c-49a2-93fa-b668823c8534","resolution":{"observed_at":"2026-08-06T22:36:16.270052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T22:36:16.328116Z","title":"Openai o1 system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:16.328116Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:eb317faa103eb1ea3e0aa6cb8276307df25bb0b8c2b227ee7bbd65f8e40d03d8","observation_id":"64396dc5-da23-4b78-9b50-770932dda3d7","resolution":{"observed_at":"2026-08-06T22:36:16.328116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07653","last_updated":"2024-07-10T13:34:14Z","snapshot_observed_at":"2026-08-05T16:35:40.046172Z","submitted_at":"2024-07-10T13:34:14Z","title":"AffectGPT: Dataset and Framework for Explainable Multimodal Emotion Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07653","snapshot_observed_at":"2026-08-06T22:36:16.371915Z","title":"Affectgpt: Dataset and framework for explainable multimodal emotion recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:16.371915Z"},"links":{"cited_paper":"/paper/2407.07653","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:e92e86f49f0e1ce1635e963fb04e791957adbe9ee9ccc88b55ccdea26f0b1566","observation_id":"c104b7a9-1c1f-41f6-97fa-cccf779cf544","resolution":{"observed_at":"2026-08-06T22:36:16.371915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 23 inbound Pith citation observations for arXiv:2506.21277."}