{"as_of":"2026-08-11T12:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:217a9cb9494c5f98ce15b7b30883ba08872b83e141e35bfd0c432577a8d156eb","coverage":[{"denominator":300,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T09:48:27.652901Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T18:04:17.133693Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.12195","snapshot_observed_at":"2026-08-01T18:04:17.133693Z","title":"Internvideo3: Agentify foundation models with multimodal contextual reasoning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:17.133693Z"},"links":{"cited_paper":"/paper/2606.12195","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:0ae5094aff77044ae749c11592266b4a1e08393e30f923394e8eab477b60df4b","observation_id":"02c8c4c3-0f6e-4e29-b8cc-cc9cf28e9563","resolution":{"observed_at":"2026-08-01T18:04:17.133693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.12195/citation-record","integrity":"/paper/2606.12195/integrity","json":"/paper/2606.12195/citation-record.json","paper":"/paper/2606.12195"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.14482","last_updated":"2026-06-11T10:07:56Z","snapshot_observed_at":"2026-08-06T07:23:27.418432Z","submitted_at":"2026-03-15T17:02:40Z","title":"V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning","version":3},"cited_work":{"arxiv_id":"2603.14482","doi":"10.48550/arxiv.2603.14482","metadata_source":"pith","pith_arxiv_id":"2603.14482","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V-JEPA 2.1: Unlocking dense features in video self-supervised learning","venue":"cs.CV","work_id":"3da7cd7a-c3f3-4e48-9704-4320e54aec60","year":2026},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2603.14482","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:176191c9332b0a0b79eda63dc974f273c11d809290b6d4380b8d294047198167","observation_id":"d15cbd7b-c4eb-4929-acc8-f3e374f16fb9","resolution":{"observed_at":"2026-07-03T10:48:02.917527Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":"2506.09985","doi":"10.48550/arxiv.2506.09985","metadata_source":"pith","pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","venue":"cs.AI","work_id":"a9c28401-f16a-4933-89f0-788e2f94e52b","year":2025},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:7263a57b63298b9783ff6021d8d1431c401646c305e002b2721601e6a014cca4","observation_id":"d2c6d8f3-4748-4950-940e-60d27a1e7afd","resolution":{"observed_at":"2026-07-03T10:48:02.914700Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-03T19:08:37.559938+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T19:08:37.559938+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08471","last_updated":"2024-02-15T18:59:11Z","snapshot_observed_at":"2026-08-07T02:30:11.447693Z","submitted_at":"2024-02-15T18:59:11Z","title":"Revisiting Feature Prediction for Learning Visual Representations from Video","version":1},"cited_work":{"arxiv_id":"2404.08471","doi":"10.1145/3178876.3185996","metadata_source":"pith","pith_arxiv_id":"2404.08471","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Revisiting Feature Prediction for Learning Visual Representations from Video","venue":"cs.CV","work_id":"f7251dcf-5341-4915-bfe7-27812387b61a","year":2024},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2404.08471","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:abfa3d83b3a82c782d37195b8d8903fcc62cacf06d028842b960b26ab8fc413c","observation_id":"f49e3c2d-f3b2-41d6-85e6-2cc0fdb44ec5","resolution":{"observed_at":"2026-07-03T10:48:02.916908Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-23T01:54:34.489718+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T01:54:34.489718+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:1de8e90854a773b6c115101b023da94236190814fcd2c8de8ac511ef9b0a368b","observation_id":"e8d72ffd-a59a-4c99-a667-148e9f066f75","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-07-31T21:36:45.596575Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":"1803.10122","doi":"10.48550/arxiv.1712.00409","metadata_source":"pith","pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Models","venue":"cs.LG","work_id":"07227eee-8445-4c98-bce4-c6a6fd5ed907","year":2018},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:37ca4b1dde8d74a44f44c39fdf8ba2ccf5c4340772fad287b5f335b5d3b913f2","observation_id":"2efbf8a5-55c5-446a-8ffb-303883f2ebf4","resolution":{"observed_at":"2026-07-03T10:48:02.911671Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-08T11:15:53.631141Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:683dd5067a7e5317ac1e80458b20b5797e86c40056f4d9861503e019d954f55c","observation_id":"3520b587-a9e9-4f67-800a-215826e6ea14","resolution":{"observed_at":"2026-07-03T10:48:02.945834Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:c8eff3230563d82d70be7dcf85c7ba2ebd8c1d04153accaf63045c20d510e3f6","observation_id":"4e02f87c-5822-439f-a655-8b0104798374","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:0074f2ad62c15ca375ccadf4f05f0c751bc0b886c32be26da7b8dc082159f6b4","observation_id":"a1bc11ee-87d1-4e01-8a90-1ca3840e8f7b","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":"2601.03267","doi":"10.48550/arxiv.2601.03267","metadata_source":"pith","pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI GPT-5 System Card","venue":"cs.CL","work_id":"ca87689a-0d29-4476-b504-b65dbbb08af4","year":2025},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:edc927e400f1ba82c19101323a68946476f6262a55355e1244e67bb7e1497f2e","observation_id":"04d415ec-2abf-47fd-b308-b3a8ed199088","resolution":{"observed_at":"2026-07-03T10:48:03.187254Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-10T00:38:24.809631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T00:38:24.809631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:395ee0c31e78f0783153a38ba15b37844e01fdbc7af266316be4da420f636707","observation_id":"6386566b-b47c-4ad6-b4f5-088ff4416594","resolution":{"observed_at":"2026-07-03T10:48:03.189549Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:fd8e898a7af44a2543b1f35bb905551de74b91ba22b5ee6903ee47a3a0988195","observation_id":"1d188e8e-622f-4eaf-9e52-54c304c7be7d","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09629","last_updated":"2024-03-18T07:56:48Z","snapshot_observed_at":"2026-07-31T09:25:34.205362Z","submitted_at":"2024-03-14T17:58:16Z","title":"Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking","version":2},"cited_work":{"arxiv_id":"2403.09629","doi":"10.48550/arxiv.2403.09629","metadata_source":"pith","pith_arxiv_id":"2403.09629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking","venue":"cs.CL","work_id":"cd82874a-9e9d-46cb-9716-a06d454a9c7e","year":2024},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2403.09629","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:51d32a986d55a2688126ef9df9bab876e75748ee02d458a38ef5221a5f542042","observation_id":"763142f9-c533-48d9-8897-df2db1b26bee","resolution":{"observed_at":"2026-07-03T10:48:03.177534Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:fafeb5f542e89aa24cbeaef763d0c28975dedce00a483342d1429354fe57eda5","observation_id":"5aaf3362-7b6d-479e-b45c-56a8414758a6","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:2e0bb3be0a6db98b93bb775565550af9662347d09fcb56a8d732a2e712a75835","observation_id":"b4b281c9-5d41-46e6-8fbd-94bf7ba8e314","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"The eleventh international conference on learning representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:068c4b56eeb3902d5af7f7c7b9b7d3e08976fb8d1ae1ecd60bd161573221e73a","observation_id":"0b5494e0-da3d-49d0-a7a3-7ace9e33d6ff","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:c36a9361422051a4649a19a7620c36f205829dd5bf7cc0de964ac2c92247de13","observation_id":"3fb389e0-15c5-415f-acea-10b39932c277","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:e0263151896839d23199e079d7d5ff54a91700836caff3061286ef2d6adee121","observation_id":"4766ea8c-42cd-4fb6-b276-b26db55b585d","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:cf26dd78260c3f51c38eb1f462b2a16abd34627bce361e61be505acc0678864c","observation_id":"758d6d7b-162d-4725-896d-1b330ecb53be","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-11T07:29:21.471807Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:db37e662cc31474c6a5dfd282bcc7ca7807ab0c7232752c06a133a264ea2f5e5","observation_id":"3079e832-34b4-4472-b8aa-f3743e308d3c","resolution":{"observed_at":"2026-07-03T10:48:03.180078Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Proceedings of the 2025 CHI Conference on Human Factors in Computing Systems , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:1408513dad997a86aa2cc1ca9b708ae9a5dc5144d284ea44a59264de2b43cfde","observation_id":"caea3a30-b8d1-4ff7-858f-ba8a3a6f3ef2","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:560b119f0e7cc01a8f90193244d9ffa1849d1316530e3049c9c8e79ed99848ae","observation_id":"fb811108-c52b-4430-ab08-62953bd0d25a","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:e414a38f81ddf923c434b685fc05a5b9ee6729ec4ad4a93ceea88263c4702b12","observation_id":"0a049c9d-5eb0-47ba-9ba8-955ebf952fb2","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":"2410.02713","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-07-09T21:36:34.348434Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","venue":"cs.CV","work_id":"e598f516-d992-449a-ab6d-6c788b3a1d7b","year":2024},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:8a4d5bc1c5534bb4fe729f9794d02c4a066c52962f2335355efff9383bf2c54f","observation_id":"39bd2809-6fa6-447c-a519-6f6e7fb985f1","resolution":{"observed_at":"2026-07-03T10:48:03.172762Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"arxiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:e725775df4102686f32fd18cab2a599f1062e891cd0adbebabb3c03b2c5b3876","observation_id":"fbd84177-dcc5-43bb-8649-df61f4558246","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.17269","last_updated":"2026-05-20T05:00:31Z","snapshot_observed_at":"2026-07-06T22:33:34.164422Z","submitted_at":"2025-10-20T07:54:46Z","title":"FineVision: Open Data Is All You Need","version":2},"cited_work":{"arxiv_id":"2510.17269","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.17269","snapshot_observed_at":"2026-07-04T10:29:45.305575Z","title":"FineVision: Open Data Is All You Need","venue":"cs.CV","work_id":"5be93f64-c161-48c7-a619-708d642d5771","year":2025},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2510.17269","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:74f6d3454c5a6a365af6a60048a4d747e9216ee51e06d1d69e9eca17cc9eda86","observation_id":"6f94c4bd-f0f9-4aad-99bc-854e50711c10","resolution":{"observed_at":"2026-07-03T10:48:03.179788Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":"2501.12386","doi":"10.48550/arxiv.2501.12386","metadata_source":"pith","pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","venue":"cs.CV","work_id":"5801b83f-d5f4-4020-bad2-4bc47f71fe7d","year":2025},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:d324eb245359d960589a082dc54494001d4a5c57412308efae1d771966022732","observation_id":"067fdded-660c-4c46-95ad-f2f2b80fb3ae","resolution":{"observed_at":"2026-07-03T10:48:03.182059Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.10611","last_updated":"2026-04-02T16:01:02Z","snapshot_observed_at":"2026-08-02T06:45:30.387180Z","submitted_at":"2026-01-15T17:27:44Z","title":"Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding","version":4},"cited_work":{"arxiv_id":"2601.10611","doi":"10.48550/arxiv.2601.10611","metadata_source":"pith","pith_arxiv_id":"2601.10611","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding","venue":"cs.CV","work_id":"f0dc2969-bd90-4a5d-81df-d557352690b6","year":2026},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2601.10611","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:8e6036a8c9e47b61c146dec2045c1e819d1b95caf8a9163e53fcbff1cb7c4f38","observation_id":"d7fdceb9-7612-44e9-a1e4-bb1f62bcff62","resolution":{"observed_at":"2026-07-03T10:48:03.182357Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.18154","last_updated":"2025-09-16T19:41:48Z","snapshot_observed_at":"2026-08-09T11:10:24.301223Z","submitted_at":"2025-09-16T19:41:48Z","title":"MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe","version":1},"cited_work":{"arxiv_id":"2509.18154","doi":"10.48550/arxiv.2509.18154","metadata_source":"pith","pith_arxiv_id":"2509.18154","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe","venue":"cs.LG","work_id":"21d4b019-63d0-49e5-b51b-350ef4783709","year":2025},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2509.18154","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:15790527fb758a913e4d8a7226da1625f5a8599d6f6225a67ce3c7591bdc6ca1","observation_id":"3b93fb68-def3-433a-81bc-c2ecb7273df7","resolution":{"observed_at":"2026-07-03T10:48:03.184975Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:18.923957+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:18.923957+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Qwen3.5: Accelerating Productivity with Native Multimodal Agents , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:3e062df889b728cff6fdadca9d2a5816f24a9127a302dd3d76b3b009e1d3e1ce","observation_id":"5d1d5be9-58c9-4e64-852d-8549a0d27deb","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:5934492e5e16e0511c998bf15cba9e0c46aa84aef9c07d74a8b179fb55d9dde0","observation_id":"dc3672fd-bfff-41b5-a7b6-7a949378ff18","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":"2602.15763","doi":"10.48550/arxiv.2602.15763","metadata_source":"pith","pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","venue":"cs.LG","work_id":"ad29b1a2-bf77-46b3-9ead-fb62b1d2c6fe","year":2026},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:9b052e1608014604d9d60c3d3cf1a4e49584118b954c28acc46beef5b42db7c0","observation_id":"c1a9e372-b008-4451-819c-f737c0d9c06d","resolution":{"observed_at":"2026-07-03T10:48:03.153084Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.10604","doi":"10.48550/arxiv.2602.10604","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Huang, A","venue":"Open MIND","work_id":"d15e4fef-8992-4e30-a202-080b8a4c6606","year":2026},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:22f84108c3f26ef7942ce892af7f4c0fee1981d6d4baf0c835ade3480951f383","observation_id":"35862d1e-06e6-47f7-8d1c-63d4307702c9","resolution":{"observed_at":"2026-07-03T10:48:03.156179Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:7335491aff02f299179be66da0ad4caf2b33a930eb937ef3de5df9fa8e418287","observation_id":"30e83669-fd66-44ad-8758-9ce7dca9ae74","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:44362f3eb41cc6d2a5b7a477884e445f9b1162571445c2d4aaf7e5fc51da1184","observation_id":"095b7fd2-d509-4917-8359-0b9271782241","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":"2405.04434","doi":"10.1145/3593013.3594097","metadata_source":"pith","pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","venue":"cs.CL","work_id":"1e1df141-cac8-47fd-b068-c4c96e51e331","year":2024},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:eae6b2646076eb46d90a2e1d89a0fe59f0494b3f8cc13a9470b97f0ef93751d6","observation_id":"6e45bfa6-8a70-4f3a-941a-baab0324fb70","resolution":{"observed_at":"2026-07-03T10:48:03.147721Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:0ab0e5182d73bafa338ef1719439eaf9848fa115186beb4493c06ab360928be4","observation_id":"b23a701e-4e54-4303-b3bc-3886b49a8bc0","resolution":{"observed_at":"2026-07-03T10:48:03.153299Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-08-07T19:30:34.681869Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:78177d81edb3d740c3edb18684df1ad6da9cc4a9e7deedeb80441ce8a629d361","observation_id":"3e276bbf-6ebc-4ead-83e0-f496a9d6499a","resolution":{"observed_at":"2026-07-03T10:48:03.158827Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:db51c01370bd8cb7ff1e91f888285e2fc7f67f16af91a2d6a2c20e5caa087db3","observation_id":"d6c40ece-16c7-404e-881e-385796a8be7b","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":"2602.02276","doi":"10.48550/arxiv.2602.02276","metadata_source":"pith","pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi K2.5: Visual Agentic Intelligence","venue":"cs.CL","work_id":"d690be8f-5d53-49b0-b1e7-79668eb8fcdb","year":2026},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:5f00cd7a272e2a761f029cbcb6761730e88347abfaa754be6ea54a2ec74661a6","observation_id":"b884b8ad-6975-4862-a1ff-cb73bf9daf4a","resolution":{"observed_at":"2026-07-03T10:48:03.135272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-07T20:38:24.673777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T20:38:24.673777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:af92b85bf377ed6a0dcd93705716cf38eb2f2217228e603ff5c417f6d493e848","observation_id":"fcf9511a-254f-449a-92d0-9631d348c4be","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:c8f0eee8cb704ce4494789df004724bb41c669c3eb7a5a23b2392c02fc38871a","observation_id":"1617a9e2-5470-49b2-8af5-2a165cde6ae6","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:d069137fa735d2b751207b133062d92acc007f04a01be6991cb1c74d9e9c39f7","observation_id":"e120af6a-65ae-489f-b59e-a8714757e604","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:1754b20d2a1eab3127dc368f3e7dd0e66284b008a9a74be4f04420fc9e31024c","observation_id":"9ca5ab0a-376c-43b9-9541-07646a7c21a7","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.09668","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:34:41.894993Z","title":"Step3-vl-10b technical report","venue":null,"work_id":"b7059382-9467-45e4-b9f6-a83382eaeba4","year":2026},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:7fddeba12b5dd863bc2f45615a4669f263509cc4e4de22af808d576e10f7b29f","observation_id":"851f6889-d71d-422a-af83-29af343c2709","resolution":{"observed_at":"2026-07-03T10:48:03.138148Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:064b5a098c2300f84d83fbeb8d6840400c3d9d45c68746afa763e8fe659a7308","observation_id":"deebf6cf-ae76-464a-b721-a0c36a43571a","resolution":{"observed_at":"2026-07-03T10:48:03.142809Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:0ea820c72d8f6dc1c0b87541467b6aef63392296e3bafac57bb578f6fae9514f","observation_id":"64c512f6-3988-429e-a4cf-077e1340ae1e","resolution":{"observed_at":"2026-07-03T10:48:03.161113Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-07-31T23:49:25.878472Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":"2512.02556","doi":"10.18653/v1/d18-1512","metadata_source":"pith","pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","venue":"cs.CL","work_id":"07c85cc5-4086-4abc-823b-6d0f4ff784d0","year":2025},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:0b84880fc3cc281f99ad8b67b3589e78eede9592a5dac010d77cbe48540d8e0a","observation_id":"54c2117f-fa73-41f8-a638-c48fdf0b39e8","resolution":{"observed_at":"2026-07-03T10:48:03.191919Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:924f002569b9ca5db348c512fce3beb86df437cf7c82aee9e534b5ae8a305dcb","observation_id":"36156d0c-4d33-48af-87f9-17346d110183","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:951b3c334c2e50e70409f94d95d0faa9b3fbd23ded64e80bf3c4de6852e485bf","observation_id":"7a9c2c7b-3ea1-424f-be20-76922501b865","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.18873","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T10:48:03.203643Z","title":"Dsi-bench: A benchmark for dynamic spatial intelligence.arXiv preprint arXiv:2510.18873","venue":null,"work_id":"a0489976-b86f-467c-8e2c-28f3f1380526","year":2025},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:92dd0f73fdccaa46e677a5219989f8ca126d2188756d57ae44a888de10e39836","observation_id":"7b9dc48b-114c-48e4-9079-8d726a9eec72","resolution":{"observed_at":"2026-07-03T10:48:03.205242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23764","last_updated":"2026-05-23T03:42:56Z","snapshot_observed_at":"2026-08-07T12:36:19.326245Z","submitted_at":"2025-05-29T17:59:52Z","title":"MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence","version":3},"cited_work":{"arxiv_id":"2505.23764","doi":"10.48550/arxiv.2505.23764","metadata_source":"pith","pith_arxiv_id":"2505.23764","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mmsi-bench: A benchmark for multi-image spatial intelligence","venue":"cs.CV","work_id":"3c86b01a-2b7e-4a70-94c5-92bf4d05ad52","year":2025},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2505.23764","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:5e6329134ccc8482726453bda89b7e371a9a8efd362429ed4047731fb58bb968","observation_id":"bffcd23b-6c9e-4041-b333-1e5c27b8c6f9","resolution":{"observed_at":"2026-07-03T10:48:03.160875Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:7b30bf133ba42884d2121dd1b9f974adc8716ba94a7774627bb008d6de86e17f","observation_id":"a343a160-20c0-4ee9-a5ac-5d074027ab7a","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:03aa23fec8c30458ea006a109ccbad88ad510f79e464b021afa06d08670fa65d","observation_id":"901738ca-96b5-4233-b361-92f8af6c1835","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:f01797aaf6223b25e59948ca22d6e95d5d7244e48f25965863ff58cf270c5f31","observation_id":"5a404da5-84a8-43b0-9bd6-65e01f1f573e","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:37a7acae19f706b60b4cd83328dcbbafb32308fec0be3b6b709449a175718ab1","observation_id":"ccd22cc7-6830-4dd6-904a-38d1716991d5","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:e80f74ca23caa2a86f417258c7c8ba647adcee7df1ca7fefa6841cca5422be72","observation_id":"ead62b95-4bfa-439e-9736-5edcc714551e","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:8abd1fd806933c382556035338906fb931df4f8642527e90e7f74bd3d2a94302","observation_id":"ebd14c95-47e6-4e3e-8484-3ac90d65ce0f","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:b06c18b5b38ad1c524b930b472c7ac104ab99804cc18ca31ef16d347d863a0e8","observation_id":"c748f440-9e64-4282-bcca-6afff8f876e1","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":"2503.09516","doi":"10.48550/arxiv.2503.09516","metadata_source":"pith","pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","venue":"cs.CL","work_id":"0e0b7549-2bc4-4574-aa7f-588ffa16eaae","year":2025},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:f7a0c75653d717881444dec95729850043560246c3cafa49d8108130f712d325","observation_id":"51c1e0f5-38e3-4ad5-a0f4-6801fc3a1689","resolution":{"observed_at":"2026-07-03T10:48:03.184805Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Hugging Face repository , howpublished =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:76c126fa24692af865e3192f06bb000a6fd3933c7e50493fd9a1ebf3daa77682","observation_id":"ce157bbb-ce03-4484-b12e-e3315a6afc37","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.10863","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T10:48:03.213683Z","title":"Mmsi-video-bench: A holistic benchmark for video-based spatial intelligence","venue":null,"work_id":"5576e252-6316-45fb-a511-bcbf65609546","year":2025},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:b5ee9e335d7221c5021177c3b6e0e3fab178db21bc6f579fd217a4b28af97107","observation_id":"40458348-34ce-4498-8d7f-9e5d31b50f4b","resolution":{"observed_at":"2026-07-03T10:48:03.214993Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:2e14c2243bcb3598a57d56709792d284f77193bd851ee5514b7c9f22b3cfc947","observation_id":"9008e37c-b381-4886-91a4-39d4d05a29f9","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:8109ad050a2c2b8434ec41d0513a5d08bc67f16b7f7f51c3f2f6034eb9ba9831","observation_id":"debe2a1b-f960-4630-a621-115eb0da35fe","resolution":{"observed_at":"2026-07-03T10:48:03.194402Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":"2508.18265","doi":"10.48550/arxiv.2508.18265","metadata_source":"pith","pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","venue":"cs.CV","work_id":"b8f5e260-fff5-444e-bcf5-2c42cfefd83d","year":2025},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:4f61ede759dd58155a5b4b631131af3e5f7123bd8115fde3235c0aef8d85497d","observation_id":"553d6468-3e84-4ac4-8d72-63e0f1f53020","resolution":{"observed_at":"2026-07-03T10:48:03.196700Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-10T17:38:12.771444+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T17:38:12.771444+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:34e9e774c526548833875e7c2feb891aedf9ff8f3bbd0ea7c9a3f7725b9e7eeb","observation_id":"b2186011-4fae-425a-9efa-910710d4bf73","resolution":{"observed_at":"2026-07-03T10:48:03.106833Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"ICML , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:59225f31a034a3a3cf84d1bf0f273a6fbfb754e1e7ce0e34ad3ee415acdd1a00","observation_id":"43aa0c1c-645d-44ec-902f-d248e76a9180","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:c75a74513930aaa504996e0423498ee416abb7559445b066e8aa2173cbd02b1a","observation_id":"3abe2257-2619-464b-a16f-0d7353333928","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Neurocomputing , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:c5b81d5eab017bae4b0e58b9ac09366f2a80b0e7a9e9cfa3f396f0fa2704d15e","observation_id":"2c338775-2a18-4995-bcee-08a20d98e88a","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"CoRR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:f68fd37c853f95bb69b7e9e17fe7df38ea959ea4f35a58abfb4c30d375b07526","observation_id":"1412aba6-5475-408f-9e70-158db8acbd48","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:76fb25ebaded7cf92b0eb1c9666ddaa309d25814de7934f7326211ef946be00d","observation_id":"00ed264e-e0b8-4b82-97ad-493476fe6b1e","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:570fd8668b4091cbaa2b2009ebe9c6f6d01d8087a74c804e53c3f2403cae8508","observation_id":"bef0ecdd-1dd3-452a-bf45-091c0466b3b5","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Findings of the Association for Computational Linguistics: EMNLP 2020 , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:a39c13d2384245db30da81bf9c0d1183fbd10f41496d7ab1ba0ff55a8cc639d3","observation_id":"4d65bcc4-ab84-4259-90ef-d885c961300e","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:ed3776c00e5044115b07f7a050fce22691818af4d92c2b70685069017ac799d1","observation_id":"84b2f344-73e1-4fe2-943d-63aefc74c4b0","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Proceedings of the IEEE conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:f935550c0459723187601579f8e058598ba69dde7ea95c650ceef43a5a6fc75c","observation_id":"6377a3c0-4ddb-4c39-a156-f8a01125d46c","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04955","last_updated":"2022-07-19T18:14:36Z","snapshot_observed_at":"2026-08-10T15:55:33.977855Z","submitted_at":"2022-03-09T18:58:28Z","title":"Temporal Difference Learning for Model Predictive Control","version":2},"cited_work":{"arxiv_id":"2203.04955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.04955","snapshot_observed_at":"2026-07-04T19:00:06.256105Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"7bad3438-3b8c-438f-98c5-122e3c23095a","year":2022},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2203.04955","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:a5eab6a7255ef4f9dc3b585065baa62101ee12ca9d488c0c5baa02cae23643c3","observation_id":"a9e4387f-ba8b-4e27-9052-eb84d5f43e5c","resolution":{"observed_at":"2026-07-03T10:48:03.124660Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:053bbed88ef767b5d1de58f03e8ba6595d5488a3997e7e90c56485e3758bc63e","observation_id":"aca501ea-fc5e-48a3-9942-7a3e92d290a5","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Journal of machine learning research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:95697ab974b4cadae137ed690443867d8c10866a04aa7653be3cb9cdb351720c","observation_id":"6ca6f77b-f490-4541-92e6-5da835a0e0d9","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:45248dad9f12483b7bd8f921fa51a39f73eb96f438abd5b61fc8fae90250da16","observation_id":"21853ee7-3b40-4d7b-8b0d-99ad7ddf5964","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"International conference on learning representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:aa99b2448f63e3b5f64fcb72d100e01dfb9c6783eb46cda9eeb4d4b3947b6ee9","observation_id":"96660d4c-a67d-4273-8969-4162b0a93d01","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":"2204.01691","doi":"10.48550/arxiv.2204.01691","metadata_source":"pith","pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","venue":"cs.RO","work_id":"037320f1-b0a9-4cbe-a639-bfb25409ce71","year":2022},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:94fea6d9807fb03eeef86d5141cc80c9796e6a7eea7fb7da5731237f88680fe0","observation_id":"ab0c2821-f6ad-4c31-9afd-b2b64f33209d","resolution":{"observed_at":"2026-07-03T10:48:03.111707Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":"2212.06817","doi":"10.48550/arxiv.2212.06817","metadata_source":"pith","pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","venue":"cs.RO","work_id":"e11bda85-8531-46bc-a07f-d0ade3643ab1","year":2022},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:0ddaa81485bc080e822419d6c53cb13533087aca02f9659a2dcceb223f4cf292","observation_id":"90208d52-4020-4672-974c-a79e7f817295","resolution":{"observed_at":"2026-07-03T10:48:03.117007Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:a1b150039b93bc497963f5165cdc21b21741df79aa769e6be61a09cfc76c36fd","observation_id":"afad968f-9070-406d-b57a-5006cb51a389","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Thinking Machines Lab: Connectionism , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:067f2089db7c69f2ace86af9cbd8d5b9a942c6233c5b52e899a98204d9eb7966","observation_id":"176ea7c3-d959-4670-8140-e271abc99c6a","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:dbc9b28b53dc942f5ce4b9e3f0f342235b227cfa0093d8c23f148a0ee88b1d8a","observation_id":"5bc1d740-5c45-46c2-a4f9-fcc350a7a827","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:e0aa4b5f7f69d64a1240202692bed94702800d03b850e44373f664eae92d342a","observation_id":"d5615fd5-1c14-400d-b15d-07952292b2cf","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:88b145c998fa87498b7b2e22b5c15ba93c7a994ab4472da1be099b953900c337","observation_id":"e3ee22a3-9185-43b5-966e-bda73f98f7e3","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:e78aefd0a875a50903af59eecee8012e818bfffc4b1e39a537b7cc23df4073dd","observation_id":"ca224461-22b6-4536-8b01-e8b77178c645","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Proceedings of the 36th annual acm symposium on user interface software and technology , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:019f9f1cb4f826e36ebcfe0b7632d2d841a9b027c4b7712431bf61d924a90014","observation_id":"800280d7-f652-4a8a-9a3c-b592cf6ed20c","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:2ceda82ed35e58c97c02c8ffe8a8ced7c11e2a46274e285971c08965ca376c68","observation_id":"ed12176d-b8e2-4609-8bdf-c4f543a6209d","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:f7487728932582d2135b4a855d401f1362628c39a33d7a2dc2be560be9608e87","observation_id":"421d85fa-12d5-47a3-9ce9-32708813056d","resolution":{"observed_at":"2026-07-03T10:48:03.089719Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":"2306.15195","doi":"10.48550/arxiv.2306.15195","metadata_source":"pith","pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","venue":"cs.CV","work_id":"44525076-312a-4259-b79c-134cd7eeb297","year":2023},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:081ce2150a035407d9551f31cb3285cdec3a4b85c5417dba1803a06186cfc5f4","observation_id":"d5d9fe82-50d6-4e2c-9c75-dc811ebdbf4d","resolution":{"observed_at":"2026-07-03T10:48:02.966022Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"2024 , publisher=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:0d76c8507186df9ddf3600618b84c1e00b8acf5d8456ca6b5dba6cc980a00a92","observation_id":"e94d2c01-5a30-492b-90be-87e876950a5c","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01603","last_updated":"2020-03-17T17:10:58Z","snapshot_observed_at":"2026-08-09T02:21:17.479736Z","submitted_at":"2019-12-03T18:57:16Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","version":3},"cited_work":{"arxiv_id":"1912.01603","doi":"10.48550/arxiv.1912.01603","metadata_source":"pith","pith_arxiv_id":"1912.01603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","venue":"cs.LG","work_id":"5103f4be-344a-4139-8504-eaa59f5bac9d","year":2019},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/1912.01603","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:c978e34d9bc08cb6f36d73bcdebe5d9a6e5516ab911eba6f75d7c6ce784059b7","observation_id":"85f5df00-8a9c-4013-951d-2f2df62f2a0e","resolution":{"observed_at":"2026-07-03T10:48:02.981512Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":"2301.04104","doi":"10.1126/sciadv.adu2488","metadata_source":"pith","pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mastering Diverse Domains through World Models","venue":"cs.AI","work_id":"6aeb260f-8c7c-4f9c-b98b-067cd7c59acd","year":2023},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:40467724ebaaab16a08d42debcc8b214712ff423954164c8f3611b5c2f43d81e","observation_id":"f87dbc2e-fb79-42a8-ab84-f078ea458654","resolution":{"observed_at":"2026-07-03T10:48:03.095524Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:6675bf28b6f3bd0de76c6f5789ec567408f16c4f57a15e389c5e355b53d3bb27","observation_id":"e4ff952d-310c-4ede-bd07-77229975e78c","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08264","last_updated":"2024-09-13T20:17:13Z","snapshot_observed_at":"2026-08-05T14:11:56.506073Z","submitted_at":"2024-09-12T17:56:43Z","title":"Windows Agent Arena: Evaluating Multi-Modal OS Agents at Scale","version":2},"cited_work":{"arxiv_id":"2409.08264","doi":"10.48550/arxiv.2409.08264","metadata_source":"arxiv_reference","pith_arxiv_id":"2409.08264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Windows agent arena: Evaluating multi-modal os agents at scale.arXiv preprint arXiv:2409.08264","venue":"arXiv (Cornell University)","work_id":"9cce46f1-e894-43ff-b34d-06a8adfe4721","year":2024},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2409.08264","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:0c1b0faf2789994228a31d2dbc2aa2f93893df2ea93c106f8621c03d84d85afa","observation_id":"164d0dc0-e567-42a8-8963-4a8e141c1486","resolution":{"observed_at":"2026-07-03T10:48:03.109381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:f448a27955e7c185cdf62fad2237df0b529358677b64da9129d693a29fe55454","observation_id":"897c40b9-1f1a-40d6-8a8f-cf06f9ff5cfe","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10813","last_updated":"2025-03-04T22:19:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-14T17:59:44Z","title":"LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory","version":2},"cited_work":{"arxiv_id":"2410.10813","doi":"10.48550/arxiv.2410.10813","metadata_source":"pith","pith_arxiv_id":"2410.10813","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory","venue":"cs.CL","work_id":"9074870f-aee7-4103-b167-ac6473a8a9b3","year":2024},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2410.10813","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:d056e48788cb78aa2194a9a840e6c912e4eccd210f2967a3d8a1f43f645f1b75","observation_id":"1af5d675-7834-48da-a95a-42ee83a1a70c","resolution":{"observed_at":"2026-07-03T10:48:03.122373Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:bddfd46cba25089f2ee0ac82fa50f6f7b5d365a353702f179ba6f2f7f12beb9c","observation_id":"b951adc4-3f46-4663-bb76-a4a131a3b5c8","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T09:48:27.652901Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:231e2a3a5d1607a5fbd00b0e651e64831a66cb8b8c1d94890dac27dbea7a811c","observation_id":"d9cf8775-a783-4640-839a-95d477bfba82","resolution":{"observed_at":"2026-06-27T09:48:27.652901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":34,"parse_uncertain":1,"unresolved":59,"verified_exact":6,"verified_fuzzy":0},"total_outbound_references":300},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 100 of 300 outbound references and 1 inbound Pith citation observation for arXiv:2606.12195."}