{"as_of":"2026-08-08T02:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1261347acfaa4521a716d93495229441075c99ea13c38866327ad73f494c44c1","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":24,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:55:14.903410Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T17:18:43.769941Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-07T09:16:48.366534Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.07973","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-07-03T17:18:43.769941Z","title":"Ferret-v2: An improved baseline for referring and grounding with large language models","venue":null,"work_id":"c4fa27bd-d0f2-4bfc-985d-56cb8646c5f0","year":2024},"citing_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-05T10:06:10.880743Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"reference_index":163,"source":"pdf_text","source_observed_at":"2026-05-11T13:10:19.972353Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2407.07726"},"observation_digest":"sha256:3ba16a7f1618088fbf3215a8b070fa7cd9e015e9375b52f65cab301ca68f4b71","observation_id":"52c46c55-579c-46fe-97ec-d0cf92d06fcc","resolution":{"observed_at":"2026-05-11T13:10:21.316983Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-07T09:16:48.366534Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.07973","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-07-03T17:18:43.769941Z","title":"Ferret-v2: An improved baseline for referring and grounding with large language models","venue":null,"work_id":"c4fa27bd-d0f2-4bfc-985d-56cb8646c5f0","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":298,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:8a5826e30d5c0b5f0edb4763f1503b024511297659285fef11fe7de8c3f86b2a","observation_id":"bf729760-af01-45a6-893f-d69d7bddf096","resolution":{"observed_at":"2026-05-10T13:23:58.322854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-07T09:16:48.366534Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.07973","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-07-03T17:18:43.769941Z","title":"Ferret-v2: An improved baseline for referring and grounding with large language models","venue":null,"work_id":"c4fa27bd-d0f2-4bfc-985d-56cb8646c5f0","year":2024},"citing_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-05-11T10:09:21.542356Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2412.10302"},"observation_digest":"sha256:109c2651958e5f2013b02faeddd79e7c9efc41989fff2f61ae8607bfd8fe3f51","observation_id":"eb2197b6-7ad7-43e4-bd0f-417a2b0b5481","resolution":{"observed_at":"2026-05-11T10:09:26.618781Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-07T09:16:48.366534Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.07973","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-07-03T17:18:43.769941Z","title":"Ferret-v2: An improved baseline for referring and grounding with large language models","venue":null,"work_id":"c4fa27bd-d0f2-4bfc-985d-56cb8646c5f0","year":2024},"citing_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-23T02:25:04.405036Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2502.13923"},"observation_digest":"sha256:707906d0df8dd48355bc42f7c204b583d855bde41d446e746f657816a4fc6e97","observation_id":"6d4e3094-5d35-4e77-99a9-2c7866e3cecf","resolution":{"observed_at":"2026-05-23T02:25:19.039848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-07T09:16:48.366534Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.07973","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-07-03T17:18:43.769941Z","title":"Ferret-v2: An improved baseline for referring and grounding with large language models","venue":null,"work_id":"c4fa27bd-d0f2-4bfc-985d-56cb8646c5f0","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":145,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:95f970afdae7187ac7ee492fe542885eb4fe93857912ffcb05a9b40b5093d2d5","observation_id":"f3329cb4-26ea-4ff8-b71b-a584ec2106a5","resolution":{"observed_at":"2026-05-10T13:41:08.173791Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-07T09:16:48.366534Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-08-07T10:55:14.903410Z","title":"Ferret-v2: An improved baseline for referring and grounding with large language models.arXiv preprint arXiv:2404.07973, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04034","last_updated":"2025-06-04T14:56:57Z","snapshot_observed_at":"2026-08-07T10:46:30.489099Z","submitted_at":"2025-06-04T14:56:57Z","title":"Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:14.903410Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2506.04034"},"observation_digest":"sha256:f03a1fea6227fd70897332dda4701f897097548b0fc4059d2eeb046c834328e5","observation_id":"19323831-a40a-49de-b004-6b7c50a0a822","resolution":{"observed_at":"2026-08-07T10:55:14.903410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-07T09:16:48.366534Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-08-07T10:28:14.279027Z","title":"Ferret-v2: An improved baseline for referring and grounding with large language models.arXiv preprint arXiv:2404.07973, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05302","last_updated":"2025-06-05T17:51:39Z","snapshot_observed_at":"2026-08-07T10:19:12.341695Z","submitted_at":"2025-06-05T17:51:39Z","title":"Perceive Anything: Recognize, Explain, Caption, and Segment Anything in Images and Videos","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:14.279027Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2506.05302"},"observation_digest":"sha256:b1483f25f8a9f2e4b4f08dcf47b9b2b55ea587c25f3f5a5ee21a4ef13de05b74","observation_id":"ae642888-c3de-4cbe-aa24-3161505b0301","resolution":{"observed_at":"2026-08-07T10:28:14.279027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-07T09:16:48.366534Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-08-07T10:50:52.768322Z","title":"Ferret-v2: An improved baseline for referring and grounding with large language models.arXiv preprint arXiv:2404.07973, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-07T10:40:42.356856Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.768322Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:3f8e8c90e80d2087314d140382223919576eed67f6717b2e312597f82caee3c3","observation_id":"061cff8b-33b5-4e83-a9cd-f71616a5ae0e","resolution":{"observed_at":"2026-08-07T10:50:52.768322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-07T09:16:48.366534Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-08-07T05:54:03.713136Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06729","last_updated":"2025-06-07T09:27:26Z","snapshot_observed_at":"2026-08-07T05:48:30.660932Z","submitted_at":"2025-06-07T09:27:26Z","title":"Mitigating Object Hallucination via Robust Local Perception Search","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:03.713136Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2506.06729"},"observation_digest":"sha256:1aca2cf5c48c6b85b12d7ffca7acb7c690c177bb078c4d6417e0b9e1dcf0b13b","observation_id":"cf03d328-6614-4812-9942-6988fa4739e2","resolution":{"observed_at":"2026-08-07T05:54:03.713136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-07T09:16:48.366534Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-08-05T19:39:48.130365Z","title":"Ferret-v2: An improved baseline for referring and grounding with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.130365Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:035b515e38d261c9486d526b81e5ba3ae22e79cb9ec077b5adfe9bff9fc2d1e8","observation_id":"4e50f82b-d859-4e4a-b256-471307846976","resolution":{"observed_at":"2026-08-05T19:39:48.130365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-07T09:16:48.366534Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.07973","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-07-03T17:18:43.769941Z","title":"Ferret-v2: An improved baseline for referring and grounding with large language models","venue":null,"work_id":"c4fa27bd-d0f2-4bfc-985d-56cb8646c5f0","year":2024},"citing_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"reference_index":174,"source":"pdf_text","source_observed_at":"2026-05-10T11:58:58.660564Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2508.18265"},"observation_digest":"sha256:89a16c3e46afcfc13e24836d8197f7af49ce092d3390ea02145754d63bfd912b","observation_id":"7c4736ca-60ba-4593-9f5a-14e5318b593a","resolution":{"observed_at":"2026-05-10T11:58:58.946719Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-07T09:16:48.366534Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-08-05T10:58:19.257522Z","title":"Ferret- v2: An improved baseline for referring and grounding with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03501","last_updated":"2025-09-03T17:33:20Z","snapshot_observed_at":"2026-08-07T14:11:47.550063Z","submitted_at":"2025-09-03T17:33:20Z","title":"Strefer: Empowering Video LLMs with Space-Time Referring and Reasoning via Synthetic Instruction Data","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-05T10:58:19.257522Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2509.03501"},"observation_digest":"sha256:508eaa0f958cc0ef7dc772b6e6d9f6b9821e35d6dfc7d4df5ed4d4803c0281e3","observation_id":"65a71161-201a-4948-826e-c30a6127c282","resolution":{"observed_at":"2026-08-05T10:58:19.257522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-07T09:16:48.366534Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.07973","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-07-03T17:18:43.769941Z","title":"Ferret-v2: An improved baseline for referring and grounding with large language models","venue":null,"work_id":"c4fa27bd-d0f2-4bfc-985d-56cb8646c5f0","year":2024},"citing_paper":{"arxiv_id":"2512.10554","last_updated":"2026-04-02T03:14:28Z","snapshot_observed_at":"2026-07-30T11:23:08.233438Z","submitted_at":"2025-12-11T11:38:50Z","title":"Grounding Everything in Tokens for Multimodal Large Language Models","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-16T23:31:05.422935Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2512.10554"},"observation_digest":"sha256:d001ddd515574683b6961376b7249833eff6eb856b68efb1fd4a4f64798d7e97","observation_id":"34366149-934d-4980-ac63-399f83fe1d0c","resolution":{"observed_at":"2026-05-16T23:31:21.900012Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-07T09:16:48.366534Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.07973","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-07-03T17:18:43.769941Z","title":"Ferret-v2: An improved baseline for referring and grounding with large language models","venue":null,"work_id":"c4fa27bd-d0f2-4bfc-985d-56cb8646c5f0","year":2024},"citing_paper":{"arxiv_id":"2604.11789","last_updated":"2026-04-20T14:38:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T17:55:02Z","title":"LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation","version":2},"reference_index":224,"source":"pdf_text","source_observed_at":"2026-05-10T15:35:37.095627Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2604.11789"},"observation_digest":"sha256:4ffca3e658b4181a3ec6a0d13a16c2f99340289a7249b56c67f41762fbaabcd1","observation_id":"8e0166ae-07b0-46e7-b378-14b89929b444","resolution":{"observed_at":"2026-05-11T10:11:08.196499Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-07T09:16:48.366534Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.07973","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-07-03T17:18:43.769941Z","title":"Ferret-v2: An improved baseline for referring and grounding with large language models","venue":null,"work_id":"c4fa27bd-d0f2-4bfc-985d-56cb8646c5f0","year":2024},"citing_paper":{"arxiv_id":"2604.18665","last_updated":"2026-04-20T14:40:43Z","snapshot_observed_at":"2026-07-06T23:05:30.879164Z","submitted_at":"2026-04-20T14:40:43Z","title":"APRVOS: 1st Place Winner of 5th PVUW MeViS-Audio Track","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T03:29:12.783993Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2604.18665"},"observation_digest":"sha256:d7354a54262fa6127000d373cb708fa081a3d6110e776fc27676103120c8e970","observation_id":"f6556e68-116d-4302-a7a0-ae0bb9f0cddf","resolution":{"observed_at":"2026-05-10T03:29:21.572846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-07T09:16:48.366534Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.07973","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-07-03T17:18:43.769941Z","title":"Ferret-v2: An improved baseline for referring and grounding with large language models","venue":null,"work_id":"c4fa27bd-d0f2-4bfc-985d-56cb8646c5f0","year":2024},"citing_paper":{"arxiv_id":"2604.22836","last_updated":"2026-04-20T14:36:19Z","snapshot_observed_at":"2026-07-06T23:09:10.050398Z","submitted_at":"2026-04-20T14:36:19Z","title":"AgentRVOS for MeViS-Text Track of 5th PVUW Challenge: 3rd Method","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T05:14:25.423302Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2604.22836"},"observation_digest":"sha256:d9fd24cd214b9b3e333dab8233746497f69077d04fb0e6c0331d5fc1a43600dc","observation_id":"79c338b0-a657-400a-aeeb-d4f246691794","resolution":{"observed_at":"2026-05-10T09:33:41.834379Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-07T09:16:48.366534Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.07973","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-07-03T17:18:43.769941Z","title":"Ferret-v2: An improved baseline for referring and grounding with large language models","venue":null,"work_id":"c4fa27bd-d0f2-4bfc-985d-56cb8646c5f0","year":2024},"citing_paper":{"arxiv_id":"2605.11462","last_updated":"2026-05-12T03:20:41Z","snapshot_observed_at":"2026-08-02T09:58:22.459807Z","submitted_at":"2026-05-12T03:20:41Z","title":"SpatialForge: Bootstrapping 3D-Aware Spatial Reasoning from Open-World 2D Images","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T01:26:47.052025Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2605.11462"},"observation_digest":"sha256:c433aefe22d7ce335a8a682a4427c7b79a982c5e6dd88026172f5c6f36a6c7df","observation_id":"7edf8782-c164-4990-aea0-70f39a55e4cd","resolution":{"observed_at":"2026-05-13T01:27:01.649239Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-07T09:16:48.366534Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.07973","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-07-03T17:18:43.769941Z","title":"Ferret-v2: An improved baseline for referring and grounding with large language models","venue":null,"work_id":"c4fa27bd-d0f2-4bfc-985d-56cb8646c5f0","year":2024},"citing_paper":{"arxiv_id":"2605.14923","last_updated":"2026-05-14T14:58:46Z","snapshot_observed_at":"2026-07-06T23:26:18.733776Z","submitted_at":"2026-05-14T14:58:46Z","title":"SceneParser: Hierarchical Scene Parsing for Visual Semantics Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T20:51:56.131205Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2605.14923"},"observation_digest":"sha256:a8523f6bea1ce77b38736ada93f3557b3ef9ffb692a4b2169fae09b8b0427d93","observation_id":"3c192de7-c3cf-4579-bbb6-8210ba4bad56","resolution":{"observed_at":"2026-06-30T20:55:04.145207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-07T09:16:48.366534Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.07973","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-07-03T17:18:43.769941Z","title":"Ferret-v2: An improved baseline for referring and grounding with large language models","venue":null,"work_id":"c4fa27bd-d0f2-4bfc-985d-56cb8646c5f0","year":2024},"citing_paper":{"arxiv_id":"2605.18018","last_updated":"2026-05-18T08:09:37Z","snapshot_observed_at":"2026-07-06T23:28:55.079333Z","submitted_at":"2026-05-18T08:09:37Z","title":"See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-20T12:10:54.874012Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2605.18018"},"observation_digest":"sha256:275c6f790e7482bc7ade0829e43d94b443eb617664480b1a26e7c37e365a0c90","observation_id":"51c62cd9-08e9-43a4-8844-3cd356ccf0fa","resolution":{"observed_at":"2026-05-20T12:13:16.197690Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-07T09:16:48.366534Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.07973","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-07-03T17:18:43.769941Z","title":"Ferret-v2: An improved baseline for referring and grounding with large language models","venue":null,"work_id":"c4fa27bd-d0f2-4bfc-985d-56cb8646c5f0","year":2024},"citing_paper":{"arxiv_id":"2606.17030","last_updated":"2026-06-17T13:54:57Z","snapshot_observed_at":"2026-08-01T21:48:31.832288Z","submitted_at":"2026-06-15T17:52:31Z","title":"Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation","version":3},"reference_index":181,"source":"arxiv_source","source_observed_at":"2026-06-27T04:19:26.332718Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2606.17030"},"observation_digest":"sha256:70ba1dec69dc94bbfa389463465ae750e0de03724115167eb582b90a5a0e2598","observation_id":"19cf84d4-0dc3-42cc-891a-1538e68afda9","resolution":{"observed_at":"2026-07-03T17:18:43.771463Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-07T09:16:48.366534Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-07-14T04:38:05.237334Z","title":"arXiv preprint arXiv:2404.07973 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11581","last_updated":"2026-07-13T14:00:57Z","snapshot_observed_at":"2026-08-06T16:55:31.542502Z","submitted_at":"2026-07-13T14:00:57Z","title":"Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-14T04:38:05.237334Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2607.11581"},"observation_digest":"sha256:972e8380cab42b087d08ca6f21e65bca9a47cc8ccb161b05ad8e1073cbade893","observation_id":"50f680ef-28ec-4ccd-8347-75f771161114","resolution":{"observed_at":"2026-07-14T04:38:05.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-07T09:16:48.366534Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-07-14T03:31:19.309532Z","title":"arXiv:2404.07973 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11738","last_updated":"2026-07-13T16:00:03Z","snapshot_observed_at":"2026-08-06T12:36:13.363835Z","submitted_at":"2026-07-13T16:00:03Z","title":"Qwen-Audio-VAE Technical Report","version":1},"reference_index":194,"source":"arxiv_source","source_observed_at":"2026-07-14T03:31:19.309532Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2607.11738"},"observation_digest":"sha256:1cc7f676acb3157a1bd47ad076d92ec51a297c7480d1e02657c7f112875e547d","observation_id":"8378c805-3cb9-4fde-afd2-956cd2c9cfa9","resolution":{"observed_at":"2026-07-14T03:31:19.309532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-07T09:16:48.366534Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-08-05T10:23:58.883843Z","title":"arXiv preprint arXiv:2404.07973 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03890","last_updated":"2026-08-04T16:23:39Z","snapshot_observed_at":"2026-08-07T23:12:37.136740Z","submitted_at":"2026-08-04T16:23:39Z","title":"CARE-X: Towards Clinically Useful Radiology VLMs with Auxiliary Supervision, Reward-Aligned Learning, and Tool-Augmented Measurement","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-05T10:23:58.883843Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2608.03890"},"observation_digest":"sha256:ba81934addee59134b66b1f9d2f24065cb5580e906f44362b0fd9bd43f4f0506","observation_id":"81988803-75fe-4b14-a681-bdc1f7221ccd","resolution":{"observed_at":"2026-08-05T10:23:58.883843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-07T09:16:48.366534Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-08-06T18:44:45.544126Z","title":"arXiv preprint arXiv:2404.07973 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04698","last_updated":"2026-08-05T11:07:22Z","snapshot_observed_at":"2026-08-08T01:12:01.109472Z","submitted_at":"2026-08-05T11:07:22Z","title":"Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T18:44:45.544126Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2608.04698"},"observation_digest":"sha256:60107164bea1193235c684609b72fcbd5a986af995ee1772ac227f15399f93f7","observation_id":"577a0dee-2ba4-4ba8-b0ae-991bf551e466","resolution":{"observed_at":"2026-08-06T18:44:45.544126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2404.07973/citation-record","integrity":"/paper/2404.07973/integrity","json":"/paper/2404.07973/citation-record.json","paper":"/paper/2404.07973"},"outbound":[],"paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T09:16:48.366534Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 24 inbound Pith citation observations for arXiv:2404.07973."}