{"as_of":"2026-08-14T20:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c980911f69b759356f90d8e3f587e388e0e61a0f54120cce5296fd3462bd7a7b","coverage":[{"denominator":113,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T05:12:20.454458Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T19:14:24.554237Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-28T19:22:34.826730Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"cited_work":{"arxiv_id":"2412.00684","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.00684","snapshot_observed_at":"2026-06-28T19:22:34.826730Z","title":"arXiv preprint arXiv:2412.00684 , year=","venue":null,"work_id":"36dde051-a72a-46f3-9753-bec7e514c138","year":null},"citing_paper":{"arxiv_id":"2606.00571","last_updated":"2026-05-30T06:47:24Z","snapshot_observed_at":"2026-08-07T13:20:18.650137Z","submitted_at":"2026-05-30T06:47:24Z","title":"On the Difficulty of Learning a Meta-network for Training Data Selection","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-06-28T19:14:24.554237Z"},"links":{"cited_paper":"/paper/2412.00684","citing_paper":"/paper/2606.00571"},"observation_digest":"sha256:c96a2289c44700762a4d67a8f7cd7711315764813cedb1d20b09193c3b905c22","observation_id":"824576a0-1d50-44d7-a20b-bcd0e676a157","resolution":{"observed_at":"2026-06-28T19:22:34.828408Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.00684/citation-record","integrity":"/paper/2412.00684/integrity","json":"/paper/2412.00684/citation-record.json","paper":"/paper/2412.00684"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-08-06T15:07:40.203199Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-12T05:12:19.993912Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:19.993912Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:5d7456db87eee7ec2f6da5ffaf92a9740a18c4ad448563d7711ade065773c4e3","observation_id":"8009f69c-56e8-49ad-94f0-7acc00108069","resolution":{"observed_at":"2026-08-12T05:12:19.993912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.000255Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.000255Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:7d8e798d8e39687c7c508bb6de35c5dd37a8b578fe8e6e9b021869f8d8432337","observation_id":"322fa19d-22fd-4006-bd24-3cc806927f37","resolution":{"observed_at":"2026-08-12T05:12:20.000255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19854","last_updated":"2024-05-30T09:03:23Z","snapshot_observed_at":"2026-08-13T05:16:12.977472Z","submitted_at":"2024-05-30T09:03:23Z","title":"RTGen: Generating Region-Text Pairs for Open-Vocabulary Object Detection","version":1},"cited_work":{"arxiv_id":"2405.19854","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.19854","snapshot_observed_at":"2026-08-12T05:12:20.812616Z","title":"RTGen: Generating Region-Text Pairs for Open-Vocabulary Object Detection","venue":"cs.CV","work_id":"d88eab39-78d0-4ed1-acf8-e986a689808e","year":2024},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.005367Z"},"links":{"cited_paper":"/paper/2405.19854","citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:a4d89a69b57a884be85a4c6e72b61d3e9528aa630d946519acf6f426ebd76035","observation_id":"79a35aef-e531-4c2d-af1d-dd950f5b9ead","resolution":{"observed_at":"2026-08-12T05:12:20.817385Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.012371Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.012371Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:3ac7bf811f9d4287358b34ede39bd99f8c8fd91931a3944e8d78fef3c1d7e8eb","observation_id":"534f779a-f7ed-42ff-ae2e-fb14118c71c9","resolution":{"observed_at":"2026-08-12T05:12:20.012371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.017274Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.017274Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:3c1ffc93b448315e904e08cbcd8ec9af9774970d7bd005a433bad6145db99193","observation_id":"661f9a99-c686-42e9-808d-3c267d77178c","resolution":{"observed_at":"2026-08-12T05:12:20.017274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.022825Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.022825Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:f87117bf5a9632436d963fa57404f8debddb5ade36fa77539170e0ec7442b590","observation_id":"d019c9b3-adef-4959-a507-8f75a79de2e9","resolution":{"observed_at":"2026-08-12T05:12:20.022825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.032481Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.032481Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:d34de15c5d0182fa3c72deb67a387066c3f1d1dc2b4a32196066b06fb77ef52c","observation_id":"55d7de17-fb4b-4fc6-aa40-6b5c4fa088a3","resolution":{"observed_at":"2026-08-12T05:12:20.032481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.036967Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.036967Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:c1ef32a9b46d90a9396504e70039a5b6a0d04d1bc1a3e6c936d0d8f811d29924","observation_id":"55320f40-6793-4a71-8a32-7f8601275e98","resolution":{"observed_at":"2026-08-12T05:12:20.036967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09599","last_updated":"2025-02-25T14:41:29Z","snapshot_observed_at":"2026-08-13T10:32:19.129279Z","submitted_at":"2023-08-18T14:54:13Z","title":"Language-Guided Diffusion Model for Visual Grounding","version":3},"cited_work":{"arxiv_id":"2308.09599","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.09599","snapshot_observed_at":"2026-08-12T05:12:20.779013Z","title":"Language-Guided Diffusion Model for Visual Grounding","venue":"cs.CV","work_id":"8200be8f-a38a-4f24-8777-6b7ac200d837","year":2023},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.041837Z"},"links":{"cited_paper":"/paper/2308.09599","citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:db238cd3e849e840a7058335576e37b14b438c5f6e03701b84839cae5b398dec","observation_id":"eb947a1c-a772-490e-85df-33f49d659813","resolution":{"observed_at":"2026-08-12T05:12:20.783716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.046472Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.046472Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:ad33762d48316740f5182054fe173b7ff645ff3c656f8270920fa814ce50db66","observation_id":"250b9161-622a-44e8-be06-9f201c2c8879","resolution":{"observed_at":"2026-08-12T05:12:20.046472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20085","last_updated":"2025-03-24T09:58:24Z","snapshot_observed_at":"2026-08-14T06:28:52.677161Z","submitted_at":"2024-06-28T17:53:18Z","title":"Auto Cherry-Picker: Learning from High-quality Generative Data Driven by Language","version":3},"cited_work":{"arxiv_id":"2406.20085","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.20085","snapshot_observed_at":"2026-08-12T05:12:20.763053Z","title":"Auto Cherry-Picker: Learning from High-quality Generative Data Driven by Language","venue":"cs.CV","work_id":"0b2679a8-87c9-427f-8407-bf04f7c64e28","year":2024},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.050215Z"},"links":{"cited_paper":"/paper/2406.20085","citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:8b317a108e606825497d4a75bd9c25953a8c9817de1f04abd6e34a53c6c10350","observation_id":"f31a606d-7c40-4ae7-a16f-e03da5da59ea","resolution":{"observed_at":"2026-08-12T05:12:20.767536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.054862Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.054862Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:2d90d223f26e915bfcc491c70f16483dae03a285650cb309888ab1d049323633","observation_id":"f8db4ca5-cdf1-4a4d-84af-07c829c31299","resolution":{"observed_at":"2026-08-12T05:12:20.054862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.062833Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.062833Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:c0944f2c7a74d37e54c23fdbe650c93fe0ac5da5b09f8de1573b001018ebd803","observation_id":"4ab30f6e-858e-4c68-b01a-111f83efdc02","resolution":{"observed_at":"2026-08-12T05:12:20.062833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08966","last_updated":"2023-08-11T04:55:40Z","snapshot_observed_at":"2026-08-13T11:16:53.504748Z","submitted_at":"2023-06-15T09:01:33Z","title":"Training Multimedia Event Extraction With Generated Images and Captions","version":2},"cited_work":{"arxiv_id":"2306.08966","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.08966","snapshot_observed_at":"2026-08-12T05:12:20.746863Z","title":"Training Multimedia Event Extraction With Generated Images and Captions","venue":"cs.MM","work_id":"635ecb18-580f-43b5-ae87-46205bfad164","year":2023},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.066866Z"},"links":{"cited_paper":"/paper/2306.08966","citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:e569ae2ef23c57d552b42e673e2aee101492db62d36a62a51e13acd2a27e79b8","observation_id":"1a1a2258-f370-44b1-80f1-71927651e577","resolution":{"observed_at":"2026-08-12T05:12:20.751383Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.071133Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.071133Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:f57efbcd4074dbaad980507cce4e8078aded6dcd71c4b71cfc58e8441ebec56d","observation_id":"63a4ed5a-9246-48fb-97ab-b5c9e2de196f","resolution":{"observed_at":"2026-08-12T05:12:20.071133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.075827Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.075827Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:b305c225db01c81653dec31163cb4df3d8b45b0018d0254aa58762e296ac55aa","observation_id":"ff26f069-dad0-4b6f-b13c-507b2cb3a2a6","resolution":{"observed_at":"2026-08-12T05:12:20.075827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.080371Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.080371Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:8ebac2adcf849990ea6ae53180c49eae8b09db5c2253a512f6341f4a555fcc3e","observation_id":"f916cec4-5705-4a3f-bdd0-d797ac7b8daf","resolution":{"observed_at":"2026-08-12T05:12:20.080371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.084008Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.084008Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:aa06c4970cfea3ca66dbc0af949e6fce0e2b45b1ce49f12ef9b2628994e7c9bf","observation_id":"08cf17b3-ab18-4d4b-b6ed-4d9b7eeae5cf","resolution":{"observed_at":"2026-08-12T05:12:20.084008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.089378Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.089378Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:1ef97e7e5a49ff0faaff6ba1a49d65e0a142075ff23d0d1e9d24c7316f82726b","observation_id":"626cd681-8d7a-41e6-bc94-1478b720ce6f","resolution":{"observed_at":"2026-08-12T05:12:20.089378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.094123Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.094123Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:f088133402158f204b4df48774bbaff952ab46a69b512f00030d78c64dba64bd","observation_id":"8b3a8c8e-0daa-495e-ac45-73a27f54aac3","resolution":{"observed_at":"2026-08-12T05:12:20.094123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13804","last_updated":"2024-12-16T14:53:21Z","snapshot_observed_at":"2026-08-13T08:07:40.974274Z","submitted_at":"2024-03-20T17:59:43Z","title":"Learning from Synthetic Data for Visual Grounding","version":2},"cited_work":{"arxiv_id":"2403.13804","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.13804","snapshot_observed_at":"2026-08-12T05:12:20.728343Z","title":"Learning from Synthetic Data for Visual Grounding","venue":"cs.CV","work_id":"a643c5d7-23ca-4697-a3a4-19f3cf5e9e6a","year":2024},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.098317Z"},"links":{"cited_paper":"/paper/2403.13804","citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:c014893d0df036d22ff8b73f595af6fd8cf39cb6e92ef6bcd28ee9d31a8623be","observation_id":"58ba7551-df15-4cd8-872b-a570006a2873","resolution":{"observed_at":"2026-08-12T05:12:20.732953Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.107924Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.107924Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:e17b1d950ef9e23fad7f85b07af5b004204b693c1f4e5c4342a5907b5eed38d3","observation_id":"7e547165-2c43-4e52-bf74-3d856707f4e0","resolution":{"observed_at":"2026-08-12T05:12:20.107924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.112838Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.112838Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:8ae91ceaf95461aa02adb9010098fa39efd8dbd5e6eadebff77a6551866b7798","observation_id":"be847524-f6af-42ea-8656-0d4865fab982","resolution":{"observed_at":"2026-08-12T05:12:20.112838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11820","last_updated":"2024-10-15T17:47:44Z","snapshot_observed_at":"2026-08-13T12:57:49.971325Z","submitted_at":"2024-10-15T17:47:44Z","title":"Adaptive Data Optimization: Dynamic Sample Selection with Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11820","snapshot_observed_at":"2026-08-12T05:12:20.117651Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.117651Z"},"links":{"cited_paper":"/paper/2410.11820","citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:2e56453095109d7bb0fca85f7090cdb55f606a691c53830bc4952f83a47a01cb","observation_id":"415bd496-4b96-4f7c-8250-33b7ef651893","resolution":{"observed_at":"2026-08-12T05:12:20.117651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.121904Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.121904Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:43440aa42c092c8eb87c4a2cf4c4d8f489527d41887fbce629fcf0c509a13d44","observation_id":"63234273-d279-4294-aed5-906fbf3dae9e","resolution":{"observed_at":"2026-08-12T05:12:20.121904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.126224Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.126224Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:ff437d77eb9ce24f6da1679f1712b8f3b37456023c50b052438bd301fdc3774c","observation_id":"313a628d-58d6-411a-adef-c15d853a5298","resolution":{"observed_at":"2026-08-12T05:12:20.126224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.130274Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.130274Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:21bd2301f3106a021264ede3ecd3f7c60a3531b2d42baea23a01844cf72448fd","observation_id":"d2640229-e280-47d6-a9e0-d14ee5d81961","resolution":{"observed_at":"2026-08-12T05:12:20.130274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06287","last_updated":"2025-03-08T17:24:42Z","snapshot_observed_at":"2026-08-08T19:36:49.120076Z","submitted_at":"2025-03-08T17:24:42Z","title":"Your Large Vision-Language Model Only Needs A Few Attention Heads For Visual Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06287","snapshot_observed_at":"2026-08-12T05:12:20.134645Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.134645Z"},"links":{"cited_paper":"/paper/2503.06287","citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:215e963df78ac561917ec86f5721f00729de68dfc9319b9093e2b8f10ed4b555","observation_id":"d0aa87e5-b1d2-4437-9442-8f2185c8cb80","resolution":{"observed_at":"2026-08-12T05:12:20.134645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.139035Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.139035Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:e3058ab2659413ee16669cb0546f0e690f24ef2a4858a03bb634f04d99eb2181","observation_id":"8933f1e6-d54e-4176-b5f1-ce65d337ca7e","resolution":{"observed_at":"2026-08-12T05:12:20.139035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.143008Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.143008Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:07de9dc2d2e31286c6a4d4907d69c222cd3b59d4e83af5c5a86056c627113a1b","observation_id":"f1f15175-d93f-46a2-be55-3ac622b1e04e","resolution":{"observed_at":"2026-08-12T05:12:20.143008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06499","last_updated":"2022-03-24T19:29:45Z","snapshot_observed_at":"2026-08-14T07:55:03.346803Z","submitted_at":"2021-07-14T06:06:52Z","title":"Deduplicating Training Data Makes Language Models Better","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06499","snapshot_observed_at":"2026-08-12T05:12:20.152343Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.152343Z"},"links":{"cited_paper":"/paper/2107.06499","citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:7313c312addaa8828526e8e9316cb704dbb86086659258a63732cb256f85485d","observation_id":"29963137-70ac-432f-8804-058ebb73c49a","resolution":{"observed_at":"2026-08-12T05:12:20.152343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.155896Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.155896Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:bbf9853ccc268d5c4f091bad55140de9c9f14fabd417cac91e0b7c1332fdd976","observation_id":"3f109bc1-eb42-4f91-a314-10223978f12b","resolution":{"observed_at":"2026-08-12T05:12:20.155896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.147583Z","title":"In Proceedings of the IEEE/CVF ICCV","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.147583Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:018e7bfe6d2f6324d96589a005ce4ba4b750a5405a8f5e985e9a21ff8f24b363","observation_id":"cc61aa19-101f-47b7-b087-5e1ea407b37c","resolution":{"observed_at":"2026-08-12T05:12:20.147583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.163421Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.163421Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:149d36571f2a1d29debd803a4aa9f584b09b4b94adf59b69863a06cf4d2eb044","observation_id":"f4283084-09b2-4af2-80fb-f8138ef8ba42","resolution":{"observed_at":"2026-08-12T05:12:20.163421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.166846Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.166846Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:88be4eb7de04e9a78b54c81c6c5362914a4efeccdc23a0c0ec2d2569494e7718","observation_id":"f48e684c-5f5d-4516-a2ff-f795adb10b3f","resolution":{"observed_at":"2026-08-12T05:12:20.166846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.07394","last_updated":"2020-02-18T06:20:06Z","snapshot_observed_at":"2026-08-06T03:18:08.960708Z","submitted_at":"2020-02-18T06:20:06Z","title":"DivideMix: Learning with Noisy Labels as Semi-supervised Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.07394","snapshot_observed_at":"2026-08-12T05:12:20.159530Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.159530Z"},"links":{"cited_paper":"/paper/2002.07394","citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:a97270fb27c1637fb08fec870e5db317fd82503bd54e85a1ac554312aa45a79a","observation_id":"fa4c133c-58e9-48cb-bf72-2e015791a4fc","resolution":{"observed_at":"2026-08-12T05:12:20.159530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.177726Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.177726Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:895f0e0c45e26e312b6c617d7ce12797bf880a0420ab68a454772c044a6b7e61","observation_id":"924688a0-a9e5-45e3-ba40-e267e6b0f054","resolution":{"observed_at":"2026-08-12T05:12:20.177726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.181418Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.181418Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:d67759193b7783440d52ea35be2e71cb6687acdf4039b7a73433e6f1f2820f4a","observation_id":"beb27491-4a75-480e-a574-054a073f275a","resolution":{"observed_at":"2026-08-12T05:12:20.181418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.170806Z","title":"InProceedings of the IEEE/CVF ICCV","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.170806Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:38e582507b0eaba09938a6c05c5a109d8b2d6a59e461bf56764b8037de03f094","observation_id":"72a8a92f-e016-4a35-a30a-ab92fbd95a3b","resolution":{"observed_at":"2026-08-12T05:12:20.170806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.174244Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.174244Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:d847ee409cde588c75f6fd6c7670494f67c466908ef99c723b90aa972a474c52","observation_id":"b0baedb0-affc-4919-8323-0a7a0d53b5c4","resolution":{"observed_at":"2026-08-12T05:12:20.174244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.523440Z","title":null,"venue":null,"work_id":"0c0bddec-c7a5-4c4b-975c-69e9bcb63e09","year":2021},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.191492Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:ce9776394cab0d21398a9268fe65e5c57293afedc1a2b0867e75fe581d2b71d8","observation_id":"89057018-ec85-4e21-8de6-49158dc18324","resolution":{"observed_at":"2026-08-12T05:12:21.527458Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.511419Z","title":null,"venue":null,"work_id":"f29dad95-be9d-40c6-9085-6ad368aab0be","year":2023},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.194498Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:30cb71c62e32703cec94011ffda1ae010e2ee30a2a713d753a89e76ca958a314","observation_id":"41b4c99d-ab1c-4fab-bf82-bab7fd9e41fa","resolution":{"observed_at":"2026-08-12T05:12:21.515330Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.184609Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.184609Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:b0216694565b6991e82ddcbb23bbbae6dad9c90deb877f5e8fcd4b428dc7bd96","observation_id":"a95e4c86-47d9-43f5-a229-d2de052520d9","resolution":{"observed_at":"2026-08-12T05:12:20.184609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.188156Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.188156Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:1e293d730330245d5b1a08db57d78b2a221a03da64ea9d021129dd11962fdf14","observation_id":"a210e828-6be0-4d94-83ac-37ae115c1275","resolution":{"observed_at":"2026-08-12T05:12:20.188156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.466060Z","title":"when to update","venue":null,"work_id":"6b53476f-f301-44d4-b0d6-771c60cbe040","year":2017},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.210003Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:2dfabe1ddc12b5ed8f3711f98137a4988ae8802c0807600ca6e5341ca57f37fc","observation_id":"5633dc6b-4ea9-4fbd-bc52-ba474229a9e6","resolution":{"observed_at":"2026-08-12T05:12:21.470469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.451528Z","title":null,"venue":null,"work_id":"3e2276ac-c4c0-40e6-b060-e035593c84b9","year":2016},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.214281Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:7cb0d76c743980acee62e46a178121050b1dd6f448fcdc56bee8e69e492900c0","observation_id":"edf2b6ba-4878-4e9a-84aa-6dd6cd1a3381","resolution":{"observed_at":"2026-08-12T05:12:21.456131Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.197667Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.197667Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:285e8b01d8571f56ffa5bae077c8601e4ba160eebb5c708d4be4b86f99941510","observation_id":"492a9b3d-23cd-4bbc-9091-0a941b3a08d5","resolution":{"observed_at":"2026-08-12T05:12:20.197667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.422106Z","title":null,"venue":null,"work_id":"5ec75f38-2fca-4800-872c-b9e4b9d929db","year":2021},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.223312Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:ce854411627c22ae36e557e2d0e1042f0fc6b3adc868ae4fbc200adb8c7c3997","observation_id":"e438df7e-527b-4708-b73c-21e61a3a0bda","resolution":{"observed_at":"2026-08-12T05:12:21.427243Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.478903Z","title":null,"venue":null,"work_id":"e30f3d63-b56f-4424-a49f-31477faf9468","year":2024},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.205985Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:7304c00e60e93c872e390106c4f9c7fcee4a7fdf3d1bb7f7b3105d175bc23b1c","observation_id":"b0bf3040-ed13-45ee-977b-5be78f70bbd6","resolution":{"observed_at":"2026-08-12T05:12:21.483412Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-12T05:12:20.231939Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.231939Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:af9cd0fe638275ed0b69edaebc5a6776f0eff1af394735732c4fbdc782a312cc","observation_id":"f0b14f49-5077-4ba3-bb13-95512cc6a919","resolution":{"observed_at":"2026-08-12T05:12:20.231939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.407820Z","title":null,"venue":null,"work_id":"1524e59a-dd15-441c-9402-db9a186b4648","year":2022},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.236532Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:59f0b1a160e6fc84a6b3de266f464bb51709aea44b0dbe160a910f3eb93b91a3","observation_id":"b649a35a-03b6-42ee-8899-b28bbddad54c","resolution":{"observed_at":"2026-08-12T05:12:21.412412Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.437377Z","title":null,"venue":null,"work_id":"f40458b1-ad55-4fc3-b108-39e33d048d09","year":2016},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.219109Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:5be172617404d1fec5f089c15761c749b3320d9da4671c60534e13af9d699699","observation_id":"1eab0424-6663-4c15-be72-bd984c335890","resolution":{"observed_at":"2026-08-12T05:12:21.442406Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.393932Z","title":null,"venue":null,"work_id":"8c56352b-d5f3-4475-8542-796f55dd4e65","year":2024},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.245062Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:2a7e2f8a8eb9305b0e2f16bbbae49e7273ef3b7c2ea14279d68909303f1d5d71","observation_id":"630bfbf3-68ae-4103-adaa-17c886809edb","resolution":{"observed_at":"2026-08-12T05:12:21.398497Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01116","last_updated":"2023-06-01T20:03:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T20:03:56Z","title":"The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01116","snapshot_observed_at":"2026-08-12T05:12:20.227843Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.227843Z"},"links":{"cited_paper":"/paper/2306.01116","citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:368c8ca489e34868480cf7cc437f5055aede2aa3d96e405dc955cd228d62defb","observation_id":"4b4fff55-6fdb-4f68-af6f-197011adb9c5","resolution":{"observed_at":"2026-08-12T05:12:20.227843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.369456Z","title":null,"venue":null,"work_id":"a2112971-24c7-4ee2-88f6-eeb00e0edd49","year":2023},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.253155Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:3db0b23023f1a4a3789aa327ec9b304817cf2b2899218c6670fc457a8805c773","observation_id":"6a63c711-28f4-4127-9df6-f389e0096a09","resolution":{"observed_at":"2026-08-12T05:12:21.373058Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.08059","last_updated":"2020-09-08T06:23:48Z","snapshot_observed_at":"2026-08-13T22:40:24.536581Z","submitted_at":"2019-11-19T02:51:15Z","title":"How does Early Stopping Help Generalization against Label Noise?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.08059","snapshot_observed_at":"2026-08-12T05:12:20.256853Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.256853Z"},"links":{"cited_paper":"/paper/1911.08059","citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:bc52466bb5fc7097ca15fe49949a56bc55dff51ad6501b6e02df753cf7fe8910","observation_id":"ac362ec6-c674-4f8f-8465-24642fde148e","resolution":{"observed_at":"2026-08-12T05:12:20.256853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-08-13T11:49:54.444750Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-08-12T05:12:20.240290Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.240290Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:0052c0db49b07576c6caf7aaa0bc1581760c8eb586021e731de08e449501064a","observation_id":"9d3acae4-c479-40a9-8da9-b4fab1d8231d","resolution":{"observed_at":"2026-08-12T05:12:20.240290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.333421Z","title":null,"venue":null,"work_id":"b360cb04-43c6-42ed-8733-e2529047c8a3","year":2024},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.267903Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:fbef2be9438638d5d6eff8b510ed730a442187bf2b1698f560fb89b721ff3817","observation_id":"78bfcfbb-beb8-4a77-b863-f7844048f839","resolution":{"observed_at":"2026-08-12T05:12:21.337625Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.382429Z","title":null,"venue":null,"work_id":"ffac4c45-345d-4bb7-8440-78c2213dcea3","year":2017},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.249233Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:4dce021dd532f0e9528078803827277c5a920fbc51e4d736a68b6224f66c36ac","observation_id":"4feae7a5-cda6-46ce-bbfd-d4645d55cfa9","resolution":{"observed_at":"2026-08-12T05:12:21.386013Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.306984Z","title":null,"venue":null,"work_id":"9f03339e-92d2-4164-b1da-6dd3177f5b43","year":2023},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.276263Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:b9c1a16484f8578c3f228a72d3925f82b4158210fbd6a7752a36660c0ba4af79","observation_id":"20c6725d-162c-4b31-b0c8-bfa55cf5c12e","resolution":{"observed_at":"2026-08-12T05:12:21.311164Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.293951Z","title":null,"venue":null,"work_id":"41eb2fb9-c8e0-4b23-af55-491f47660e4d","year":2021},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.280115Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:32e34bc41ce20a9a4eb3af5bf7bcdbd3f5677cdb36c2c2c5b25067cb66bf473b","observation_id":"4d079386-bc48-4da2-9b26-b099b087fcd1","resolution":{"observed_at":"2026-08-12T05:12:21.298007Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.261101Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.261101Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:60b13bb90645fab4b210545f1e64f766c9ed1d23c8ffca36a70e7ca48cac75a1","observation_id":"a0a3da97-4ca0-42cd-a1a7-af300c0d98f1","resolution":{"observed_at":"2026-08-12T05:12:20.261101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.260559Z","title":null,"venue":null,"work_id":"51d6c2ab-6f18-4683-980c-c8c137ef8782","year":2024},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.290668Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:a3a4b4de3536b6121a208d13d537160f6eb6defab53f3fff70b1bc2338776b22","observation_id":"ea86cc9f-80aa-4278-8e28-73bcc61c46a5","resolution":{"observed_at":"2026-08-12T05:12:21.264894Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.247326Z","title":null,"venue":null,"work_id":"89ca89b1-9d7c-4208-861d-0c5fb8141983","year":null},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.294268Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:b769a82ecfb51992215f70b5947f217c352969398e0800cff97e00e10aae5958","observation_id":"aa218fa6-17bc-41be-9538-bcc3f4d9fe43","resolution":{"observed_at":"2026-08-12T05:12:21.252401Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.320465Z","title":null,"venue":null,"work_id":"ce8c6598-fb7e-4ed1-9ab6-5273a82833df","year":2023},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.272395Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:3b2466f2178952ce9f1f0cc68e2ffaa0941bc5633ddd31bddb85c93cfbbc2c25","observation_id":"b694cc80-8df1-4e6a-b049-b22b902dab75","resolution":{"observed_at":"2026-08-12T05:12:21.324521Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05159","last_updated":"2019-11-15T17:08:30Z","snapshot_observed_at":"2026-08-14T17:44:31.188487Z","submitted_at":"2018-12-12T21:24:15Z","title":"An Empirical Study of Example Forgetting during Deep Neural Network Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05159","snapshot_observed_at":"2026-08-12T05:12:20.306364Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.306364Z"},"links":{"cited_paper":"/paper/1812.05159","citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:5b9791c113472e1b33a6a36f0e8a67faf73ff7668a3b3314c47f7fc101ff881f","observation_id":"6e1c317d-ab71-44ff-90ba-d89721b67e93","resolution":{"observed_at":"2026-08-12T05:12:20.306364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14563","last_updated":"2024-07-18T20:29:49Z","snapshot_observed_at":"2026-08-12T23:19:07.698012Z","submitted_at":"2024-07-18T20:29:49Z","title":"Learning Visual Grounding from Generative Vision and Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14563","snapshot_observed_at":"2026-08-12T05:12:20.310701Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.310701Z"},"links":{"cited_paper":"/paper/2407.14563","citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:404cb6e4aa2c4064f5a46d04a9a8c9f19f6fb61212c1fa1b938b04454953239c","observation_id":"851445d6-809a-4ffd-a566-67cba513120a","resolution":{"observed_at":"2026-08-12T05:12:20.310701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.283684Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.283684Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:0b47e5c764537cc6f5961ed40b168394a3d5b3de11acf4730dbcb0f31c0918f4","observation_id":"85113e0c-25b4-429c-a241-7dc55d3912e5","resolution":{"observed_at":"2026-08-12T05:12:20.283684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.273292Z","title":"In Proceedings of the 30th ACM International conference on Multimedia","venue":null,"work_id":"43dbcf37-5ecb-4da0-9441-5f11c195fdb4","year":null},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.287112Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:e41100ba395880251d0cfa64a3f4d24dcc9dd7b65b2330f2e7dbdd6986268cea","observation_id":"3ebdc20d-bc7c-4bab-b3e3-0ed2ad46a4e9","resolution":{"observed_at":"2026-08-12T05:12:21.277443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.208142Z","title":null,"venue":null,"work_id":"3e666b1a-94da-4974-9219-5ed80194554d","year":null},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.322075Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:40a9ab44bcb39e2ba66f2d86074f3d11a7fa9a46fce3cfd94382da49d2a5c55d","observation_id":"b452c6fd-68ab-4dd2-ab9c-2664149a49dc","resolution":{"observed_at":"2026-08-12T05:12:21.212367Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.180398Z","title":null,"venue":null,"work_id":"01af27c2-0534-455a-b8bb-7f632e75ee02","year":2022},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.329484Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:73d9a7e5c9951b07b226057e52d59e1bb3470fbb770eb8c7808cec750eaaae1f","observation_id":"61020110-c9b8-4355-80ee-715ac74f7695","resolution":{"observed_at":"2026-08-12T05:12:21.184437Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16944","last_updated":"2023-06-15T06:25:34Z","snapshot_observed_at":"2026-08-13T11:32:25.316168Z","submitted_at":"2023-05-26T13:59:45Z","title":"Learning to Imagine: Visually-Augmented Natural Language Generation","version":3},"cited_work":{"arxiv_id":"2305.16944","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.16944","snapshot_observed_at":"2026-08-12T05:12:20.623292Z","title":"Learning to Imagine: Visually-Augmented Natural Language Generation","venue":"cs.CL","work_id":"c0958245-69e1-4df9-8673-7512635e6d03","year":2023},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.298077Z"},"links":{"cited_paper":"/paper/2305.16944","citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:243ca1cab0b25d8e04e7ea0399913b8da1d1e7381dabe324506c81671bf58fe6","observation_id":"4c9f024c-f85d-49a7-b629-e38a6c9ad705","resolution":{"observed_at":"2026-08-12T05:12:20.628533Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17742","last_updated":"2023-12-28T18:59:55Z","snapshot_observed_at":"2026-08-13T04:52:37.403767Z","submitted_at":"2023-12-28T18:59:55Z","title":"Learning Vision from Models Rivals Learning Vision from Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17742","snapshot_observed_at":"2026-08-12T05:12:20.301904Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.301904Z"},"links":{"cited_paper":"/paper/2312.17742","citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:3c901a0751ea0c9529388138e3e9881efedee3057846d1ae8f341d22250a9213","observation_id":"0653d2c1-0b84-4493-94f1-15c9adbc1e4d","resolution":{"observed_at":"2026-08-12T05:12:20.301904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13400","last_updated":"2024-09-05T14:33:04Z","snapshot_observed_at":"2026-08-13T00:25:32.833962Z","submitted_at":"2024-04-20T14:57:31Z","title":"HiVG: Hierarchical Multimodal Fine-grained Modulation for Visual Grounding","version":2},"cited_work":{"arxiv_id":"2404.13400","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13400","snapshot_observed_at":"2026-08-12T05:12:20.548999Z","title":"HiVG: Hierarchical Multimodal Fine-grained Modulation for Visual Grounding","venue":"cs.CV","work_id":"66470b3e-decb-4840-971b-566372c76905","year":2024},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.342501Z"},"links":{"cited_paper":"/paper/2404.13400","citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:27e992012cbbc5caee13fd68e9401cfc4acf276a5c690d053ba81351388d2df9","observation_id":"cd1f2e48-8818-4b97-9e3d-75f46744f4e5","resolution":{"observed_at":"2026-08-12T05:12:20.555642Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.167724Z","title":null,"venue":null,"work_id":"f40961a4-1222-480d-a064-1f11739ea69c","year":2023},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.346379Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:99a63d697e098e6620bcfb68f8c7043102306190890f028e10215f9c1ea3f0a3","observation_id":"bcf183e3-da8f-4805-b2fc-027891ca7e77","resolution":{"observed_at":"2026-08-12T05:12:21.171850Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.233038Z","title":null,"venue":null,"work_id":"d1a75cfb-eaf8-44b2-945b-d226abfafb9d","year":2024},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.314801Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:4b206b0c9b4bdd22205c617b0c737600943118a4bdca0d53b5a685e5dbb45f2a","observation_id":"441fdaf3-c4ff-4763-bbb0-10ba53b9ecd0","resolution":{"observed_at":"2026-08-12T05:12:21.237427Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.221227Z","title":null,"venue":null,"work_id":"4a619768-5b93-4d2e-be48-b8ab451fb2f7","year":2024},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.318437Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:c05ba5fcc80737c5486efbac888fb079cd5d6eab06794fd72fecd6dc6899d650","observation_id":"1d54b081-d868-44a6-9a6d-b911bec648b4","resolution":{"observed_at":"2026-08-12T05:12:21.224959Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.111279Z","title":null,"venue":null,"work_id":"b28622ce-2516-4a58-97ee-213fe747edcf","year":null},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.360716Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:d14a337d3a7e34426993e87743894bb0f072d248ed5b82348697587cfed223c8","observation_id":"a49d7526-e548-4928-ae02-b1aaa01e8ef7","resolution":{"observed_at":"2026-08-12T05:12:21.115373Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.193369Z","title":"In Proceedings of the 30th ACM International Conference on Multimedia","venue":null,"work_id":"e9a91b73-015d-4593-8123-f0c67b33bd07","year":null},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.325787Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:5c0af6e0b5aeb199a9c423d1350d2882eea13bbabc00d6cde97c35a735a57d1d","observation_id":"3c6b1d10-eeb7-412c-b428-30f236fb1be9","resolution":{"observed_at":"2026-08-12T05:12:21.198260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.074677Z","title":null,"venue":null,"work_id":"4a401ec8-45fd-4858-aa55-ad05b89b06b5","year":null},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.371578Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:1573527f1b97f7989223d9b770e72ea8a5bf391970674b3809d2f37945cee3fd","observation_id":"405bcca6-0c11-4b7c-a6a6-ed4314bf4cf3","resolution":{"observed_at":"2026-08-12T05:12:21.078550Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09994","last_updated":"2020-06-17T16:54:43Z","snapshot_observed_at":"2026-08-14T12:00:40.095980Z","submitted_at":"2020-06-17T16:54:43Z","title":"Noise or Signal: The Role of Image Backgrounds in Object Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09994","snapshot_observed_at":"2026-08-12T05:12:20.332941Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.332941Z"},"links":{"cited_paper":"/paper/2006.09994","citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:09cf6d176c6f6401b68f47f4ad9f075e1c1098f2462c859ff727d9481dff261e","observation_id":"0a399130-a21b-4575-b6c1-56b08106a9ed","resolution":{"observed_at":"2026-08-12T05:12:20.332941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20206","last_updated":"2026-08-04T09:37:47Z","snapshot_observed_at":"2026-08-10T07:55:01.075143Z","submitted_at":"2024-12-28T16:34:35Z","title":"Toward Visual Grounding: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20206","snapshot_observed_at":"2026-08-12T05:12:20.338098Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.338098Z"},"links":{"cited_paper":"/paper/2412.20206","citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:4941b700e525fdc49defc5108344800422d1039e15bf2666ed38ffde7fd9fc5b","observation_id":"39e1e990-c959-4b2b-85ee-c38a3bc9f2c7","resolution":{"observed_at":"2026-08-12T05:12:20.338098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09329","last_updated":"2023-02-27T04:55:14Z","snapshot_observed_at":"2026-08-13T21:17:27.060264Z","submitted_at":"2022-05-19T05:36:35Z","title":"Dataset Pruning: Reducing Training Data by Examining Generalization Influence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09329","snapshot_observed_at":"2026-08-12T05:12:20.386043Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.386043Z"},"links":{"cited_paper":"/paper/2205.09329","citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:e0a8667bb549e52805815ebe540dc8db63d8db8bc3396e2cae594840e3226ce8","observation_id":"be224721-c81f-41a4-b184-ee5f99ed21a2","resolution":{"observed_at":"2026-08-12T05:12:20.386043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.021477Z","title":null,"venue":null,"work_id":"07969701-18c7-4959-9f56-eabf5801ea4c","year":2022},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.389775Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:d80a05662120fa18a7bd12b440ac97c11039e1abf6e1e4fb1cccc922445e745c","observation_id":"a4f432f7-1fcb-4769-b0f2-9b9e4b489ffb","resolution":{"observed_at":"2026-08-12T05:12:21.025907Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.154819Z","title":null,"venue":null,"work_id":"09a7defd-c3ea-4bc5-b678-1af74488ef23","year":null},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.350315Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:741c0089a391f519a8b919d3c8e4a1bd6a120f1c5b01a7b86fc73d0dcac66912","observation_id":"0d18720f-09b9-4a05-a52a-6c378937f691","resolution":{"observed_at":"2026-08-12T05:12:21.159008Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.140829Z","title":"International Journal of Computer Vision (2024), 1–20","venue":null,"work_id":"66bdc40f-bf9c-4c72-8877-d1a2cb299859","year":2024},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.353946Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:039a7dbb231d3d9f67902d228ca81e8a04c43d1c9a538b9ec37fad9db3412cce","observation_id":"507e423e-30d4-43b7-aff9-b4289a2fa7e7","resolution":{"observed_at":"2026-08-12T05:12:21.145535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.357550Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.357550Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:b79d9e162e53b72c0d77a3239c33466e935c351e89cd15f904f89f4bb63dbba9","observation_id":"115bd1c1-24fe-4c93-8d1a-393577b6f77e","resolution":{"observed_at":"2026-08-12T05:12:20.357550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.976463Z","title":null,"venue":null,"work_id":"cc398c62-5ed2-4bcf-b4a0-77939cd18c79","year":2024},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.408313Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:4ed72ef6cd62efe4cd00c928931186917c613025e1da63966f64d07e5cb5fc66","observation_id":"247b730b-b7f1-42af-86f2-cfe8222b4956","resolution":{"observed_at":"2026-08-12T05:12:20.980906Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.096355Z","title":"In Proceedings of the 31st ACM International Conference on Multimedia","venue":null,"work_id":"8fb8491b-fe5a-424d-8f0c-56c960d70ca9","year":null},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.364237Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:524448a11b4907cd1ef965e0d5baaafbf93bd82bc488734b4851ccb5e6c98ed5","observation_id":"158fe8e8-42f9-42b3-a45f-d4a0ad6f3d3c","resolution":{"observed_at":"2026-08-12T05:12:21.101953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.085839Z","title":null,"venue":null,"work_id":"9269575e-14f3-4706-aef9-a1f85c543f38","year":2023},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.367960Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:21fe236ea552394cf2b7e16dabdc0853347f9fe252fc8ba96d553f08ed41afc9","observation_id":"76b7ac57-2372-457f-b8d8-95ea83ebb3ec","resolution":{"observed_at":"2026-08-12T05:12:21.089196Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.939032Z","title":null,"venue":null,"work_id":"d0adfa86-05dc-4e21-ac86-35e3b873b208","year":2018},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.421784Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:7a26f4a59fd85ba847bd83882b6164fa7d0d95f13c405aa7b483048d9c0da6a8","observation_id":"3bc3e676-7212-4b7f-87cd-0741fdf54ec7","resolution":{"observed_at":"2026-08-12T05:12:20.943009Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.061096Z","title":null,"venue":null,"work_id":"b1d91de7-2400-4eb9-97e9-c21dfe4b7a4b","year":null},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.375134Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:bb356c85fd7e5194d498e18e9b2396008d76416c338b07b2d4e8edb34991d37b","observation_id":"df2d1dcb-62ad-4210-b05c-a6e04a2e9b4c","resolution":{"observed_at":"2026-08-12T05:12:21.065877Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.048547Z","title":null,"venue":null,"work_id":"8062e146-52d3-46ca-b011-4e7d9645b50c","year":2024},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.378813Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:f9ac898137c3f7d2590036da46dbc6593b174c98ebc534bf7a853eec9b892ebd","observation_id":"ad73574e-4b65-491a-9044-1f00bd67945c","resolution":{"observed_at":"2026-08-12T05:12:21.052881Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.034252Z","title":null,"venue":null,"work_id":"2ee9266b-c0ff-4873-86d3-50bbdd9b7706","year":2022},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.382421Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:39ea051f8d771f6d2ebfde3e359367a71e0e991d7e2947d69760c3279ab4fec5","observation_id":"1d1bf5ef-600a-41a9-87e8-ffe7e1264cf7","resolution":{"observed_at":"2026-08-12T05:12:21.038453Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.864756Z","title":null,"venue":null,"work_id":"27f8ffdd-150b-4105-85f5-90eb0b14d8c2","year":2024},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.449531Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:e3f9b6e86cd438ff2d212e3d7569c64fce4ec5ac97be7e3755f31f7d3a5cccef","observation_id":"3c15c56e-50fd-4505-b444-cafe48ab7217","resolution":{"observed_at":"2026-08-12T05:12:20.869636Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03893","last_updated":"2023-09-07T17:55:01Z","snapshot_observed_at":"2026-08-13T10:18:20.403188Z","submitted_at":"2023-09-07T17:55:01Z","title":"DiffusionEngine: Diffusion Model is Scalable Data Engine for Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03893","snapshot_observed_at":"2026-08-12T05:12:20.454458Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.454458Z"},"links":{"cited_paper":"/paper/2309.03893","citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:838b81b1b5caaafee6f6d1c04face660cc9b64a582fcb0113672301683da5d64","observation_id":"8998b965-2205-4974-90c5-fe375500c15d","resolution":{"observed_at":"2026-08-12T05:12:20.454458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:21.006029Z","title":null,"venue":null,"work_id":"e583a1af-fad9-4d39-af00-0e82f4a265d8","year":2023},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.393546Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:b8c2a5b2d36216c9bea2ab2b0d360cb81a44d024b9fe5ba4edc2538b8f6dabda","observation_id":"2ebaa63e-268d-4594-a49b-cd96eeea7b64","resolution":{"observed_at":"2026-08-12T05:12:21.011491Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01830","last_updated":"2023-10-23T08:57:58Z","snapshot_observed_at":"2026-08-14T05:33:21.819850Z","submitted_at":"2023-10-03T06:55:19Z","title":"AI-Generated Images as Data Source: The Dawn of Synthetic Era","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01830","snapshot_observed_at":"2026-08-12T05:12:20.397495Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.397495Z"},"links":{"cited_paper":"/paper/2310.01830","citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:ceafe9be71b2a326106bf864c52a459e0436e6e78db331aab62515c9a92e1d2f","observation_id":"563522cf-352e-45ae-9b50-23753a1e81c3","resolution":{"observed_at":"2026-08-12T05:12:20.397495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.989748Z","title":null,"venue":null,"work_id":"cbaf0404-38a3-41cd-b705-0b40b0f78f53","year":2020},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.402956Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:a0eb2aa1d6cbda9041fb03a40b02d9cabf1bd6a73cf908d1a6893d86f0b83c9f","observation_id":"a6d8a094-dfcd-4170-af0c-a06be6aa602e","resolution":{"observed_at":"2026-08-12T05:12:20.993885Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:12:20.964727Z","title":null,"venue":null,"work_id":"802a5498-7ba3-4746-a7f4-7965890cb648","year":2023},"citing_paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-12T05:12:20.412244Z"},"links":{"citing_paper":"/paper/2412.00684"},"observation_digest":"sha256:5c8c8a305f16b0115b6ad7e5e693ba7a5112041d64dbcbdaeb0726c4455ea9d1","observation_id":"07af76ca-69c1-41ea-9a82-66e257150f2c","resolution":{"observed_at":"2026-08-12T05:12:20.968156Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.00684","last_updated":"2025-04-20T10:32:37Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T05:15:28.741838Z","submitted_at":"2024-12-01T05:47:59Z","title":"Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":88,"verified_exact":6,"verified_fuzzy":5},"total_outbound_references":113},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 100 of 113 outbound references and 1 inbound Pith citation observation for arXiv:2412.00684."}