{"as_of":"2026-08-08T03:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5cdb5edf8e01148c8d892e04e64c5bda44c994a752fc3616bab6a55da149efc2","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:44:12.200891Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.01558/citation-record","integrity":"/paper/2506.01558/integrity","json":"/paper/2506.01558/citation-record.json","paper":"/paper/2506.01558"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:11.322434Z","title":"Self-calibrated clip for training-free open-vocabulary segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.322434Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:f3db71e8b61f531cb477c31086b946dac26b5f63580a713167e11a837ead4582","observation_id":"5f657d51-1ebb-49b7-a1c1-a31055a06513","resolution":{"observed_at":"2026-08-07T11:44:11.322434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:11.348892Z","title":"Unraveling in- stance associations: A closer look for audio-visual segmenta- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.348892Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:e85e00a68c64c999fa4e833d2999e7279757dd0630f61110e0badc5fd82c71fb","observation_id":"4106bdea-8ebf-42b7-b522-168cf3635064","resolution":{"observed_at":"2026-08-07T11:44:11.348892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T11:44:11.369535Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.369535Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:31d2977b831722068fb6db518611b461e2e659bd99814592aae6f3eb2f00bf7c","observation_id":"28ddbb4c-1743-43ca-a927-991312d9307f","resolution":{"observed_at":"2026-08-07T11:44:11.369535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.719529Z","title":"Avsegformer: Audio-visual segmentation with trans- former","venue":null,"work_id":"5f7605ec-abbb-4036-a806-30641612d0e8","year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.393623Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:1253f1431c4691a18d5e81c8ef7eb56f7b8af58694175040ee9d4d0b4d59570d","observation_id":"9dbd80ee-966b-44cf-9bd8-158540a1080f","resolution":{"observed_at":"2026-08-07T11:44:14.736426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.687353Z","title":"Audio set: An ontology and human- labeled dataset for audio events","venue":null,"work_id":"e8f1175d-096e-4b20-a245-9aa88fd7c1da","year":2017},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.422743Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:ebc9c3415e4d3c87c477389c64fd618bdc7ceb1d469ef4be1348940252a9fdf1","observation_id":"20ec1905-41b2-4500-bd1c-255311445b5a","resolution":{"observed_at":"2026-08-07T11:44:14.699455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.650178Z","title":"Cnn archi- tectures for large-scale audio classification","venue":null,"work_id":"e666cdef-198d-42da-bcb2-4a8ba82c3aaf","year":2017},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.443369Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:0663250bfc753190da5bbab4df3661fd26c59f6f301f9aeaf5f106f01e0bbbc7","observation_id":"36ef3bfc-767c-4f91-9234-e25c73b26324","resolution":{"observed_at":"2026-08-07T11:44:14.667367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.614519Z","title":"Referitgame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":"726aa265-1337-4559-a293-438ccee25346","year":2014},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.467929Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:351fc10108c26de299471109f2c24685f8079e9045791e64fe487c1a7e81725e","observation_id":"0bd5aab6-3c94-4e93-9d15-3be7573625d0","resolution":{"observed_at":"2026-08-07T11:44:14.631580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:11.487126Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.487126Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:62b6888c0e97c78e25a917e3f2a938b44ebf340eda84a6a5ea16d6b11026fd3f","observation_id":"112943e8-e328-4570-85bf-0f711cd5c1a1","resolution":{"observed_at":"2026-08-07T11:44:11.487126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:11.507306Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.507306Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:178ef0947236afc9cfe2dd901a5f4faf5f8dc3b7e657231129694e6d209d18a4","observation_id":"44aa1544-d441-432f-a99f-8a2339efc465","resolution":{"observed_at":"2026-08-07T11:44:11.507306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.567216Z","title":"Learning to answer questions in dynamic audio-visual scenarios","venue":null,"work_id":"9ee85464-314d-4cf0-90a3-db9a9a496caf","year":2022},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.527309Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:bc1d3bc0b0679ef6f02baade078536402abc331aebe360326ca74d541f92644d","observation_id":"a8e998dc-9bfe-4169-a895-9b7f0e2d6e10","resolution":{"observed_at":"2026-08-07T11:44:14.580940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:11.551397Z","title":"Robust referring video object segmentation with cyclic structural consensus","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.551397Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:e46e0e9273e17fe13db3be9646388f20f65e742aaeb29f4f5963b740fa5e23a1","observation_id":"dd7a614f-769c-40c2-a826-1465021b808b","resolution":{"observed_at":"2026-08-07T11:44:11.551397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.516931Z","title":"Libero: Benchmarking knowl- edge transfer for lifelong robot learning","venue":null,"work_id":"001990fa-a3b2-4d1e-bae9-d9a4a44f0227","year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.568454Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:706788d7aa8dae2c57ffb9d9bc584daa0fffd4c5c1bf3af1a489ac5c81511676","observation_id":"68ac84f6-97a6-4d9e-9619-a4d26330f4de","resolution":{"observed_at":"2026-08-07T11:44:14.532561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.480902Z","title":"GRES: Gen- eralized referring expression segmentation","venue":null,"work_id":"b46a3bfe-6a96-42e0-a981-0d2f1ab42ed5","year":2023},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.584902Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:578a11c195028a1e203e72801870b66127d902217044c5650bb0353c04270545","observation_id":"b7696e5c-1259-4a90-a136-bc97a26f253b","resolution":{"observed_at":"2026-08-07T11:44:14.498870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:11.601043Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.601043Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:2d77ae418bb7a22511f1db7b80bd5b9b77260e028910a23878f19015286ee8aa","observation_id":"abedcc9d-ea78-471c-b193-3feea0248855","resolution":{"observed_at":"2026-08-07T11:44:11.601043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:11.621005Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.621005Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:aa76a2d4124b279e3831bf06d7bf0ddab77dd52165144caa2191d1b2c30deb30","observation_id":"e108d5a6-4276-4322-8943-95722e94cc8f","resolution":{"observed_at":"2026-08-07T11:44:11.621005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-07T11:44:11.639745Z","title":"Roberta: A robustly optimized bert pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.639745Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:84ef0e2da8a682e93ca11dedaadda7702cea2c85591fe91c8ab9b343db850786","observation_id":"a2c1f8d2-72ed-4b08-804b-9a28108aa5a3","resolution":{"observed_at":"2026-08-07T11:44:11.639745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.431186Z","title":"Open-vocabulary segmentation with semantic-assisted calibration","venue":null,"work_id":"3c4d7375-1020-47c7-8b59-72567141c978","year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.660057Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:5f4e265d4fd05988d18b6d33abef14f97c1a1845f689d5407de45de5e5bf4e0a","observation_id":"e1580b59-e6a2-4b27-adb5-7382a9c7bf06","resolution":{"observed_at":"2026-08-07T11:44:14.446323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.382187Z","title":"Universal segmentation at arbi- trary granularity with language instruction","venue":null,"work_id":"b3a51b18-8e04-40ac-bec5-f8265a90f92e","year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.677555Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:740edad43299836670de7432d8f01b7142fac4322fcbd95dfefd289c08b9a6f4","observation_id":"d3be685d-3edd-4cb2-a54e-cce2bfe266c4","resolution":{"observed_at":"2026-08-07T11:44:14.399232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:11.704295Z","title":"Decoupled weight de- cay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.704295Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:f3cfef50a3f359a6dc0f354ce3ac2d3e41173b7619382cb72639acee0031a66c","observation_id":"f94e348d-ca8a-47fc-ace8-4688e635702d","resolution":{"observed_at":"2026-08-07T11:44:11.704295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.341092Z","title":"Soc: Semantic-assisted object cluster for referring video object segmentation","venue":null,"work_id":"b7d426e9-9c11-4709-b4c4-2e29490ec12f","year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.721300Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:a5f178c44ddb29cff05c58d0669d072a2d7147aa77d63c40f310c49da5936a4c","observation_id":"09e0cbf6-df4a-49e9-94f7-25215f04a837","resolution":{"observed_at":"2026-08-07T11:44:14.354324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.291828Z","title":"Mod- eling context between objects for referring expression un- derstanding","venue":null,"work_id":"69eefe5f-ad3c-49c7-8bd4-a946f40adb4b","year":2016},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.738165Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:c9d62c361d5b31ac027032f85b326306db97ae69350490cfd0391de7c0783f20","observation_id":"16f510cc-11dc-4c5a-a067-d6c1aef562ba","resolution":{"observed_at":"2026-08-07T11:44:14.313045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T11:44:11.756990Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.756990Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:f24f8b2794762522a4696e08922619c43faa06ad184dc2306cb591a42fc2eb9c","observation_id":"b645e32b-6c58-4403-94c1-1563de57e8aa","resolution":{"observed_at":"2026-08-07T11:44:11.756990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.248512Z","title":"Pixellm: Pixel reasoning with large multimodal model","venue":null,"work_id":"f22f7021-23ec-4810-bb1a-16d144edcac9","year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.778749Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:e18cf0fab407894053b0c4efe19e8f600b08223567e73e2a820871bfff5586a8","observation_id":"247f7548-6d8e-430a-9382-b699f0dee7a6","resolution":{"observed_at":"2026-08-07T11:44:14.269637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-07T11:44:11.802462Z","title":"Distilbert, a distilled version of bert: smaller, faster, cheaper and lighter.arXiv preprint arXiv:1910.01108,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.802462Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:5b7e8856f23758a7b893285f3eade64a22b584098d260ac9b12396960114744a","observation_id":"e51c9301-f233-417f-95a4-7afa4d1929a7","resolution":{"observed_at":"2026-08-07T11:44:11.802462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.208330Z","title":"Efficient attention: Attention with lin- ear complexities","venue":null,"work_id":"7fde7d5f-ed4e-4bd3-a7ab-c20cef9d9698","year":2021},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.832827Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:915f8cd4854f459e252468a35e939dc67b0ce12a2aececec9e2b95a7f88894fe","observation_id":"3028eb4f-1c46-4812-92eb-c73560c00a93","resolution":{"observed_at":"2026-08-07T11:44:14.225927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:11.848405Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.848405Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:31157033e49a48c5331e054aca6e1409ddeda9c1da8b65a54321b29e3a9f8fc5","observation_id":"5878c5f0-72c0-41ed-a211-55eac3e2713c","resolution":{"observed_at":"2026-08-07T11:44:11.848405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.171864Z","title":"Auto- acd: A large-scale dataset for audio-language representation learning","venue":null,"work_id":"f77054c9-8ccd-43a2-82d3-6609d142fe9b","year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.871678Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:a94d8297a07142c4c4d01b57ed5920fca99fabcdb3c6cd4337fbc7a72cf1eede","observation_id":"bc52a43d-4679-4847-ad56-7721d435448c","resolution":{"observed_at":"2026-08-07T11:44:14.182438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07929","last_updated":"2024-02-02T08:02:35Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-13T05:43:35Z","title":"Prompting Segmentation with Sound Is Generalizable Audio-Visual Source Localizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07929","snapshot_observed_at":"2026-08-07T11:44:11.892307Z","title":"Prompting segmentation with sound is generalizable audio-visual source localizer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.892307Z"},"links":{"cited_paper":"/paper/2309.07929","citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:b5cdb0ba3bcf88e58f6d89497047ba02dbffe0cd88b1bd2d19942f6afcc1a681","observation_id":"f31b91df-7213-47e0-aca7-bd32ddac1e79","resolution":{"observed_at":"2026-08-07T11:44:11.892307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.138893Z","title":"Efficient remote sensing transformer for coastline detection with sentinel-2 satellite imagery","venue":null,"work_id":"97d8ce58-212d-46f9-bda1-04ad45994b82","year":2023},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.907122Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:2b8820652c962a730d091c309f1f3ef54953d6273220188c59b4f66b3f08c01f","observation_id":"64f558e1-147b-468f-878c-483ff6fa7bbe","resolution":{"observed_at":"2026-08-07T11:44:14.151753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.093239Z","title":"Prompting segmentation with sound is gen- eralizable audio-visual source localizer","venue":null,"work_id":"d8b2578f-17d8-4a3b-8c1b-f5bfed0cf972","year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.924209Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:7e121ca5659bde33d84b48f2f3746d373d0879076340c39119d79d2f9092711f","observation_id":"58ab5cbc-bd89-45e4-b97f-f47dc87a431e","resolution":{"observed_at":"2026-08-07T11:44:14.117916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.045465Z","title":"Ref-avs: Refer and segment objects in audio-visual scenes","venue":null,"work_id":"d3fd0626-b403-46ab-93bd-b75aca948d22","year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.945322Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:a5a98f3d750da7acde4b933bce75b9a5444b7fc9e5c4749c64ea3ae9bfa65383","observation_id":"2e111730-5219-4b15-8ebf-ad71dd6e9371","resolution":{"observed_at":"2026-08-07T11:44:14.060729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.008860Z","title":"Convolution meets trans- former: Efficient hybrid transformer for semantic segmenta- tion with very high resolution imagery","venue":null,"work_id":"bd041314-9348-40e1-baf7-a5f4135602f2","year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.959188Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:bb61751a8beee1da8b9dac652a282429eb5a6667d10944929039b3c7813e6037","observation_id":"493dc4ad-5486-4df8-804b-0238b2ed74bc","resolution":{"observed_at":"2026-08-07T11:44:14.026308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00936","last_updated":"2025-03-02T15:19:37Z","snapshot_observed_at":"2026-08-07T17:35:45.126755Z","submitted_at":"2025-03-02T15:19:37Z","title":"IteRPrimE: Zero-shot Referring Image Segmentation with Iterative Grad-CAM Refinement and Primary Word Emphasis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00936","snapshot_observed_at":"2026-08-07T11:44:11.980254Z","title":"Iterprime: Zero-shot referring image segmen- tation with iterative grad-cam refinement and primary word emphasis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.980254Z"},"links":{"cited_paper":"/paper/2503.00936","citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:a95805b0fb52a9584de03add3817985ec9d9447fc7100af28e4096b59f594447","observation_id":"5cb92975-e83f-4199-a288-d262b10ca69c","resolution":{"observed_at":"2026-08-07T11:44:11.980254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:11.997831Z","title":"Onlinerefer: A simple online baseline for referring video object segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.997831Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:8d206c491c715ba83049a9f58eea7d49720d659e9445c32af53f3d689c4df41b","observation_id":"4138baf4-d4f3-423a-bb44-b3b7c22d4c7c","resolution":{"observed_at":"2026-08-07T11:44:11.997831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:12.014816Z","title":"Language as queries for referring video object seg- mentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:12.014816Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:07813feed949ea88b41d6a9c73fefd59aa6d58f2ebfd5b3e5be965e30d7a9bff","observation_id":"b4aace26-db3c-4949-8b24-73b9f780121b","resolution":{"observed_at":"2026-08-07T11:44:12.014816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:13.955019Z","title":"Language as queries for referring video object seg- mentation","venue":null,"work_id":"08a09ddb-71c5-452e-97b1-5b0259164612","year":2022},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:12.032542Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:18bb22c16989c09b89b09539e8724a30ddbe5081c14e415bd8c4c45ecb2d64e3","observation_id":"0882748c-073e-47fa-aa91-48331e4454a4","resolution":{"observed_at":"2026-08-07T11:44:13.972399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:13.918418Z","title":"Gsva: Generalized segmentation via multimodal large language models","venue":null,"work_id":"236fe52a-96c0-42da-9028-9b6fddbd845f","year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:12.045116Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:7b2968452a6977f8177c13e7b05ba11e1aafff607b1e716e4a1da9436034a397","observation_id":"4d8b0770-911d-4830-955e-49fbd5ba5748","resolution":{"observed_at":"2026-08-07T11:44:13.935682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:12.061070Z","title":"Efficientsam: Leveraged masked image pretraining for efficient segment anything","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:12.061070Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:785beb8320446717c83f0b07cef5f7e9e17f9041aaee3c2884ccc3092b5aaf75","observation_id":"d7575162-9125-4f72-a778-1645e4c6b5a8","resolution":{"observed_at":"2026-08-07T11:44:12.061070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:12.605831Z","title":"Avqa: A dataset for audio- visual question answering on videos","venue":null,"work_id":"1862c6a6-7736-43fb-b067-872b506cb10f","year":2022},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:12.078141Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:fb47ce65d0e5295214cd3d726e567dde9e6dd03807b5a52aaa200718df113327","observation_id":"338baf62-16e1-439a-bd25-27965cef8bea","resolution":{"observed_at":"2026-08-07T11:44:13.878090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:12.563158Z","title":"Lavt: Language-aware vision transformer for referring image segmentation","venue":null,"work_id":"17805f41-b76b-4374-9e5e-e9bcd4a0eef8","year":2022},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:12.092128Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:f36ae1eb61f8f8fc51cfcef61126c31ce4fb084ed1938773203250509341eaae","observation_id":"9556304f-7048-4819-9f84-f36361c06f50","resolution":{"observed_at":"2026-08-07T11:44:12.578490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:12.525097Z","title":"Language- aware vision transformer for referring segmentation","venue":null,"work_id":"de3253ba-4d02-48c0-bc18-a6195cb2cd09","year":null},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:12.110003Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:449444d96401a1e1ade50a9ef880411914ed4610d39dd458d54d5516ff6d5bc4","observation_id":"16a50437-db4c-45f7-9e15-127705cd219f","resolution":{"observed_at":"2026-08-07T11:44:12.541709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14289","last_updated":"2023-07-01T07:26:22Z","snapshot_observed_at":"2026-07-06T15:46:29.060519Z","submitted_at":"2023-06-25T16:37:25Z","title":"Faster Segment Anything: Towards Lightweight SAM for Mobile Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14289","snapshot_observed_at":"2026-08-07T11:44:12.122600Z","title":"Faster segment anything: Towards lightweight sam for mo- bile applications","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:12.122600Z"},"links":{"cited_paper":"/paper/2306.14289","citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:b9718c73cbffa147ad9eeafffc2a3746ffa78a42dfb3c8d4088f01139f432abb","observation_id":"fd632782-eadc-4606-8d53-4ee658adf5c9","resolution":{"observed_at":"2026-08-07T11:44:12.122600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-08-07T11:44:12.137620Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:12.137620Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:6136ea0c4688eb0326b606e05e24b9e8ccc183725960521e190d561d277322e5","observation_id":"d7f2f6e5-a0fd-4d05-91d9-d1a3c3424bb8","resolution":{"observed_at":"2026-08-07T11:44:12.137620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12156","last_updated":"2023-06-21T10:08:29Z","snapshot_observed_at":"2026-07-06T15:45:01.961896Z","submitted_at":"2023-06-21T10:08:29Z","title":"Fast Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12156","snapshot_observed_at":"2026-08-07T11:44:12.151305Z","title":"Fast segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:12.151305Z"},"links":{"cited_paper":"/paper/2306.12156","citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:b29c87328bcc97875e0a4351e2bc2e0c7c8706107f342b65822ed122aef6d542","observation_id":"6d85d712-5c57-410d-8660-822dd4315a3c","resolution":{"observed_at":"2026-08-07T11:44:12.151305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:12.480000Z","title":"Audio-visual segmentation","venue":null,"work_id":"2280cd6f-4ba3-463f-b10f-f19578759d2d","year":2022},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:12.170613Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:f34a32b256fe4b78e714b5265013b97744d63081022e7f6190ee43f3963b704a","observation_id":"98aa6ac5-3a2e-4830-9d09-ed2199079c42","resolution":{"observed_at":"2026-08-07T11:44:12.500281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13190","last_updated":"2023-01-30T18:53:32Z","snapshot_observed_at":"2026-08-05T20:42:38.247638Z","submitted_at":"2023-01-30T18:53:32Z","title":"Audio-Visual Segmentation with Semantics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13190","snapshot_observed_at":"2026-08-07T11:44:12.186738Z","title":"Audio- visual segmentation with semantics","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:12.186738Z"},"links":{"cited_paper":"/paper/2301.13190","citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:75bcbc98d806af8ba29ec2a138e0c6bbb7526022b806fa9f4447d0b036f8b097","observation_id":"3321ace5-26c3-49e0-8a45-7ab64cb4f444","resolution":{"observed_at":"2026-08-07T11:44:12.186738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:12.200891Z","title":"Generalized decoding for pixel, image, and lan- guage","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:12.200891Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:d62b4d9b001f2f8d2358cf701f7714fb2f9d684f5ed23690dc276e6b2e9ae531","observation_id":"518e8f9d-885c-4021-83d6-3e19bb0a794f","resolution":{"observed_at":"2026-08-07T11:44:12.200891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2506.01558."}