{"as_of":"2026-08-11T13:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4dc5b6e77cbffa3c3001279e77c26c8748e2a690ca69062b28fdd3772cbda0af","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:20:29.491954Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.00339/citation-record","integrity":"/paper/2507.00339/integrity","json":"/paper/2507.00339/citation-record.json","paper":"/paper/2507.00339"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:30.083541Z","title":"pix2gestalt: Amodal segmentation by synthesizing wholes, 2024","venue":null,"work_id":"47ac6d23-f5a3-4a0d-83b6-66f163e39a13","year":2024},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.348774Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:fda0eafb8a13c67d9b8a56196bb87cd94228010fa93fa9367a414ed624c2859b","observation_id":"819ec2c1-fbd4-4282-a469-7038a0e0779e","resolution":{"observed_at":"2026-08-06T21:20:30.090312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:30.066788Z","title":"Bot-sort: Robust associations multi-pedestrian tracking, 2022","venue":null,"work_id":"5b1b01f0-94af-41aa-a4c8-a84045fcc8e3","year":2022},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.352673Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:075159f69fd18d176f12667e7248c62b802a65def57092d0ea440e5652795dfa","observation_id":"8c2aa305-2bcc-421e-8869-f0551e80155a","resolution":{"observed_at":"2026-08-06T21:20:30.072720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:30.049985Z","title":"Bytetrack: Multi-object tracking by associating every detection box, 2022","venue":null,"work_id":"4dff5e56-dd17-46ab-9584-529f32675fcf","year":2022},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.356031Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:34bf56356da8621362a825337c4dd60518aea3e64731d72a7b3acfd86d5db938","observation_id":"592f2094-4eff-4b4e-b573-d09cfd39dc64","resolution":{"observed_at":"2026-08-06T21:20:30.056150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:30.033772Z","title":null,"venue":null,"work_id":"310a23aa-b2bb-45b4-97d4-e5ca32dc35f2","year":2022},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.359398Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:43842aee34c219d52cdf3e7bcd9307649a855daed0c4e33dddbb38cc020cda2c","observation_id":"c7b87e6a-5743-45fd-9436-81016b36c333","resolution":{"observed_at":"2026-08-06T21:20:30.039557Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:30.018018Z","title":"Putting the object back into video object segmentation, 2024","venue":null,"work_id":"6a2a3a83-eb93-46ca-886f-014fee921381","year":2024},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.363166Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:7220cbc00366ec24cabcab1919400769497467fd4f9560f4f7c4f078b24ff9c5","observation_id":"532f1e6a-d463-43c1-ae0c-5a759a2a0bea","resolution":{"observed_at":"2026-08-06T21:20:30.024364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.999848Z","title":"Sam 2: Segment anything in images and videos, 2024","venue":null,"work_id":"e265a579-672b-45ff-bfc1-b96254e11a8e","year":2024},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.366728Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:4ffcae9d9b210e5b5231b3690a5375f1dfca1874dbb83c4795ab86296e23a0ab","observation_id":"19b5741f-ffda-4bff-803e-e3694f31cbec","resolution":{"observed_at":"2026-08-06T21:20:30.006863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.982249Z","title":"Transformer for object re-identification: A survey, 2024","venue":null,"work_id":"3bd8391d-1b60-4668-a3e0-910645bf6c55","year":2024},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.370641Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:c2ac5dedb9ee9fd641408472af46247e9b0261255859dbda439acb3877fb7a05","observation_id":"e1509505-da74-4e74-8b64-3a3f6762a955","resolution":{"observed_at":"2026-08-06T21:20:29.989284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.963771Z","title":"Feature aggregation and con- nectivity for object re-identification","venue":null,"work_id":"25847ab3-da03-4aeb-900f-a130cdfcc094","year":2025},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.373874Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:35650a26e900df514f5f77146578727ddeae969633bb093cd44046ade651b0aa","observation_id":"08d3de7d-2b09-454a-a668-619bfeaa5fee","resolution":{"observed_at":"2026-08-06T21:20:29.971467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.945559Z","title":"Repaint: Inpainting using denoising diffusion probabilistic models, 2022","venue":null,"work_id":"1676283a-25d7-4493-bbf7-69551eb01d93","year":2022},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.377138Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:7a0a6830020a2a888617cf2e8bbe918a648fbb9eb6ba1a8647135d72a1b5ee89","observation_id":"5f9ca094-dc0a-4c42-b981-3f62408ca529","resolution":{"observed_at":"2026-08-06T21:20:29.953055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.927818Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis, 2023","venue":null,"work_id":"c4edb001-30b0-435b-853f-2fe9dadc0e12","year":2023},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.380332Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:fa473e1e19d6aba47f82fbb81e361345be397bcb4890da1452cf1c338572b4c6","observation_id":"97ef334d-9a93-41d0-b6bd-b50206a5fde8","resolution":{"observed_at":"2026-08-06T21:20:29.933948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.910261Z","title":"Seeing objects in a cluttered world: Computational objectness from motion in video, 2024","venue":null,"work_id":"6f100331-ef42-4779-83a3-37b143d98d7d","year":2024},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.383605Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:14f409766dc2b24f3623d96a2f853f95106346e6d8193619db4f931b56ba70ba","observation_id":"c4e3b540-6050-401e-8136-9f6d739ff70e","resolution":{"observed_at":"2026-08-06T21:20:29.917185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.895022Z","title":"Learning 6-dof object poses to grasp category-level objects by language instructions, 2022","venue":null,"work_id":"5dbc6e8d-ded5-4320-b52b-ab00575f1371","year":2022},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.386717Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:8bff75b945d9d4aa4a111fd31d65a9fd4750cceb026bb3bb6e8e94db7aceeaef","observation_id":"73aa0060-603b-4e78-8885-ff622ff0b4a6","resolution":{"observed_at":"2026-08-06T21:20:29.900816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.877161Z","title":"Are we ready for autonomous driving? the kitti vision benchmark suite","venue":null,"work_id":"4ad310c6-3b16-4dcd-bbdf-d8139f1591c1","year":2012},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.390472Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:bff13a7ea2f568b1b080be4f8e13e32e72119afff87e300ccb98ef0f21a2f52d","observation_id":"278b6ccc-00cb-4087-92cb-a691cc52b6d0","resolution":{"observed_at":"2026-08-06T21:20:29.883881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.863335Z","title":"Impdet: Exploring implicit fields for 3d object detection, 2022","venue":null,"work_id":"57d71f15-aa8e-4a74-8641-c3da4efc9b47","year":2022},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.393568Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:7a387ee5eeda54dfd9211c511e40724fd9950ada1b1a97a4586e559017df7cda","observation_id":"f99b2e6e-9221-4617-bf9e-a694e19d45ee","resolution":{"observed_at":"2026-08-06T21:20:29.867963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.850313Z","title":"Rethinking amodal video segmentation from learning supervised signals with object-centric representa- tion, 2023","venue":null,"work_id":"460b9973-ef97-4c5f-8a9f-9685109b6aba","year":2023},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.396601Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:bd638b4c9f626e6147a6030148d7a25afb8aaf084f56ea064797e0a67043a6b3","observation_id":"e1a40c96-28c3-4b3d-85df-fe8dc2fe0cc3","resolution":{"observed_at":"2026-08-06T21:20:29.854334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.838629Z","title":"Amodal panoptic segmentation, 2022","venue":null,"work_id":"8f61f3f4-f8c1-426c-bdd7-29f210679ea0","year":2022},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.399868Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:9974c0731831494a39d60f8394ff6f1c059dae44fa091200799a6362ef3e7f78","observation_id":"47eb4572-7eac-43b9-86a2-fc6cdddf84fc","resolution":{"observed_at":"2026-08-06T21:20:29.842357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.826529Z","title":"Aisformer: Amodal instance segmentation with transformer, 2024","venue":null,"work_id":"898c0965-bff2-4df2-b0bd-d06ac10e87c4","year":2024},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.402916Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:ae0e98ac78b5aafba6354137a033328ed6ad986b2b733f51514dff5f788222b4","observation_id":"97409735-6b73-4a44-a0e1-dabe75bcd72a","resolution":{"observed_at":"2026-08-06T21:20:29.830942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.814517Z","title":"Amodal segmentation based on visible region segmentation and shape prior, 2020","venue":null,"work_id":"f7023b95-788a-470b-a714-4597f6d3fb63","year":2020},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.406447Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:8094fb83e1951786b741aead818d3434dc13ddea9cdda08503c00056b154bdd4","observation_id":"9a55621b-7deb-4154-ac96-d690b50ff049","resolution":{"observed_at":"2026-08-06T21:20:29.818156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.802668Z","title":"Deep occlusion-aware instance segmentation with overlap- ping bilayers, 2021","venue":null,"work_id":"6988ce49-a06b-451f-81b4-b8894e60b128","year":2021},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.409900Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:88b497c84662272637ef3c316a0648359b44afcf5bc6ed05bcb1771bf7d544e5","observation_id":"511b49ae-f443-4713-aaa2-e3ac0a441b22","resolution":{"observed_at":"2026-08-06T21:20:29.806555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.790761Z","title":"Using diffusion priors for video amodal segmen- tation, 2024","venue":null,"work_id":"b1bda2ee-924a-44bb-8e89-119e1075c1c7","year":2024},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.413499Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:d6654d5ef414fe31374faeb5abc1eb08cce0721383f63d4b14672bf2ca4ab5dc","observation_id":"7e876359-37f4-4137-9017-5655e87d082c","resolution":{"observed_at":"2026-08-06T21:20:29.795111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12049","last_updated":"2025-08-04T14:59:28Z","snapshot_observed_at":"2026-08-07T17:02:14.677646Z","submitted_at":"2025-03-15T08:47:45Z","title":"TACO: Taming Diffusion for in-the-wild Video Amodal Completion","version":2},"cited_work":{"arxiv_id":"2503.12049","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.12049","snapshot_observed_at":"2026-08-06T21:20:29.523589Z","title":"TACO: Taming Diffusion for in-the-wild Video Amodal Completion","venue":"cs.CV","work_id":"1af0d46c-ed6d-48af-8305-9ebe35a537cc","year":2025},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.417219Z"},"links":{"cited_paper":"/paper/2503.12049","citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:6eba4a9349fa6d691df09a44cd3031f53c4efc2e333970f93602be4ddf66d053","observation_id":"691d872a-7133-4e1f-80cc-103f83fb3d4e","resolution":{"observed_at":"2026-08-06T21:20:29.529577Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.778113Z","title":"Learning to see the invisible: End-to-end trainable amodal instance segmentation, 2018","venue":null,"work_id":"f8546d85-1d1b-447d-b569-a122580606cc","year":2018},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.420843Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:cead1147018a8366dc92840633788c802c961904447485f6834554b34965a925","observation_id":"f247ae06-97e1-4153-9b46-f09825a6d974","resolution":{"observed_at":"2026-08-06T21:20:29.782482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.766508Z","title":"Amodal instance segmentation with diffusion shape prior estimation, 2024","venue":null,"work_id":"5439b50d-36a6-4b39-8de9-f7d535307635","year":2024},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.424116Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:80eb05c47a6d91b795a6572629f93c2767667afdfb7a7d2948a63a583cf68ce0","observation_id":"db0b07dc-f981-4645-be60-98ad7bb7205d","resolution":{"observed_at":"2026-08-06T21:20:29.770240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.754363Z","title":"Amodal instance segmentation, 2016","venue":null,"work_id":"30831165-febb-46c4-968f-3c57a17f0af2","year":2016},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.427237Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:54a5e38eda4901afc7732d3cd02f1a8d05140885c9e21c313af48beeada1dccf","observation_id":"28924686-6636-43ec-9c72-a5de4b437f65","resolution":{"observed_at":"2026-08-06T21:20:29.758172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.743230Z","title":"Self-supervised scene de-occlusion, 2020","venue":null,"work_id":"f2d73e60-f227-45f7-9a94-fbed05ea610c","year":2020},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.430756Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:004fc72957b188657e8836a7535ecaf414088b6e3af8447bccf318836227d01a","observation_id":"cb591e8c-bed7-4f7c-abf5-c1d7cd043ff1","resolution":{"observed_at":"2026-08-06T21:20:29.746783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.731824Z","title":"Amodal instance segmentation with kins dataset","venue":null,"work_id":"33e4123d-ecfc-4bbb-b3f9-9e306c5377e4","year":2019},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.434388Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:44779aec2b49f8ef49fc8aee30c0c5c2bcaf673934a25f42da1ebe6ff0144b7d","observation_id":"da7bc35c-1f2e-47f5-a317-b2dcd1cb81e5","resolution":{"observed_at":"2026-08-06T21:20:29.735320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.720851Z","title":"Bosch, Tessa M","venue":null,"work_id":"d5e2b8d3-0c64-4479-8903-9d8bbe6980ba","year":2019},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.437745Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:e8297e266d1a4f1d0d81b154cd629a563717c6c60f7c0fd47135bfe243e74a9f","observation_id":"a1cbde60-f6a5-4ead-b760-0e9fa420cf3e","resolution":{"observed_at":"2026-08-06T21:20:29.724027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.709340Z","title":"Amodal completion via progressive mixed context diffusion, 2023","venue":null,"work_id":"995a04f9-f845-439a-942c-f8cf0fc2f3d6","year":2023},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.441291Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:0e9e88707537dff5d5c03803d179ccf25039bda5c55854f67de3c1e0bf145688","observation_id":"159e4a69-b954-4796-9e60-22f59e3bd55c","resolution":{"observed_at":"2026-08-06T21:20:29.713471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.697851Z","title":"Addressing issues with working memory in video object segmentation, 2024","venue":null,"work_id":"d26ff939-50b1-4de0-a514-4cdabc92e4aa","year":2024},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.444516Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:eb6a9c3501c06e412e9956cad51e064a56c2ce302e10ccbe5d090bcdbfa28c3a","observation_id":"9bc574ca-6755-4368-b2db-568f4d960c1d","resolution":{"observed_at":"2026-08-06T21:20:29.701488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.686871Z","title":"Narasimhan","venue":null,"work_id":"3c0e2507-1545-4fae-84bd-10f452298c38","year":2022},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.448165Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:4d8b0bf3ae5cdd455b5dc725424f6d2a26ffc1e556cb74d4adf72b35073abf01","observation_id":"2508cee0-09d9-4bb5-ba47-136b5b405fa7","resolution":{"observed_at":"2026-08-06T21:20:29.690380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.675955Z","title":"Foundation models for amodal video instance segmentation in automated driving, 2024","venue":null,"work_id":"4eeeedd4-d319-44db-9c8f-c4e5c5ae606d","year":2024},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.451745Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:c7e0ee114a199a6c575e0d9eae16021cee0c6a5181cd8bc2bf3de6bac944407a","observation_id":"d0dae70a-02f8-4152-857b-9d150f35e654","resolution":{"observed_at":"2026-08-06T21:20:29.679575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.664920Z","title":"Synwoodscape: Synthetic surround-view fisheye camera dataset for au- tonomous driving","venue":null,"work_id":"459898aa-4580-4a55-89a4-ee7573301c10","year":2022},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.454980Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:36706e77467afa36db48ef6b45f151d37feecb71411bd921a80ced67cd2929a5","observation_id":"260c8f1a-d196-46bc-a7f2-c0f23fb3c448","resolution":{"observed_at":"2026-08-06T21:20:29.668427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.654002Z","title":"R3d3: Dense 3d reconstruction of dynamic scenes from multiple cameras, 2023","venue":null,"work_id":"1cda9618-fb7c-406d-ab46-f44cc76ac6e0","year":2023},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.458350Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:78a6827868655547f6c85e7f5f3e52245fbb8b59f3c0d0838592449e510d1b00","observation_id":"3421157e-276b-4dde-9948-6a9e5be691cb","resolution":{"observed_at":"2026-08-06T21:20:29.657567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.642001Z","title":"The wildtrack multi-camera person dataset, 2017","venue":null,"work_id":"678a9f81-7930-42f3-aff0-5fb7bccc365e","year":2017},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.461472Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:e00fc09d1a53133127f145e041e7a8969aa5095b650ebb0157e2683d8eff3251","observation_id":"33118de1-2af8-4768-8fe1-a13ba6b12dab","resolution":{"observed_at":"2026-08-06T21:20:29.645775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.630665Z","title":"Mmptrack: Large-scale densely annotated multi-camera multiple people tracking benchmark, 2021","venue":null,"work_id":"aed49a62-440c-484e-b28e-15141465ee02","year":2021},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.464826Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:e340f10fa4753a30274ecffb13ec967a1c2e24880614bf35d8e71d282a502903","observation_id":"52c5b61e-219c-464a-9253-1c6c917868ee","resolution":{"observed_at":"2026-08-06T21:20:29.634374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.618940Z","title":"Multi-camera multi-object tracking: A review of current trends and future advances","venue":null,"work_id":"e6149343-849d-4246-823d-08f7bffdec3a","year":2023},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.467943Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:d07c6457fbdfc9f1b3c2dd1e11a338d0874f3483ff15f82043a661d38778e0cc","observation_id":"22116cae-1fc6-4f91-a65e-2d69b3421e61","resolution":{"observed_at":"2026-08-06T21:20:29.622827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.607709Z","title":"Ferryman and Ali Shahrokni","venue":null,"work_id":"db0f27b0-b38f-4d4e-b6b5-c18e97c19463","year":2009},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.471216Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:aec8ba2ec2b0a57049f070f7c3fbbf22a28cd548c4721653a9651fdbae1d60ed","observation_id":"14f18e15-0d0f-4e84-b0eb-b9cf63ad9597","resolution":{"observed_at":"2026-08-06T21:20:29.611262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.596748Z","title":"Multiview equivariance improves 3d correspondence understanding with minimal feature finetuning, 2025","venue":null,"work_id":"371009be-7eb2-426a-9b9c-6e887b59b5c5","year":2025},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.474776Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:db33c7bb6e84fa651603b99f7672d37a81f292c3377d58321d8fd6b65968a9a7","observation_id":"a19c364c-81e1-480c-a4e1-4c53462200dc","resolution":{"observed_at":"2026-08-06T21:20:29.600320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.584472Z","title":null,"venue":null,"work_id":"0d6783b8-dfc5-4eec-9bee-d27d67f03f1d","year":2022},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.478182Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:7ad14799eb73400a182d03ab49dc9dc2922e1fce0dff41d93277357a9981d6e4","observation_id":"1d2da6c8-06b9-46ce-bbf2-e91a8eebca66","resolution":{"observed_at":"2026-08-06T21:20:29.588352Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.572731Z","title":"Coarse-to-fine amodal segmentation with shape prior, 2023","venue":null,"work_id":"d6bd979d-8d98-41f8-b724-2efae96a8c77","year":2023},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.481730Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:06968c9f141409d4e4f7d6f4288faadebab612325714ee55379ca4e246df3550","observation_id":"183cbd46-ebe3-4036-bdde-6190fdbedd68","resolution":{"observed_at":"2026-08-06T21:20:29.576435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.561130Z","title":"Self-supervised amodal video object segmentation, 2022","venue":null,"work_id":"826dbe0e-dd62-40ae-b47a-9ab6d64767e0","year":2022},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.485230Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:829d91551252ef281b47435b4804bfbc43ded3be2c0002e42ed26d355e997210","observation_id":"023a954a-dfd3-4e2c-8506-ab46f321c52b","resolution":{"observed_at":"2026-08-06T21:20:29.564822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.549307Z","title":"Efros, Eli Shechtman, and Oliver Wang","venue":null,"work_id":"bd635dcf-b12f-467c-a417-7ce2bab01938","year":2018},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.488715Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:2f4a6a1159712e9df3e15312ecdc2787dde8d2c426606ed481a37e174f63d16f","observation_id":"eefac145-34e0-479c-86a1-a36779eaa53e","resolution":{"observed_at":"2026-08-06T21:20:29.552895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:20:29.537972Z","title":null,"venue":null,"work_id":"3b69a16b-9b1a-4fdf-94d1-bab4660f3c9f","year":2004},"citing_paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:29.491954Z"},"links":{"citing_paper":"/paper/2507.00339"},"observation_digest":"sha256:62539a2feaa69858ce70a94a7475cb39c219278433c2aface4de9d8b7018814a","observation_id":"b1435de9-3887-4c15-afbc-bed4d92bc61c","resolution":{"observed_at":"2026-08-06T21:20:29.541503Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.00339","last_updated":"2025-07-01T00:36:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:15:56.293671Z","submitted_at":"2025-07-01T00:36:56Z","title":"Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":1,"verified_fuzzy":39},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2507.00339."}