INFS5705 A1 Individual Assignment I 拍卖与图片分析
🖼️ 图片分完组还得认房间
题目给了 1,500 张房产图片,明确写着未标注。厨房、客厅、浴室是希望支持的浏览类别,文件里没有现成 answer。如果你照这几个名称建分类器,训练时就会缺少每张图对应的标签。
我的做法是先提取颜色、边缘等视觉信息,再用聚类把相似图片放在一起。聚类就是按相似度分组,结果先叫组号。若一组全是明亮画面,里面同时有厨房和客厅,给它命名为厨房就会把浏览入口做错。
轮廓系数衡量组内是否相似、组间是否分开。数值好看仍要人工核验房间名称,检查每组代表图和容易分错的边界图,再解释这种分组能怎样帮助浏览。
🏠 提前售出要单列处理
如果你把所有售出记录都编码为成功,模型就会学到一个比题目更宽的目标。学校写明,成功指拍卖期间或拍卖之后售出;提前成交的记录发生在拍卖之前,不能混入这一定义。
对应到 Outcome,S、SN、SA、SS 属于成功,PI 是未售出。SN 中的 N 表示价格未披露,房产已经卖出,不能因为价格空着就改成未售出。SP、PN 则是提前售出。
我的做法是将 SP、PN 单列并排除,在报告中交代理由和数量。这是样本处理选择,学校没有指定必须用哪行代码。先保留七种结果的原始统计,再映射目标,未知代码单独查明;否则模型再准确,也只是在回答你自己改过的问题。
📊 两模型要用同批房源比较
题目要求两种不同算法。若逻辑回归和随机森林各自随机切一次数据,碰巧一个遇到更容易预测的房源,两个测试数字就掺进了样本难度的差别。
我的做法是先固定一份测试记录,让两模型共用,再只在训练记录里学习填补缺失值、编码和缩放的规则。报告写清目标哪一类算正类;若把未售出设为正类,召回率就表示真实未售出中被预警的比例。
比较时看漏报与误报各有多少。漏报让需要关注的房源未被发现,误报增加人工检查量。两个模型总准确率接近,运营代价也能不同。参数在训练集内部比较,确定后再看测试集,避免反复拿同一批房源挑方案,却把数字当成未来表现的证明。
📋 给图片组命名的检查清单
以厨房这一浏览入口为例,我会先写清识别规则:画面出现什么设施算厨房,开放式厨客厅同时出现时怎样记录。题目举的房间名称只是业务方向,识别规则需要你说明。
- 查看每组靠近中心的代表图,记录共同出现的房间设施,避免只按颜色和光线命名。
- 再看远离中心或接近两组边界的图片,记录厨房与客厅混在一起的情况,留下核验截图。
- 另外抽出一批图片,按事先写好的规则人工标注,用它检查组名和房间用途能否对应。
- 对混杂组保留人工整理,报告写出改正记录和仍有歧义的情形,先小范围试用分类浏览。
这些记录连接了相似度与业务用途。没有人工标签核验时,结果只能描述为视觉相似组;核验发现混杂,就继续改特征或补标签,不直接给用户展示错误房间名。






