ไม่มีอะไรมาก มีคนส่ง link google trend มาให้ดูเมื่อซักอาทิตย์ก่อน เลยนึกถึงงานเก่าของแล็บขึ้นมา
google trends เป็นงาน burst keyword detection
- keyword เป็นอะไรได้หลายอย่าง ทั้ง label ที่ใส่กันใน blog, web เป็น keyword ในการ search หรือเป็น topic ของ document ต่างๆ
- burst คือ ในช่วงเวลาหนึ่งๆ มี keyword นั้นๆปรากฏขึ้นมามากเป็นพิเศษ เช่น ช่วงที่ผ่านมา keyword ประมาณ "ชูวิทย์" "ผู้ว่า กทม." ก็คงจะเพิ่มขึ้นกว่าช่วงปกติทั่วไป
มันเอาไปต่อยอดได้อีกหลายอย่าง อย่างงานเก่าของแล็บที่ผ่านมา นอกจากจะ detect burst ยังดูด้วยว่าคนพูดถึง keyword พวกนี้ในแง่ไหน ง่ายๆ ก็ positive หรือ negative (sentiment analysis) อย่างของผู้ว่ากทม. ก็อาจจะสรุปเป็นโพลได้เหมือนกัน ว่าตกลงแล้ว เขาจะเลือกใครกัน แต่เท่าที่เห็น ของ google ยังทำแค่ burst keyword ยังไม่ได้พิจารณาว่าเป็น positive หรือ negative
เราสามารถทำอะไรได้อีกเยอะกับข้อมูลใน internet เห็น google เปิดบริการฟรีเพียบยังงี้ก็เถอะ มันเป็น database ชั้นดีในการเอาไปทำอะไรต่อได้อีกเยอะ ตอนนี้ google ก็เพิ่ม data จาก text อย่างเดียว มีรูป (มันมี picasa) มี video (มันซื้อ youtube ไป) มี map .. ในอนาคตคงได้เห็นอีกหลายๆ application ที่ integrate ข้อมูลพวกนี้เข้าด้วยกันออกมาเรื่อยๆล่ะ
ป.ล. เล่าเฉยๆ ข้อมูล n-gram ของภาษาญี่ปุ่น extract จากราวๆ สองหมื่นล้าน document (สองแสนล้าน word) ... google ขาย.. ชุดละ สองหมื่นเยน.. (ถ้าให้คนเก็บจริงๆ ระดับสองหมื่นล้าน document นี่.. งบเป็นล้านนะ)
จะว่าไป..ถ้าคนไทยจะทำ corpus .. ทำแบบ google ก็ไม่เลว (เอ..หรือเราจะใช้ data เป็น blogspot ภาษาไทยดี.. เข้าท่าแฮะ แต่..กลับไปนั่งตัดคำก่อนนะ 55)
โฆณาหน่อย..
BlogWatcher: งานเก่าของแล็บที่ปิดโปรเจกต์ไปแล้ว
http://blogwatcher.pi.titech.ac.jp/
Shooti: ตอนนี้งานนี้มันย้ายไปเป็นตั้งเป็นบริษัทแล้ว มีเด็กเก่าของแล็บคนนึงไปทำต่อ
http://shooti.jp/
Wednesday, October 8, 2008
Subscribe to:
Post Comments (Atom)
No comments:
Post a Comment