ivaneeo's blog

自由的力量，自由的生活。

:: 管理

669 Posts :: 0 Stories :: 64 Comments :: 0 Trackbacks

熟悉Oracle9i的人应该都知道，Oracle9i中有2种日志，一种称为Redo Log（重做日志），另一种叫做Archive Log（归档日志），但是这两种日志在Oracle9i数据库中所起到的作用相信很难有人说清楚，下面我就结合自己对Oracle9i的认识来进行一下说明

重做日志redo log file是LGWR进程从Oracle实例中的redo log buffer写入的，是循环利用的。就是说一个redo log file(group) 写满后，才写下一个。
归档日志archive log是当数据库运行在归档模式下时，一个redo log file(group)写满后，由ARCn进程将重做日志的内容备份到归档日志文件下，然后这个redo log file(group)才能被下一次使用。

不管数据库是否是归档模式，重做日志是肯定要写的。而只有数据库在归档模式下，重做日志才会备份，形成归档日志。

归档日志结合全备份，用于数据库出现问题后的恢复使用。

posted @ 2010-10-19 15:00 ivaneeo 阅读(502) | 评论 (0) | 编辑收藏

分布式计算开源框架Hadoop介绍

作者岑文初发布于 2008年8月4日上午2时15分

社区

主题

标签

── 分布式计算开源框架Hadoop入门实践（一）

相关厂商内容

迷你书免费下载：开源选型、Struts 2、Scrum和XP、GRails

SOY Framework：Java富客户端快速开发框架

在SIP项目设计的过程中，对于它庞大的日志在开始时就考虑使用任务分解的多线程处理模式来分析统计，在我从前写的文章《Tiger Concurrent Practice --日志分析并行分解设计与实现》中有所提到。但是由于统计的内容暂时还是十分简单，所以就采用Memcache作为计数器，结合MySQL就完成了访问控制以及统计的工作。然而未来，对于海量日志分析的工作，还是需要有所准备。现在最火的技术词汇莫过于“云计算”，在Open API日益盛行的今天，互联网应用的数据将会越来越有价值，如何去分析这些数据，挖掘其内在价值，就需要分布式计算来支撑海量数据的分析工作。

回过头来看，早先那种多线程，多任务分解的日志分析设计，其实是分布式计算的一个单机版缩略，如何将这种单机的工作进行分拆，变成协同工作的集群，其实就是分布式计算框架设计所涉及的。在去年参加BEA大会的时候，BEA和VMWare合作采用虚拟机来构建集群，无非就是希望使得计算机硬件能够类似于应用程序中资源池的资源，使用者无需关心资源的分配情况，从而最大化了硬件资源的使用价值。分布式计算也是如此，具体的计算任务交由哪一台机器执行，执行后由谁来汇总，这都由分布式框架的Master来抉择，而使用者只需简单地将待分析内容提供给分布式计算系统作为输入，就可以得到分布式计算后的结果。

Hadoop是Apache开源组织的一个分布式计算开源框架，在很多大型网站上都已经得到了应用，如亚马逊、Facebook和Yahoo等等。对于我来说，最近的一个使用点就是服务集成平台的日志分析。服务集成平台的日志量将会很大，而这也正好符合了分布式计算的适用场景（日志分析和索引建立就是两大应用场景）。

当前没有正式确定使用，所以也是自己业余摸索，后续所写的相关内容，都是一个新手的学习过程，难免会有一些错误，只是希望记录下来可以分享给更多志同道合的朋友。

什么是Hadoop？

搞什么东西之前，第一步是要知道What（是什么），然后是Why（为什么），最后才是How（怎么做）。但很多开发的朋友在做了多年项目以后，都习惯是先How，然后What，最后才是Why，这样只会让自己变得浮躁，同时往往会将技术误用于不适合的场景。

Hadoop框架中最核心的设计就是：MapReduce和HDFS。MapReduce的思想是由Google的一篇论文所提及而被广为流传的，简单的一句话解释MapReduce就是“任务的分解与结果的汇总”。HDFS是Hadoop分布式文件系统（Hadoop Distributed File System）的缩写，为分布式计算存储提供了底层支持。

MapReduce从它名字上来看就大致可以看出个缘由，两个动词Map和Reduce，“Map（展开）”就是将一个任务分解成为多个任务， “Reduce”就是将分解后多任务处理的结果汇总起来，得出最后的分析结果。这不是什么新思想，其实在前面提到的多线程，多任务的设计就可以找到这种思想的影子。不论是现实社会，还是在程序设计中，一项工作往往可以被拆分成为多个任务，任务之间的关系可以分为两种：一种是不相关的任务，可以并行执行；另一种是任务之间有相互的依赖，先后顺序不能够颠倒，这类任务是无法并行处理的。回到大学时期，教授上课时让大家去分析关键路径，无非就是找最省时的任务分解执行方式。在分布式系统中，机器集群就可以看作硬件资源池，将并行的任务拆分，然后交由每一个空闲机器资源去处理，能够极大地提高计算效率，同时这种资源无关性，对于计算集群的扩展无疑提供了最好的设计保证。（其实我一直认为Hadoop的卡通图标不应该是一个小象，应该是蚂蚁，分布式计算就好比蚂蚁吃大象，廉价的机器群可以匹敌任何高性能的计算机，纵向扩展的曲线始终敌不过横向扩展的斜线）。任务分解处理以后，那就需要将处理以后的结果再汇总起来，这就是Reduce要做的工作。

图1：MapReduce结构示意图

上图就是MapReduce大致的结构图，在Map前还可能会对输入的数据有Split（分割）的过程，保证任务并行效率，在Map之后还会有Shuffle（混合）的过程，对于提高Reduce的效率以及减小数据传输的压力有很大的帮助。后面会具体提及这些部分的细节。

HDFS是分布式计算的存储基石，Hadoop的分布式文件系统和其他分布式文件系统有很多类似的特质。分布式文件系统基本的几个特点：

对于整个集群有单一的命名空间。
数据一致性。适合一次写入多次读取的模型，客户端在文件没有被成功创建之前无法看到文件存在。
文件会被分割成多个文件块，每个文件块被分配存储到数据节点上，而且根据配置会由复制文件块来保证数据的安全性。

图2：HDFS结构示意图

上图中展现了整个HDFS三个重要角色：NameNode、DataNode和Client。NameNode可以看作是分布式文件系统中的管理者，主要负责管理文件系统的命名空间、集群配置信息和存储块的复制等。NameNode会将文件系统的Meta-data存储在内存中，这些信息主要包括了文件信息、每一个文件对应的文件块的信息和每一个文件块在DataNode的信息等。DataNode是文件存储的基本单元，它将Block存储在本地文件系统中，保存了Block的Meta-data，同时周期性地将所有存在的Block信息发送给NameNode。Client就是需要获取分布式文件系统文件的应用程序。这里通过三个操作来说明他们之间的交互关系。

文件写入：

Client向NameNode发起文件写入的请求。
NameNode根据文件大小和文件块配置情况，返回给Client它所管理部分DataNode的信息。
Client将文件划分为多个Block，根据DataNode的地址信息，按顺序写入到每一个DataNode块中。

文件读取：

Client向NameNode发起文件读取的请求。
NameNode返回文件存储的DataNode的信息。
Client读取文件信息。

文件Block复制：

NameNode发现部分文件的Block不符合最小复制数或者部分DataNode失效。
通知DataNode相互复制Block。
DataNode开始直接相互复制。

最后再说一下HDFS的几个设计特点（对于框架设计值得借鉴）：

Block的放置：默认不配置。一个Block会有三份备份，一份放在NameNode指定的DataNode，另一份放在与指定DataNode非同一Rack上的DataNode，最后一份放在与指定DataNode同一Rack上的DataNode上。备份无非就是为了数据安全，考虑同一Rack的失败情况以及不同Rack之间数据拷贝性能问题就采用这种配置方式。
心跳检测DataNode的健康状况，如果发现问题就采取数据备份的方式来保证数据的安全性。
数据复制（场景为DataNode失败、需要平衡DataNode的存储利用率和需要平衡DataNode数据交互压力等情况）：这里先说一下，使用 HDFS的balancer命令，可以配置一个Threshold来平衡每一个DataNode磁盘利用率。例如设置了Threshold为10%，那么执行balancer命令的时候，首先统计所有DataNode的磁盘利用率的均值，然后判断如果某一个DataNode的磁盘利用率超过这个均值 Threshold以上，那么将会把这个DataNode的block转移到磁盘利用率低的DataNode，这对于新节点的加入来说十分有用。
数据交验：采用CRC32作数据交验。在文件Block写入的时候除了写入数据还会写入交验信息，在读取的时候需要交验后再读入。
NameNode是单点：如果失败的话，任务处理信息将会纪录在本地文件系统和远端的文件系统中。
数据管道性的写入：当客户端要写入文件到DataNode上，首先客户端读取一个Block然后写到第一个DataNode上，然后由第一个 DataNode传递到备份的DataNode上，一直到所有需要写入这个Block的NataNode都成功写入，客户端才会继续开始写下一个 Block。
安全模式：在分布式文件系统启动的时候，开始的时候会有安全模式，当分布式文件系统处于安全模式的情况下，文件系统中的内容不允许修改也不允许删除，直到安全模式结束。安全模式主要是为了系统启动的时候检查各个DataNode上数据块的有效性，同时根据策略必要的复制或者删除部分数据块。运行期通过命令也可以进入安全模式。在实践过程中，系统启动的时候去修改和删除文件也会有安全模式不允许修改的出错提示，只需要等待一会儿即可。

下面综合MapReduce和HDFS来看Hadoop的结构：

图3：Hadoop结构示意图

在Hadoop的系统中，会有一台Master，主要负责NameNode的工作以及JobTracker的工作。JobTracker的主要职责就是启动、跟踪和调度各个Slave的任务执行。还会有多台Slave，每一台Slave通常具有DataNode的功能并负责TaskTracker的工作。TaskTracker根据应用要求来结合本地数据执行Map任务以及Reduce任务。

说到这里，就要提到分布式计算最重要的一个设计点：Moving Computation is Cheaper than Moving Data。就是在分布式处理中，移动数据的代价总是高于转移计算的代价。简单来说就是分而治之的工作，需要将数据也分而存储，本地任务处理本地数据然后归总，这样才会保证分布式计算的高效性。

为什么要选择Hadoop？

说完了What，简单地说一下Why。官方网站已经给了很多的说明，这里就大致说一下其优点及使用的场景（没有不好的工具，只用不适用的工具，因此选择好场景才能够真正发挥分布式计算的作用）：

可扩展：不论是存储的可扩展还是计算的可扩展都是Hadoop的设计根本。
经济：框架可以运行在任何普通的PC上。
可靠：分布式文件系统的备份恢复机制以及MapReduce的任务监控保证了分布式处理的可靠性。
高效：分布式文件系统的高效数据交互实现以及MapReduce结合Local Data处理的模式，为高效处理海量的信息作了基础准备。

使用场景：个人觉得最适合的就是海量数据的分析，其实Google最早提出MapReduce也就是为了海量数据分析。同时HDFS最早是为了搜索引擎实现而开发的，后来才被用于分布式计算框架中。海量数据被分割于多个节点，然后由每一个节点并行计算，将得出的结果归并到输出。同时第一阶段的输出又可以作为下一阶段计算的输入，因此可以想象到一个树状结构的分布式计算图，在不同阶段都有不同产出，同时并行和串行结合的计算也可以很好地在分布式集群的资源下得以高效的处理。

posted @ 2010-10-14 19:37 ivaneeo 阅读(209) | 评论 (0) | 编辑收藏

Android示例项目

1.Android团队提供的示例项目

如果不是从学习Android SDK中提供的那些样例代码开始，可能没有更好的方法来掌握在Android这个框架上开发。由Android的核心开发团队提供了15个优秀的示例项目，包含了游戏、图像处理、时间显示、开始菜单快捷方式等。

地址：http://code.google.com/p/apps-for-android/

附件: Amazed2_1-300x200.jpg

Amazed 2 Android App

2.Remote Droid

RemoteDroid是一个Android应用，能够让用户使用自己的无线网络使用无线键盘、触摸屏操作手机。这个项目为开发者提供了如网络连接、触摸屏手指运动等很好的样例。

地址：http://code.google.com/p/remotedroid/

附件: remotedroid.jpg

Remote Droid

3.TorProxy和Shadow

TorProxy应用实现了Android手机无线电电传通讯(TOR)，和Shadow应用一起使用，可以使用手机匿名上网。从该项目源代码中，可以掌握socket连接、管理cookie等方法。

地址：http://www.cl.cam.ac.uk/research/dtg/code/svn/android-tor/

附件: img02.png

Android TorProxy

4、 Android SMSPopup

SMSPopup可以截获短信内容显示在一个泡泡形状的窗口中。从这个项目中可以掌握到如何使用内置的短信SMS接口。

地址：http://code.google.com/p/android-smspopup/

附件: screenshot1.png

Android SMSPopup

5、 Standup Timer

Standup Timer应用用于控制站立会议时间，类似秒表倒计时，可以提醒每个人的讲话时间已到，从而保证每个与会者使用时间一样。从该项目的代码中，可以学会如何使用时间函数。另外，这个项目的代码是采用视图view、模型model严格分离的设计思路。

地址：http://github.com/jwood/standup-timer

附件: stats.png

Android App – Standup Timer

6、 Foursquare

是 Foursquare.com的一个客户端应用，该应用主要分为两个模块：API(com.joelapenna.foursquare)和界面前端 (com.joelapenna.foursquared)两部分。从该项目代码中，可以学会如何同步、多线程、HTTP连接等技术。

地址：http://code.google.com/p/foursquared/

附件: screen_1.png

Foursquare for Android

7、 Pedometer

Pedometer应用用于记录你每天走路步[]数的。尽管记录不一定精准，但是从这个项目中，可以学习几个不同的技术：加速器交互、语音更新、后台运行服务等。

地址：http://code.google.com/p/pedometer/

附件: Pedometer-Android_1.png

Android pedometer

8、 OpenSudoku-android

OpenSudoku是一个简单的九宫格数独游戏。从代码中可以学习到如何在视图中显示表格数据，以及如何和一个网站交互等技术。

地址：http://code.google.com/p/opensudoku-android

附件: gameplay_sn.png

Android OpenSudoku

9、 ConnectBot

ConnectBot是Android平台的一个客户端安全壳应用。从该项目代码中，可以学习到很多Android安全方面的内容，这些是你在开发应用时经常需要考虑的安全问题。

地址：http://code.google.com/p/connectbot/

附件: connectbot-top.png

附件: connectbot-list.png

Android Connectbot

10、 WordPress的Android应用

当然在最后不能不提Wordpress的Android应用了，这是Wordpress官方开发团队提供的一个项目。从代码中可以学习到XMLRPC调用（当然还有更多的优秀内容）。

地址：http://android.svn.wordpress.org/trunk/

附件: wordpress-android-apps-develpors.jpg

Android Wordpress

源文档 <http://www.pin5i.com/showtopic-top-10-android-open-source-project.html>

posted @ 2010-10-14 19:32 ivaneeo 阅读(861) | 评论 (0) | 编辑收藏

java.io和java.nio性能简单对比

摘要: 我从java1.3开始学习java，后来主要用1.4，再后来1.5和1.6中的很多新特性，都停留在“知道”的状态，比如nio，虽然据说可以提升性能，但并没有真正深入使用和测试过，工作操作文件的情况不多，所以关注也不多，即便用到，也还是习惯性的用java.io。今天看到的这篇文章，虽然测试手段非常简单，所得结论也难免有些片面，但依然说明，在顺序访问的时候，NIO的性能相对j... 阅读全文

posted @ 2010-10-14 19:29 ivaneeo 阅读(1010) | 评论 (0) | 编辑收藏

Erlang的Unicode支持

摘要: 勤奋的 litaocheng 同学，在每日超负荷的加班工作之余，仍然刻苦学习笔耕不辍，为我们不断带来劲爆文章，这一篇《Erlang的Unicode支持》为我们介绍了 R13 的最新特性，也是最被大家期望的特性——内置的 Unicode 支持。废话少说，直接上正文。在R13A中， Erlang加入了对Unicode的支持。本文涉及到的数据类型包括：list, binary， ... 阅读全文

posted @ 2009-10-28 15:19 ivaneeo 阅读(1406) | 评论 (1) | 编辑收藏

【转】erlang 网络调优实战

摘要: 前些天给echo_server写了个非常简单的连接压力测试程序, 下载: stress_test.erl -module(stress_test). -export([start/0, tests/1]). start() -> ... 阅读全文

posted @ 2009-10-27 15:49 ivaneeo 阅读(364) | 评论 (0) | 编辑收藏

Unit Test in Erlang

摘要: Erlang被称作是“工业级的语言”，在测试领域，理应是有相当成熟度的。而，Joe老先生本人，也是崇尚“拿测试结果说话”的人（在《Programming Erlang》书中，上来就搞测试，然后再开讲的例子比比皆是）。就连 Erlang/OTP 本身的代码质量也是有严密的测试作为保障的。所以，如果在Erlang领域，你见到远比其他语言为多的测试相关工具... 阅读全文

posted @ 2009-10-27 15:48 ivaneeo 阅读(299) | 评论 (0) | 编辑收藏

Erlang: Let’s talk to java

摘要: 试了一下传说中的 JInterface ，使用 OtpErlang.jar 的整个过程其实非常简单，似乎比 JMS 的程序都简单。首先，我们要用 java 实现的原始 erlang 程序如下，没错，就是巨简单的 echo ，我们的目标是要把它用 java 来改写，不仅写服务端，也要写客户端。下载: echo_client.erl -module(echo_c... 阅读全文

posted @ 2009-10-27 15:46 ivaneeo 阅读(352) | 评论 (0) | 编辑收藏

jruby jdbc连接oracle

require 'java'

import 'oracle.jdbc.driver.OracleDriver'

module JavaLang

include_package "java.lang"

end

module JavaSql

include_package "java.sql"

end

#JavaLang::Class.forName("oracle.jdbc.driver.OracleDriver").newInstance

##发现如果直接用Class.forName话根本找不到类。看来jruby是预先导入的直接用import CLASS即可

con =

JavaSql::DriverManager.getConnection( \

"jdbc:oracle:thin:@132.228.129.104:1521:ods","ods","ods")

sql = con.createStatement()

result = sql.executeQuery("select * from dual")

while result.next

puts result.getString(1)

end

posted @ 2009-04-22 14:50 ivaneeo 阅读(1665) | 评论 (0) | 编辑收藏

guid类型的使用

oracle guid类型其实是raw(16)类型

生成: SELECT SYS_GUID ()
INTO v_guid
FROM DUAL;

posted @ 2008-12-01 15:08 ivaneeo 阅读(593) | 评论 (0) | 编辑收藏

仅列出标题

ivaneeo's blog

常用链接

留言簿(30)

我参与的团队

随笔分类

随笔档案

搜索

最新评论

阅读排行榜

评论排行榜